Tavusとは?GriffinとCVIの仕組み・企業活用

Tavusとは?GriffinとCVIの仕組み・企業活用

AI新規事業

AI新規事業のPoC・立ち上げ、何から始めるべきかご相談ください

要件定義からリリースまで、Mojiがワンチームで伴走します。

無料で相談する

Tavus(タバス)は、リアルタイムの映像・音声対話をアプリケーションへ組み込むためのプラットフォームです。2026年10月1日に発表されたGriffin(グリフィン)は、相手を見て聞きながら、音声・映像での応答や動きを同時に生成するHuman Interaction Model(HIM)として説明されています。Tavus公式:Griffinの発表

2026年10月4日時点で、Griffin-Liteは選定されたテスター向けの研究プレビューです。企業が利用できるCVIの機能・APIと、Griffinの研究発表を分けて確認する必要があります。この記事では、Griffinの仕組みと提供状況、現在のCVIの構成、企業で検証する際の判断基準を整理します。

現在のCVI(Conversational Video Interface)は、映像・音声・会話の進行・LLM・音声合成・Faceの描画を組み合わせ、アプリケーションへリアルタイムの対話体験を組み込むための枠組みです。Tavus公式:What Is CVI?

企業がTavusを検討する際は、アバターの見た目だけでなく、会話の先に社内検索・予約・CRM照会などの処理をどう接続するか、業務の完了をどう確認するかを分けて評価します。Tavusの公式ドキュメントでは、CVIをリアルタイムのマルチモーダル動画対話の枠組みとして説明し、PAL・Face・Conversationを主要な構成要素として整理しています。Tavus公式:What Is CVI?

Griffin(グリフィン)とは?見て・聞いて・応答する処理を同時に行うモデル

Griffinは、対面でのリアルタイムなやり取りを理解・生成するフルデュプレックスのvideo-to-videoモデルです。ここでのフルデュプレックスとは、AIが話している間も相手の映像・音声を受け取り続け、会話の変化に応じて発話、表情、視線、ジェスチャーを調整する方式を指します。Tavus公式:Introducing Griffin

公式の技術説明では、入力された映像・音声から「いつ、何を、どのように応答するか」を決めるContinuous Conversational Modelingと、その制御信号を音声・映像へ変えるAudio-Visual Generationの2つが連携します。知覚、会話の判断、音声・映像の生成が会話中ずっと並行して動くため、相手の発話中に相づちを打つ、割り込みに反応する、見せられた物を踏まえて応答するといった振る舞いを狙っています。Tavus公式:Griffinの技術構成とデモ

Tavusは、Griffinとの1分間のビデオ通話を用いた自社評価で、参加者の48%が人間と話したと思ったと公表しています。これは同社の研究評価として読み、企業での採用判断では、自社の日本語会話、固有名詞・数字の正確さ、業務完了率を実データに近い条件で測定します。Tavus公式:Griffin-Liteの評価

Griffin-Liteの提供状況と、現在のCVIとの関係

2026年10月4日に確認した公式発表では、Griffin-Liteは限られたテスター向けの研究プレビューで、一般顧客向けのTavusプラットフォームにはまだ提供されていません。一般提供開始日、顧客向けAPIの仕様、料金は今回確認した発表では確定情報として確認できません。導入計画では、実際に利用できるモデルと契約条件を公式に確認してください。Tavus公式:Griffinの今後の提供

同じ発表は、従来のCVIがPhoenix-4.5、Raven-1、Sparrow-2で動いていたことも説明しています。Griffinは、これまでの知覚・会話・映像生成の研究成果を一つのvideo-to-videoシステムに統合する位置付けです。企業が現在のCVIを設計する際は、以下の各レイヤーの役割と、Griffinの研究プレビューの提供条件を区別して評価します。Tavus公式:従来のCVIとGriffinの位置付け/Tavus公式:モデル一覧と役割

結論:Tavusが向くのは「会話そのもの」が業務価値になる場面

以下はMojiによる導入判断の提案です。Tavusを優先して検討しやすいのは、次の条件が重なる業務です。

  • 利用者が口頭で説明し、追加質問を受けながら進める必要がある
  • 声の調子、沈黙、画面共有、表情など、テキスト以外の情報を会話の補助として使う仮説がある
  • ヒアリング完了、予約候補の収集、研修ロールプレイの完走など、会話の到達点を定義できる
  • 社内システムへの更新・送信など、外部操作には確認・承認の条件を設けられる

反対に、短いFAQを表示するだけの業務、定型入力フォームの方が速く正確に完了する業務、映像を出すことが利用者の負担になる業務では、通常のチャット、フォーム、音声IVRなどを比較対象に含めます。Tavusは既存LLMや社内検索の代替ではなく、それらを対話型の映像インターフェースへ接続する選択肢として考えると、比較対象を整理しやすくなります。

Tavusの基本用語:CVI、PAL、Faceを混同しない

用語

実務での意味

主な設計対象

CVI

Conversational Video Interface。リアルタイムの映像・音声対話を実現する全体の枠組み。

対話パイプライン、接続方式、画面体験

PAL

Personified Application Layer。AIがどう振る舞い、何を知り、どの目標へ進むかを設定する対象。

行動、知識、Objectives、Guardrails、Tools、パイプライン

Face

PALの見た目を担う要素。ストックのFaceまたは学習したFaceを設定する。

視覚的な表現、ブランド表現、利用者への説明

Conversation

PALとFaceを利用者につなぐ、1回のライブ対話セッション。

開始・終了、時間制限、ログ、評価データ

公式ドキュメントでは、PALは行動・知識・Objectives・Guardrails・Tools・パイプラインを設定する対象、Faceは見た目、ConversationはWebRTCを通じて行うライブセッションと説明されています。旧称のpersona・replicaは後方互換のため一部APIで残っていますが、新規設計ではPAL・Faceという用語を使うのが安全です。Tavus公式:What Is a PAL?

「見て・聞いて・話す」は、どのように実現されるか

公開ドキュメントで説明される現在のCVIの標準的な流れは、Perception(認識)→ Conversational Flow(会話進行)→ STT(音声認識)→ LLM → TTS(音声合成)→ Realtime Face(顔の描画)です。Tavusでは、Raven-1が映像・音声の知覚、Sparrow-2が発話順序や割り込みの扱い、Phoenix-4.5がリアルタイムのFace描画を担います。LLMはTavus提供の低遅延モデルを使う構成に加え、既存のLLMを統合する構成も選べます。Tavus公式:CVIのパイプラインとレイヤー

要素

役割

導入時に確認すること

Raven-1

映像・音声・共有画面から、表情、視線、声の調子、周囲の状況などを認識するPerceptionレイヤー。

カメラ・画面共有を本当に使うか。認識結果を応答や評価に使う範囲を限定できているか。

Sparrow-2

利用者が話し終えたか、待つべきか、割り込めるかを扱う会話進行レイヤー。

沈黙を考える時間として尊重する業務か、素早い応答を優先する業務か。

LLM

質問、回答、要約、次に実行するToolの選択などを担う推論・生成レイヤー。

既存LLMを使うか、モデルごとの品質・速度・費用をどう評価するか。

Face / Phoenix-4.5

発話と連動してFaceの顔・表情・身振りをリアルタイムに描画する。

映像が理解・完了率を高めるという業務仮説があるか。説明表示や同意導線が十分か。

Griffin / Griffin-Lite(研究プレビュー)

映像・音声の知覚、会話判断、音声・映像生成を同時に扱うHuman Interaction Model。

研究プレビューの参加条件と、一般提供時期・API・料金の公開情報を確認する。

Mojiによる利用上の注意:Ravenが扱う表情や視線などの認識結果を、重要な個人判断の根拠として使うかどうかは、用途ごとに分けて検討します。少なくともPoCでは、認識結果を会話を補助する信号として扱う範囲、保存するデータ、担当者が確認する箇所を明文化し、想定した条件で評価してください。これはTavusの機能仕様ではなく、認識機能を業務へ組み込む際のMojiの設計提案です。

ObjectivesとTools:会話を「業務完了」へつなげる仕組み

対話AIを業務に使うなら、「自然に話せた」ではなく「必要な情報を集め、正しい条件で次の処理へ渡せた」を確認する必要があります。Tavusでは、そのための設定としてObjectivesとToolsを分けて考えられます。

Objectives:会話で達成したい状態と抽出項目を定義する

Objectivesは、会話を具体的な到達点へ導き、評価用LLMが会話履歴から完了可否や構造化変数を確認・抽出する仕組みです。たとえば「希望日時を確認する」「利用規約へ明示的に同意したことを確認する」のように、1つの目的を検証可能な文で定義します。Tavus公式:Objectives Prompting Guide

Mojiによる設計提案:Objectiveは「雑談を通じて理解を深める」のような抽象語ではなく、次の型で書きます。

[動作] [収集・確認する情報または条件] [完了条件]

架空の例:
「利用者が希望する相談日時を、日付・開始時刻・連絡方法まで確認する。復唱し、利用者が肯定した場合に完了とする。」

Tools:社内検索や業務システムを呼び出す窓口

Toolsは、会話中に外部のAPIやバックエンド処理を呼び出すための仕組みです。TavusのToolは、フロントエンドへイベントを送るapp-message方式、または設定済みのバックエンドへHTTPSリクエストを送るAPI方式で実行できます。つまり、既存の社内検索、CRM、予約システム、在庫照会APIなどを、Toolの実装先として接続できます。Tavus公式:Tool Calling

公式ガイドは、参照系Toolと更新系Toolを分け、更新系Toolについては、利用者の意図が明確で必要な項目がそろった状態で実行するよう案内しています。作成・更新・送信・提出・課金・削除のような不可逆または状態変更を伴う操作では、実行直前に明示確認を取る方針も示されています。Tavus公式:更新系Toolの確認・ログ設計。委任範囲と人の承認を設計する考え方は、AIエージェントはどこまで任せるべきかも参考になります。

既存LLM・社内検索と接続する際の判断基準

以下はMojiによる構成選定の提案です。既に社内RAGや独自LLMアプリがある企業は、回答ロジックをTavusへ全面移行する必要はありません。CVIのLLMレイヤーへ既存のモデルを統合する、またはTool経由で自社バックエンドの検索・照会処理を呼び出す、という分担が考えられます。

要件

優先する構成

確認ポイント

規程・製品情報を根拠付きで答えたい

既存RAGまたは検索APIをToolとして接続

検索結果の出典、権限、更新日、回答不能時の案内

社内CRMから状況を参照したい

参照専用Tool

本人確認、返却する項目の最小化、アクセスログ

予約・チケット起票・メール送信までしたい

確認付きの更新系Tool

復唱、明示承認、重複実行防止、失敗時の引き継ぎ

日本語の社内文書を回答根拠にしたい

既存の日本語対応検索基盤を優先して接続

ネイティブKnowledge Baseの対応範囲を事前確認

2026年10月2日に確認した公式API資料では、TavusのKnowledge Baseへ登録する文書は、現時点では英語文書のみをサポートし、英語での会話に最適化されていると案内されています。そのため、日本語の規程・FAQを根拠に回答する要件では、TavusのKnowledge Baseだけで要件を満たすと決めず、既存の日本語RAGや検索APIをToolとして接続する案を比較してください。Tavus公式:Knowledge Baseの文書対応範囲。RAGの基本設計と評価の切り分けは、RAG(検索拡張生成)とは?、社内RAGが的外れな回答を返す原因と改善方法で解説しています。

企業での活用検討例:接客・研修・事前ヒアリング

以下は導入事例や効果の保証ではなく、Mojiによる活用検討例です。採用可否は、対象者、入力品質、接続先システム、評価指標、許容できない誤りによって変わります。

用途

会話の目標

Tool・連携の候補

人へ引き継ぐ条件

接客・商品案内

用途・予算・制約を聞き、候補を比較できる状態にする

商品検索、在庫照会、予約候補の表示

例外値引き、契約判断、苦情、本人確認が必要な場合

研修ロールプレイ

決めた質問・反論への応答を練習し、振り返り材料を残す

シナリオ出し分け、採点基準の記録、研修管理システム連携

評価確定、人事判断、ハラスメント・心理的負担が生じた場合

事前ヒアリング

相談内容、希望条件、必要書類、連絡先などを不足なく集める

予約枠照会、入力フォーム表示、CRMの参照

緊急性が高い内容、重要事項の判断、情報不足・矛盾がある場合

特に事前ヒアリングでは、「映像対話を導入する」ことをゴールにせず、収集すべき項目、質問順、確認文、途中離脱時の保存範囲、有人切替を先に決めます。Tavusの公式サンプルには、Objectiveの進捗、Guardrails、Tools、Ravenの認識状態を確認できる事前問診アプリが含まれています。Tavus公式GitHub:tavus-intake

日本語・固有名詞・数字は「対応言語」ではなく業務データで評価する

TavusのCVIドキュメントは、対応TTSエンジンを通じた42以上の言語での会話を案内しています。一方で、対応言語の記載だけから、日本語の社名、製品名、住所、型番、金額、日時を業務要件どおりに扱えるとは判断できません。Tavus公式:Multilingual support

MojiによるPoC用チェックリスト:

  • 社名・部署名・人名・商品名・型番を、聞き取り、復唱、画面・CRMへの反映まで正しく扱えるか
  • 日付、時刻、金額、電話番号のような数字列を、聞き間違いなく確認できるか
  • 漢字・カタカナ・英数字が混在する語を、利用者が訂正しやすいUIになっているか
  • 利用者の沈黙、言い直し、相づち、途中割り込みで、質問順やTool実行が乱れないか
  • 検索結果がない場合に、推測して答えず、確認・有人引き継ぎへ進めるか
  • カメラをオフにした場合でも、必要な業務を完了できるか

PoCの進め方:会話品質だけでなく業務完了率と費用を測る

以下はMojiによるPoC設計の提案です。PoCは、デモの印象を確かめる場ではなく、本番化・限定継続・中止を判断するための実験です。モデル、入力データ、評価指標、許容誤差で結論は変わるため、開始前に合否ラインを決めてください。より一般的な進め方は、AI PoCを本番化する進め方も参照してください。

ステップ1:対象業務を一つに絞る

最初から接客、研修、予約、CRM更新を同時に実装しません。「初回相談の希望条件を集め、有人担当者に要約して渡す」のように、会話開始から完了までを1本の業務フローとして定義します。

ステップ2:成功・失敗・停止条件を先に書く

架空の例:PoC判定シート
対象業務:初回相談の事前ヒアリング
成功:必須項目がそろい、利用者が要約内容を確認できる
失敗:数字・固有名詞の誤り、根拠のない回答、重複登録
停止:本人確認前の情報開示、未確認での予約確定、監視不能なTool実行
有人切替:利用者が希望した場合、緊急性がある場合、入力が2回連続で確認できない場合

ステップ3:テスト会話を業務データから作る

テストには、正常な会話だけでなく、言い直し、曖昧表現、ノイズ、途中離脱、同じ内容の再質問、検索結果なし、更新操作の取消しを含めます。個人情報や機密情報を含む本番データを無造作に使うのではなく、利用許可を確認したデータまたは匿名化した検証用データを使います。

ステップ4:指標を分けて記録する

評価軸

見る指標の例

失敗時の主な確認先

情報の正確さ

必須項目の正答率、固有名詞・数字の転記正確率

STT、復唱設計、入力UI、検索データ

会話の進行

Objective完了率、質問の重複率、途中離脱率

プロンプト、Objective設計、Sparrow設定

業務結果

有人確認後の有効完了率、引き継ぎ率、再入力率

業務フロー、Tool、有人切替条件

安全性

未承認の更新件数、誤った情報開示、ログ欠損

権限、Guardrails、Toolの確認・監査設計

費用

完了セッションあたりの総費用、確認工数を含む運用費

会話分数、外部LLM、検索基盤、開発・監視・有人対応

生成AIシステムの評価では、最終回答だけでなく、検索・入力・Tool実行・人の確認を分けて観測します。評価データの作り方は、RAG評価データセットの作り方、AI全体の評価観点は、AIの評価とは?も参考になります。

費用の見方:CVIの利用料と「業務を完了させる総費用」を分ける

2026年10月2日に確認したTavusの公式価格ページでは、プランごとに利用条件、含まれる会話分数、追加利用、同時接続数などが案内されています。会話分数は、AI humanが利用者とセッションに接続してから切断するまでのライブCVI利用時間として扱われ、各会話には30秒の最低料金があり、6秒単位で丸められると説明されています。料金・プラン・提供条件は変更され得るため、導入判断時には対象プランの公式ページと契約条件を確認してください。Tavus公式:Plans and Pricing

CVIの技術パイプラインは、RavenによるPerception、SparrowによるConversational Flow、STT、LLM、TTS、PhoenixによるRealtime Faceで構成されます。Tavusの価格ページは各プランにCVIへのアクセスを含む旨を案内していますが、既存LLM、社内検索、CRM、監視、ログ保存、有人対応、実装・保守まで含めた総費用は、個別の構成として見積もる必要があります。Tavus公式:CVIパイプライン Tavus公式:Plans and Pricing

Mojiによる費用計算テンプレート
完了セッションあたりの総費用 =
(Tavus基本料+CVI従量課金+外部LLM/検索/API費+運用・監視費+有人確認工数)
÷ 有効完了セッション数

※「有効完了」は、必須項目がそろい、誤った外部操作がなく、業務担当者が受け入れたセッションとして定義します。

導入前チェックリスト

  • 映像対話が必要な理由を、「親しみやすさ」以外の業務仮説で説明できる
  • 対象業務を1つに絞り、開始・完了・有人切替の条件を書ける
  • Griffinの研究プレビューと、現在利用できるCVIの提供条件を区別できる
  • PAL、Face、Conversation、Objectives、Toolsの責任範囲を区別できる
  • 社内検索やCRMを接続する場合、参照系と更新系のToolを分けている
  • 更新系Toolに、復唱・明示承認・重複防止・監査ログを設けている
  • 日本語の固有名詞・数字・日付・型番を含む評価会話を用意している
  • Knowledge Baseの言語対応範囲と、自社文書の言語要件を照合している
  • 利用者への説明、カメラ・マイク・画面共有の利用範囲、ログの取扱いを社内方針と契約条件に照らして確認している
  • 品質、業務完了、安全性、費用の合否基準をPoC開始前に決めている

まとめ

Tavusは、PALで会話の目的・知識・制約・Toolを設定し、CVIでリアルタイム対話を構成するプラットフォームです。最新のGriffinは、映像・音声を受け取りながら応答と動きを同時に生成するHuman Interaction Modelとして発表されており、2026年10月4日時点ではGriffin-Liteの限定的な研究プレビューが案内されています。

導入の成否を分けるのは、映像の自然さだけではありません。どの業務で対面性が必要か、何を完了とするか、どの情報を正確に扱う必要があるか、どの操作を人が承認するかを先に決め、実データに近い条件でPoCを行うことが重要です。既存の社内検索・LLM・業務システムを活かしながら、Tavusを対話レイヤーとして組み込めるかを評価してください。

Contact

AI新規事業の立ち上げ、まずは無料相談から

PoCの進め方や開発体制など、貴社の状況に合わせてご提案します。

AI新規事業デザイン開発支援の詳細を見る
無料相談する