AIToday
大規模言語モデル動画生成AI安全性・アラインメントGIGAZINE AI掲載日時: 2026年10月6日 22:00

TavusのGriffin-Lite、48%が人間と誤認

LINEで送る
TavusのGriffin-Lite、48%が人間と誤認

3つのポイント

  1. 何が起きたか

    Tavusの実験で54人が1分間のビデオ通話で別の人間と会話していると思い込み、26人(約48%)がAI駆動のGriffin-Liteを人間と判断、平均確信度は79%。

  2. なぜ重要か

    管理された実験で約半数がAIを実在の人物と誤認したなら、こうしたシステムが人を欺く目的で悪用される恐れがある。Tavusがアクセスを制限している理由もそこにある。

  3. 注目点

    Tavusの安全策が機能するかどうかがGriffinの一般提供の時期を左右する。それまで信頼できるテスター向けの限定リサーチプレビューにとどまる。

誰に効くか合成メディアを評価する信頼・安全担当チームやビデオ通話プラットフォームは、AI参加者が自社製品で人間になりすませるかどうかを検討する必要があるかもしれない。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

TavusはGriffinをいわゆるHuman Interaction Modelとして開発した。ユーザーが話し終えるのを待ってから認識・応答生成・音声合成を行う一般的な音声AIと違い、Griffinは映像と音声を継続的に読み取り、1秒未満でうなずいたり相づちを打ったり遮ったりできる。1枚の参照画像から顔だけでなく腕、指、体の動き、椅子、影、背景まで生成し、720p・320ミリ秒単位のチャンクで出力。NVIDIA H100上で、受信音声から画面上の映像までの遅延は平均0.43秒。Tavusによれば、比較した次に速いストリーミング映像生成手法の約半分の遅延だという。

NVIDIAのVideoFDBベンチマークで、Griffin-LiteはGenerationで5点満点中3.83を記録し、人間の参照データの3.92に迫り、Gemini 2.5 + Anamの2.80を上回った。Perceptionでは3.73で、人間の4.20、MiniCPM-o 4.5の3.44という結果だった。Tavusによると、この評価はNVIDIAが2026年9月に独自に実施した。会話実験では、参加者はGriffin-Liteの自然さを5.4、信頼性を5.6、また話したいかを5.8、話を聞いてもらえている感覚を5.5と評価した一方、自然な会話の流れは最低の4.9だった。

流れのスコア4.9と人間判定48%の間の隔たりこそ、Tavusが抱える緊張関係だ。Griffinが限定リサーチプレビューの域を出られるかは、こうした結果を生んだ自然さを損なわずに、通話相手がAIであることを示す明確なサインをどれだけ構築できるかにかかっていそうだ。

よくある質問
Griffin-Liteを人間だと思った参加者は何人ですか?
54人中26人、約48%が実在の人物と判断し、平均確信度は79%でした。
Griffin-Liteがまだ一般公開されていないのはなぜですか?
Tavusは、自然で人間らしい会話がAIを人間と思い込ませる目的に使われかねないとし、安全策を検討中の間はリサーチプレビューとして信頼できるテスターに限定してアクセスを制限しています。
Griffin-LiteはTavusの従来システムとどう比較されますか?
同じ実験設定で、Tavusの従来システムPhoenix-4.5 + Sparrow-2 + Raven-1を人間と判断したのは41人中2.4%にとどまりました。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へWikimedia、OpenAIのエージェントがEtherpadへのハッキングを試みたと発表