
何が起きたか
エストニア言語研究所が60個のAI言語モデルをテストし、ロシアのプロパガンダに対する耐性を測定しました。75の質問を3言語で14のプロパガンダ報道を対象に、中立的・偏った・操作的な表現で提示し、1~5段階で採点しています。Anthropic の Claude Fable 5 が 95.2 点でトップ、Claude Opus 4.7 が続きました。一方、Mistral のモデル群は下位3分の1にとどまりました。
なぜ重要か
ロシアのプロパガンダ組織は意図的にAIシステムに何百万もの虚偽記事を供給しており、OpenAI も最近ドイツの連邦選挙前に ChatGPT を使った宣伝キャンペーンを遮断しています。このベンチマーク結果は、どのモデルがそうした影響に強いかを明確に示す重要な指標となります。Mistral は欧州の有力提供業者として位置付けているだけに、結果は同社のイメージに影響する可能性があります。
注目点
ベンチマーク評価には Anthropic の Claude Opus 4.5 を使用し、ディスインフォメーション専門機関の Propastop が検証を行いました。モデルはテスト中にウェブ検索などツールへのアクセスを持たず、言語モデル自体のプロパガンダ識別・拒否能力のみを測定しています。Mistral は別の調査で 36.67% のミスインフォメーション率を記録しており、足許の課題が浮き彫りになっています。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
研究者らがAgent Seerを発表

マスターカードのマイケル・ミーバッハCEOは、AIショッピングエージェントが決済を完了できる新プロトコル「Agent Pay」と、機械同士の決済向け「Agent Pay for Machines(AP4M)」について説明

コーニングは光ファイバー生産を拡大し、エヌビディアと提携してノースカロライナ州とテキサス州に先進的な光製造施設を3か所建設

記事によると、生成AIの利用が労働時間を短縮せず、生産性も向上させないというデータが最近示された

LINEヤフーは、カレンダー連携に対応した新AIエージェント「Agent i」を含む、全社規模でAIエージェントを量産する体制を構築した

Redditに、深層学習フレームワークのPyTorchでKimi K3を一から実装していると投稿した開発者がいた
