AIToday
大規模言語モデルTHE DECODER掲載日時: 2026年5月31日 19:001分で読める

AI検索エージェントは既存知識を確認するだけで、実際にはウェブ調査をしていない

LINEで送る
AI検索エージェントは既存知識を確認するだけで、実際にはウェブ調査をしていない

3つのポイント

  1. 研究チームがGPT-5.4、Gemini 3.1 Pro、Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6など11のモデルを検証した結果、BrowseCompベンチマーク上の高スコアの大部分が、インターネット接続なしの記憶だけで解答可能なことが判明。MiniMax M2.5は44.5%、Kimi K2.6は62%(中国語版BrowseComp-ZH)を記憶だけで達成。

  2. 検索インターフェースを残したまま確認用ドキュメントを削除すると、全モデルの性能は記憶のみの場合より低下。MiniMax M2.5は44.5%から8.0%へ、Kimi-K2.6は25.5%から2.3%へ低下。モデルの独自推論が検索クエリの半数以上を占め、関連証拠が見つかった場合でも3分の1未満の使用率。

  3. 時系列の新情報に対応した新ベンチマーク「LiveBrowseComp」(過去90日以内の事実を含む335問の人間作成問題)では、閉鎖環境テストで全モデル2%未満の精度に低下、ツール使用時でもBrowseComp結果より約25~40ポイント低下。これまでBrowseCompで上位だったGLM 5.1はLiveBrowseCompで中位に後退、底位だったDeepSeek v3.2が首位に浮上。

この記事についてAIに質問する →

LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • CBTSがForge Agents発表、AIエージェントを数日で構築SiliconANGLE AI · 2時間前
  • アルファベットAI概要、月間25億人が利用Yahoo Finance AI · 2時間前
  • VS Codeに「ラバーダック」機能、別AIの第2意見Publickey · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へトルコの毛髪移植産業は医療観光インフラと革新的な手術技術により世界的地位を確立