AIToday
大規模言語モデルHacker News掲載日時: 2026年8月23日 10:004分で読める

MiniMax M3 MediumがDeepSearchQAで73.17% F1達成、GPT-5 Highに並ぶ

LINEで送る
MiniMax M3 MediumがDeepSearchQAで73.17% F1達成、GPT-5 Highに並ぶ

要点

  • MiniMax M3 MediumはDeepSearchQAでF1 73.17%を達成し、GPT-5 High Reasoningに並んだ。

  • You.com検索・コンテンツツールと最適化された研究スキルを活用。

  • タスク当たり0.532ドルで、Gemini Deep Researchなど上位エージェントには及ばないが透明性が高い。

3つのポイント

  1. 何が起きたか

    MiniMax M3 MediumがYou.comの調査ツールと組み合わせ、自動研究ループで最適化され、DeepSearchQAベンチマークで調整後73.17% F1を達成した。2026-08-21に900タスク、2,700トライアルでの全実行が完了し、結果はGitHubとHugging Faceで公開されている。

  2. なぜ重要か

    このスコアはDeepSearchQAの論文Table 4に記載されたGPT-5 High ReasoningのF1 73.24%と競争力を持つ。ただしMiniMax M3 MediumはGemini Deep Research Agent(F1 81.90%)およびGPT-5 Pro High Reasoning(F1 78.98%)といった最先端のエージェントに後れを取り、完全に不正確な率(19.01%)はこれらリーダーより高い。

  3. 注目点

    評価コストは合計478.41ドル(モデル328.14ドル、You.com API 150.27ドル)で、タスク当たり平均0.532ドル。中央値レイテンシは54.3秒、95パーセンタイルは238.8秒。すべてのプロンプト、採点結果、軌跡は公開されており、検査と再現が可能。

この記事についてAIに質問する →

背景と解説

MiniMax M3 MediumのF1 73.17%は、オープンおよび商用推論モデルの進化における意味のあるチェックポイントを示す。このスコアはDeepSearchQA論文がF1 73.24%と報告するGPT-5 High Reasoningと同等の位置付けである。しかし本文は明確に、MiniMax M3 MediumがGemini Deep Research Agent(F1 81.90%)およびGPT-5 Pro High Reasoning(F1 78.98%)といった最上位のエージェントに後れを取ることを認める。完全に不正確な率19.01%も、これらリーディングシステムと比較して改善の余地を示唆している。

評価方法論は主張の透明性を加える。論文の主張ではなく、結果は900タスク上の2,700トライアルに支えられ、すべての中間成果物(軌跡、採点、プロンプト)が検査と再現のために公開されている。このオープン成果物アプローチは、You.com MCPツールと最適化された研究スキルと組み合わせて、さらなる反復のための明確な基盤を確立する。合計478.41ドルのコストと54.3秒の中央値レイテンシは運用コンテキストを提供する。モデルは研究タスクに合理的なリソース範囲で動作するが、238.8秒の95パーセンタイルレイテンシはより難しいクエリでの変動を示す。

評価が最上位エージェントではなくGPT-5 High Reasoningと競争的と説明されることは、現実的な期待値を設定する。本文はこれをMiniMax M3 Medium系列の前進として位置付け、野心的な突破としてではなく、分野を上回る成果ではない。実務者にとって主要な信号は、公開成果物(検証と微調整を可能にする)およびドキュメント化されたコストとレイテンシのトレードオフである。

よくある質問

MiniMax M3 Mediumのスコアはほかのモデルと比較してどうか
MiniMax M3 MediumはF1 73.17%を達成し、GPT-5 High Reasoning(F1 73.24%)に並んだ。ただしDeepSearchQA論文Table 4によると、Gemini Deep Research Agent(F1 81.90%)およびGPT-5 Pro High Reasoning(F1 78.98%)には及ばない。
どのツールとインフラが使用されたか
評価はYou.com MCPのyou-searchおよびyou-contentsツールをMiniMax対応の研究スキルと組み合わせ、自動研究ループで最適化した。ジャッジモデルはdeepseek/deepseek-v4-flash-0731で、フォールバックはqwen/qwen3.6-flash。
結果は再現可能か
可能。prompts.jsonl、results.jsonl、trajectories.jsonl、graded.jsonl、summary.jsonをすべて含む成果物がGitHubとHugging Faceで公開されている。リポジトリには全評価を再現するコマンドと環境変数が含まれている。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • DataAgentが1000万ドル調達、Kubernetes障害を自動修復SiliconANGLE AI · 2時間前
  • SK海力士定制HBM推升推理性能5.15倍DIGITIMES Asia · 2時間前
  • エヌビディア決算、統合回避戦略で退屈な内容にStratechery (Ben Thompson) · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へエンタープライズAIエージェント、自由より制限で成功