
MiniMax M3 MediumはDeepSearchQAでF1 73.17%を達成し、GPT-5 High Reasoningに並んだ。
You.com検索・コンテンツツールと最適化された研究スキルを活用。
タスク当たり0.532ドルで、Gemini Deep Researchなど上位エージェントには及ばないが透明性が高い。
何が起きたか
MiniMax M3 MediumがYou.comの調査ツールと組み合わせ、自動研究ループで最適化され、DeepSearchQAベンチマークで調整後73.17% F1を達成した。2026-08-21に900タスク、2,700トライアルでの全実行が完了し、結果はGitHubとHugging Faceで公開されている。
なぜ重要か
このスコアはDeepSearchQAの論文Table 4に記載されたGPT-5 High ReasoningのF1 73.24%と競争力を持つ。ただしMiniMax M3 MediumはGemini Deep Research Agent(F1 81.90%)およびGPT-5 Pro High Reasoning(F1 78.98%)といった最先端のエージェントに後れを取り、完全に不正確な率(19.01%)はこれらリーダーより高い。
注目点
評価コストは合計478.41ドル(モデル328.14ドル、You.com API 150.27ドル)で、タスク当たり平均0.532ドル。中央値レイテンシは54.3秒、95パーセンタイルは238.8秒。すべてのプロンプト、採点結果、軌跡は公開されており、検査と再現が可能。
MiniMax M3 MediumのF1 73.17%は、オープンおよび商用推論モデルの進化における意味のあるチェックポイントを示す。このスコアはDeepSearchQA論文がF1 73.24%と報告するGPT-5 High Reasoningと同等の位置付けである。しかし本文は明確に、MiniMax M3 MediumがGemini Deep Research Agent(F1 81.90%)およびGPT-5 Pro High Reasoning(F1 78.98%)といった最上位のエージェントに後れを取ることを認める。完全に不正確な率19.01%も、これらリーディングシステムと比較して改善の余地を示唆している。
評価方法論は主張の透明性を加える。論文の主張ではなく、結果は900タスク上の2,700トライアルに支えられ、すべての中間成果物(軌跡、採点、プロンプト)が検査と再現のために公開されている。このオープン成果物アプローチは、You.com MCPツールと最適化された研究スキルと組み合わせて、さらなる反復のための明確な基盤を確立する。合計478.41ドルのコストと54.3秒の中央値レイテンシは運用コンテキストを提供する。モデルは研究タスクに合理的なリソース範囲で動作するが、238.8秒の95パーセンタイルレイテンシはより難しいクエリでの変動を示す。
評価が最上位エージェントではなくGPT-5 High Reasoningと競争的と説明されることは、現実的な期待値を設定する。本文はこれをMiniMax M3 Medium系列の前進として位置付け、野心的な突破としてではなく、分野を上回る成果ではない。実務者にとって主要な信号は、公開成果物(検証と微調整を可能にする)およびドキュメント化されたコストとレイテンシのトレードオフである。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した
SK海力士はSEMICON Taiwan 2026で、ベースダイに演算機能を組み込んだカスタムHBMの構想を発表

エヌビディアの決算は注目に値する一方で退屈な内容となり、統合された世界を避ける姿勢が反映された

AnthropicがNvidia支援のクラウド事業者Lambdaと、$35bnのクラウドコンピューティング契約を結んだ

消費者庁は24日、全国の消費生活センターに寄せられる年間約90万件の相談を生成AIで分析し、詐欺の手口や事業者の経営破綻の早期サインを検出すると発表した

最高裁判所は2027年度予算案にAI関連費用として約6000万円を計上
