
何が起きたか
Amazon SageMaker AI MTRLでQwen3.6-27Bを微調整し、BrowseComp-PlusでnDCG@10が23.7%向上、失敗率は22.89%から0.68%に低下した。
なぜ重要か
失敗率の大幅な低下は、エージェントがターン数とトークン予算内でタスクを完了できるようになったことを示す。専用の小規模モデルで高い信頼性が得られるため、推論コストと遅延の削減につながるとみられる。
注目点
FreshStackではnDCG@10が0.4112から0.4089へ低下し、改善はベンチマーク次第である。
誰に効くか社内検索やカスタマーサポート向けのRAGシステムを運用する情報システム部門やMLエンジニアは、専門的なRL知識なしに小規模モデルを自社環境へ適応させ、検索品質と信頼性を高められる可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
従来、検索エージェントのようなマルチターン行動の学習には課題があった。教師あり微調整(SFT)は理想的なマルチターン軌道の専門家によるデモンストレーションを必要とし、収集コストが高く、自社環境向けのデータは通常存在しない。単一ターンの強化学習(RLVRなど)は一度の応答のみを評価するため、検索エージェントが多数のターンにわたって相互依存的に行う意思決定を最適化できない。
MTRLはエージェントの全マルチターン軌道を最適化し、最終的な結果のみを反映する報酬信号を使う。今回の検証では、FRAMES、BRIGHT、Enterprise RAG、ESCI、Musique、MLQAを訓練に、FreshStack、WixQA、BrowseComp-Plus、Wandsをテストに使い、nDCG@10を報酬関数とした。訓練ではmax_epochs、global_batch_size、rollout_max_concurrencyの3つのハイパーパラメータのみを変更し、RLアルゴリズムやアドバンテージ推定器、オフポリシーの陳腐化境界はデフォルトのままとした。
結果として、WixQAで+18.4%、Wandsで+6%、BrowseComp-Plusで+23.7%のnDCG@10改善が見られ、FreshStackではわずかに低下した。特にBrowseComp-Plusの失敗率が22.89%から0.68%へ下がったことは、ターン数とトークン予算内でタスクを完了する能力が向上したことを示す。ただし、この改善はベンチマークやデータセットの性質に依存する可能性があり、自社環境への適用時には評価と反復が不可欠とみられる。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AirbnbのCTO Ahmad Al-Dahleは、社内AIツール「Everest」により食料品配送は8~9ヶ月、空港送迎は約6週間で開発できたと述べ、コードの60%をAIが作成していると明かした

Booking HoldingsのCFO、Ewout Steenbergen氏がFortuneのAIQ Summitで、LLM開発に数百億ドルを投じるハイパースケーラーでもROIを把握せず仮定や仮説に頼ると述べた

GartnerはAIエージェント案件の40%超が2027年末までに中止されると予測

PwC Japanの2026年春の6カ国調査で、生成AIで「期待を大きく上回る」効果を得た日本企業は9%のみ

GitHubがGwen Davis氏のキャリア助言を公開

Googleは9月、1-million-tokenのコンテキストウィンドウを持つ新フロンティアモデル「Gemini 4 Argon」を発表した
