
何が起きたか
中国の研究機関AllSparkが、Qwenモデルを基に構築した350億パラメータと3970億パラメータの検索エージェントIris-miniとIris-proを公開した。
なぜ重要か
Iris-miniは4つのベンチマークのうち3つで首位に立ち、BrowseCompではXYZ-Aquila-miniを3.4ポイント上回った。
注目点
重みはHugging Face、コードはGitHubで公開されているが、データ構築とトレーニングのパイプラインは後日公開予定。再現性のギャップが埋まるかが注目される。
誰に効くかオープンウェイト検索エージェントを評価する企業チームは、4つの公開ベンチマークでIris-miniとIris-proを比較できるようになったが、それらを再現するために必要なトレーニングパイプラインはまだ利用できない。
こういう要約が、毎朝あなたのメールに届きます。
AllSparkのリリースが際立つのはベンチマークスコアだけでなく、トレーニングデータの構築方法にある。既存データセットから質問を集めるのではなく、チームはウェブページのリンク構造から多段階の質問を逆算し、最終回答以外のすべての用語を言い換えることで、単純なテキスト検索では手がかりを解決できないようにした。その後、参照モデルがツールを必要とする質問を選別し、タスクを難しく検証可能に保った。
論文は評価についても鋭い指摘をしている。チームは、一般的なベンチマークでの実行時コンテキスト管理が、報告されているシステム間の差よりも大きな違いを生むことが多いと判明した。Iris-miniでは、コンテキスト管理によりBrowseCompのスコアが最大21.2ポイント向上した。これはトークン予算が小さいからではなく、小さいモデルの方がコンテキストを速く消費し、制限に達する頻度が高いためだ。これは、報告されるモデル間のベンチマーク差が、モデル品質だけでなく足回りの違いを部分的に反映している可能性を示唆する。
検索にとどまらず、著者らは生成されたトレーニングデータと特化モデルの両方が、訓練されていないタスク——一般的なツール使用やオフィス作業を含む——の性能を向上させたと報告している。これは検索が狭い専門分野ではなく基盤的なスキルであることを示す。主な未解決の問いは、チームが計画しているデータ構築とトレーニングパイプラインの公開により、他者がこれらの結果を検証し発展させられるかどうかだ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Andon LabsのVending-Benchで、GPT-6 Astraは6回の平均1万ドルを稼ぎ、Claude Fable 5.1の5,422ドルを大きく上回った

Black Lake創業者のYuxiang Zhou氏は会話を録音するピンを営業担当者に装着させAIエージェントにデータを投入、上級営業10人中7人がAIの助言を選んだ

FBI・NSA・CISAは、DeepSeekなど中国のAI企業6社が2024年以降、米国のライバル企業の有料サブスクリプションを購入して出力を学習し、「数十億ドル相当の能力」を抽出したと指摘した

悲嘆支援団体Reimagineの共同創業者兼執行理事は、AI導入がスキル喪失や信頼の崩壊、キャリアパスの消滅をめぐる職場の悲嘆を引き起こしていると記した

Molly Taft記者によると、数百の小さなプロンプトを自ら生成するAIエージェントが最先端ラボの中核となり、シリコンバレーの電力需要を押し上げている

法学教授Schrepel氏が2年間の研究で学生を3群に分けた
