AIToday
大規模言語モデルオープンソースAITHE DECODER掲載日時: 2026年9月13日 22:003分で読める

AllSpark、Iris検索エージェント公開

LINEで送る
AllSpark、Iris検索エージェント公開

3つのポイント

  1. 何が起きたか

    中国の研究機関AllSparkが、Qwenモデルを基に構築した350億パラメータと3970億パラメータの検索エージェントIris-miniとIris-proを公開した。

  2. なぜ重要か

    Iris-miniは4つのベンチマークのうち3つで首位に立ち、BrowseCompではXYZ-Aquila-miniを3.4ポイント上回った。

  3. 注目点

    重みはHugging Face、コードはGitHubで公開されているが、データ構築とトレーニングのパイプラインは後日公開予定。再現性のギャップが埋まるかが注目される。

誰に効くかオープンウェイト検索エージェントを評価する企業チームは、4つの公開ベンチマークでIris-miniとIris-proを比較できるようになったが、それらを再現するために必要なトレーニングパイプラインはまだ利用できない。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

AllSparkのリリースが際立つのはベンチマークスコアだけでなく、トレーニングデータの構築方法にある。既存データセットから質問を集めるのではなく、チームはウェブページのリンク構造から多段階の質問を逆算し、最終回答以外のすべての用語を言い換えることで、単純なテキスト検索では手がかりを解決できないようにした。その後、参照モデルがツールを必要とする質問を選別し、タスクを難しく検証可能に保った。

論文は評価についても鋭い指摘をしている。チームは、一般的なベンチマークでの実行時コンテキスト管理が、報告されているシステム間の差よりも大きな違いを生むことが多いと判明した。Iris-miniでは、コンテキスト管理によりBrowseCompのスコアが最大21.2ポイント向上した。これはトークン予算が小さいからではなく、小さいモデルの方がコンテキストを速く消費し、制限に達する頻度が高いためだ。これは、報告されるモデル間のベンチマーク差が、モデル品質だけでなく足回りの違いを部分的に反映している可能性を示唆する。

検索にとどまらず、著者らは生成されたトレーニングデータと特化モデルの両方が、訓練されていないタスク——一般的なツール使用やオフィス作業を含む——の性能を向上させたと報告している。これは検索が狭い専門分野ではなく基盤的なスキルであることを示す。主な未解決の問いは、チームが計画しているデータ構築とトレーニングパイプラインの公開により、他者がこれらの結果を検証し発展させられるかどうかだ。

よくある質問
Iris-miniとIris-proのテストにはどのベンチマークが使われましたか?
チームは両モデルをBrowseComp、BrowseComp-ZH、DeepSearchQA、Humanity's Last Examでテストした。Iris-miniは82.2、84.8、86.9、52.3を記録し、Iris-proはコンテキスト管理を有効にした状態で88.6、85.1、92.9、56.4を記録した。
Irisモデルはオープンソースですか?
はい。モデルの重みはHugging Faceのコレクションで入手でき、コードはGitHubにある。リリースにはエージェントループ、ツール、コンテキスト管理戦略を含むIris Harnessも含まれる。
AllSparkのトレーニングデータは何が違うのですか?
質問はウェブのリンク構造から逆算され、最終回答以外のすべての用語が言い換えに置き換えられている。参照モデルがツールなしでは解けず、適切な情報源があれば解ける質問だけが採用されている。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AI禁止の教室、最下位にTHE DECODER · 4時間前
  • アモデイ氏AI減速訴えJapan Times Tech · 10時間前
  • Huggingface事件、AIの「語り手」は「実行者」を制御できずLessWrong AI · 10時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

GPT-6 Astra、ドローン全5タスクで人間超え

Andon LabsのVending-Benchで、GPT-6 Astraは6回の平均1万ドルを稼ぎ、Claude Fable 5.1の5,422ドルを大きく上回った

NEWTHE DECODER1時間前

Yuxiang Zhou:営業10人中7人がAI助言選択

Black Lake創業者のYuxiang Zhou氏は会話を録音するピンを営業担当者に装着させAIエージェントにデータを投入、上級営業10人中7人がAIの助言を選んだ

NEWFortune AI1時間前

DeepSeek、560万ドル学習費を過少申告か 米機関が指摘

FBI・NSA・CISAは、DeepSeekなど中国のAI企業6社が2024年以降、米国のライバル企業の有料サブスクリプションを購入して出力を学習し、「数十億ドル相当の能力」を抽出したと指摘した

NEWFortune AI1時間前

Reimagine理事、AI失業と導入が悲嘆生む

悲嘆支援団体Reimagineの共同創業者兼執行理事は、AI導入がスキル喪失や信頼の崩壊、キャリアパスの消滅をめぐる職場の悲嘆を引き起こしていると記した

NEWFortune AI1時間前

AIデータセンター建設を動かすのはチャットボットでなくAIエージェント:Wired

Molly Taft記者によると、数百の小さなプロンプトを自ら生成するAIエージェントが最先端ラボの中核となり、シリコンバレーの電力需要を押し上げている

NEWWIRED AI1時間前

AI禁止の教室、最下位に

法学教授Schrepel氏が2年間の研究で学生を3群に分けた

NEWTHE DECODER4時間前
次の記事へYuxiang Zhou:営業10人中7人がAI助言選択