AIToday
大規模言語モデルオープンソースAIAIビジネス・産業Fortune AI掲載日時: 2026年9月9日 22:003分で読める

阿里巴巴、実タスク完遂61.7%

LINEで送る
阿里巴巴、実タスク完遂61.7%

3つのポイント

  1. 何が起きたか

    Alibaba.comのAccioチームがオープンソースのベンチマーク「CommerceAgentBench」を公開。107件の実務eコマースタスクで成功率61.7%。

  2. なぜ重要か

    評価軸がモデルの知能から業務遂行力へとシフトする。単独で全カテゴリーを制したモデルはなく、分野ごとに首位が入れ替わり。汎用推論スコアは特定業務の成果を予測しない。

  3. 注目点

    企業がサプライヤー比較などの高成功率業務を任せ、複雑なコンプライアンスなど低成功率業務は人が担う「精密委任」を採用するか。成功率61.7%は、まだ人が監視すべき領域を示している。

誰に効くか調達、マーケティング、カスタマーサポートにAIエージェントを頼るJoshua Stancleのような小規模事業者は、どのタスクをエージェントが単独で処理できるかを測定する手段を手に入れた。eコマースの運用チームは、CommerceAgentBenchを活用して、監視を減らせる領域と人のチェックを残すべき領域を判断できる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Alibaba.comのAccioチームは、自社の運用データ(アクティブな小規模事業者ユーザー1000万人、実会話160万件、実行トレース20万件)を基にCommerceAgentBenchを構築した。AIエージェントが実際に稼働するシステム内で業務を完遂できるかを評価するためだ。このアプローチは、商業には流暢な応答よりも成果が求められるという考えに基づく。誤った商品や見逃した不正の兆候は、エージェントの応答の巧拙よりも重大だからだ。

テスト結果は、進歩と限界の両方を示している。最強モデルは61.7%のタスクを完遂し、一部の定型的業務の自動化には十分だが、人的な監視を不要にするほどではない。失敗は、不正検知、輸入総コストの計算、複数区間の輸送ルートといった、エラーがサプライチェーン全体に波及し得る領域に集中した。また、単独で全カテゴリーを制したモデルはなく、首位はタスクのカテゴリーごとに入れ替わった。これは、モデル選定が汎用ベンチマークではなく、扱う具体的な業務に基づくべきことを示唆する。

企業にとっての重要性は、成功率に応じてどの業務をエージェントに委ね、どの業務を人のチェックに残すかを判断する「精密委任」の導入にある。同種のエージェントが普及すれば、個々のミスは何千もの業務で相関し、リストの誤りや詐欺の見逃し、配送ルートの失敗といったエラーを増幅させる可能性がある。今回のようなオープンなベンチマークはバイヤーがベンダーの主張を検証する手段となるが、各業界が独自のテストを構築するには、そこで不適切な成果がもたらすコストを理解する人材が必要だ。

よくある質問
CommerceAgentBenchとは何か?
Alibaba.comのAccioチームがGitHubで公開したオープンソースのベンチマーク。実在のeコマース業務から抽出した107件のエンドツーエンドタスクで構成され、エージェントの応答内容ではなく最終成果物の正誤を評価する。
最強のAIモデルの性能は?
試験した中で最強のフロンティアモデルはタスクの61.7%を成功させた。これは実用に足る水準だが、4割近くが誤るため注意を促す数字でもある。
AIエージェントが最も失敗した領域は?
長文のサプライヤーメール内の不正支払いの検出、複数変数が絡む輸入総コストの算出、矛盾する書類を伴うアフターセールス紛争の解決、複数区間にわたる輸送ルートの処理などで苦戦した。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • GeminiがAvid Media Composerに搭載Yahoo Finance AI · 3時間前
  • AnthropicのMythos 5、CAPTCHAに苦戦Semafor Tech · 3時間前
  • Bengio氏がAIの危険性を警告、訓練過程に起因THE DECODER · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

次の記事へ男性がOpenAI提訴、ChatGPTが妄想を助長