AIToday
大規模言語モデルオープンソースAITHE DECODER掲載日時: 2026年10月1日 22:00

Ataraxos、8000ドル以下でStratego最強を破る

LINEで送る
Ataraxos、8000ドル以下でStratego最強を破る

3つのポイント

  1. 何が起きたか

    AIのAtaraxosが、Strategoで最も実績のあるNiemeijerを3週間で実効勝率85%で破った。計算費用は8000ドル未満。

  2. なぜ重要か

    不完全情報ゲームにおける突破口となり、ポーカー由来の手法が苦戦した大量の隠れた情報を強化学習で扱えることを示した。

  3. 注目点

    研究者によると、より洗練された探索手法を開発しない限り計算時間を増やしても性能は向上しない。コードは公開されている。

誰に効くかこの成果は、AIが限られた予算で隠れた情報を伴う複雑な戦略的意思決定問題に取り組めることを示しており、金融、軍事計画、交渉などの分野の研究者や企業に恩恵をもたらす可能性がある。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Strategoは長くAIにとって難題であり続けてきた。両プレイヤーが40個の駒を伏せて配置し、10^33通り以上の初期配置が生まれるからだ。こうしたゲームでは着手の価値が隠れた情報に依存し、ポーカーAIの手法は隠れた情報が少ない場合にしか機能しなかった。DeepMindのDeepNashは1024台のTPUノードで2〜3か月訓練され、2025年価格で推定300万〜450万ドルを費やしたが、トップ人間を破れなかった。対照的にAtaraxosは16基のNvidia H100 GPUで1週間、さらに4基のGPUで4日間を要しただけで、費用は8000ドル未満だった。研究者はカスタムGPUシミュレータと高いサンプル効率を功績としている。

Ataraxosの成功の鍵は正則化で、これによりAIはプレーを変化させ、予測可能な戦略を避ける。さらに信念ネットワークで隠れた駒を予測する。研究者は3週間にわたりNiemeijerとAtaraxosを対戦させ、Niemeijerには1000ドルと勝利・引き分けへのボーナスを支払った。AIは実効勝率85%で勝利し、最高レベルでは前例のない結果と評された。Niemeijerは多くの対局を通じて適応できたが、AIは彼に適応できず、3度の世界王者Vincent de Boerはこれを大きなハンデと呼んだ。2025年Stratego世界選手権のエキシビションでは、Ataraxosは40局中38局を制した。

この手法は他のゲームでも機能した。Barrage Stratego、Hanabi、Dou dizhuだ。著者らは、大量の隠れた情報はもはや強化学習の障害ではなく、金融市場、軍事紛争、交渉といった戦略的意思決定問題に実用的なAIを開く道だと主張する。ただし高速なシミュレータを構築できる場合に限る。一つの限界は、探索が学習の単一ステップを模倣するだけであり、より洗練された探索手法なしに計算量を増やしても性能は向上し続けないことだ。コードは公開されており、他の者が手法を検証・拡張できるが、実世界での影響はそうした領域に適したシミュレータが存在するかどうかにかかっている。

よくある質問
AIの訓練費用はいくらだったか?
Ataraxosの計算費用は2025年価格で8000ドル未満。これはDeepMindのDeepNashの約500分の1にあたる。
AIは誰が作ったか?
Carnegie Mellon、NYU、Stanford、MITの研究者がAtaraxosを開発した。筆頭著者のSamuel SokotaがXで詳細を発表した。
他にどんなゲームを制したか?
同じ手法がBarrage Strategoで勝利し、Hanabiで記録を更新し、Dou dizhuでトップシステムを破った。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へ敵対的レビュー、重大な指摘138件中72件は1レーンのみ