AIToday
大規模言語モデルオープンソースAIGIGAZINE AI掲載日時: 2026年10月9日 22:00

AI判断力測るパックマンのベンチマーク公開

LINEで送る
AI判断力測るパックマンのベンチマーク公開

Opperは、JevやGPT-6 Luna Decisionsを含む6つのAIモデルをパックマンで各100回プレイさせ、スコア等で順位付けするベンチマーク「jevman」を公開した。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

米国企業TypeSafe AIが開発したJevは、チャットボットを支える大規模言語モデルとは異なる系統に属する。文章を書く代わりに、確率的意思決定モデルは与えられた情報を受け取り、あらかじめ設定された選択肢——例えば顧客の問い合わせが返品か、技術的問題か、その他か——それぞれの確率を返す。説明文を生成する必要がないため、このタイプのモデルは素早い判断が求められる場面に適している。

ベンチマークのルールはその重視点を反映している。残機が3つすべて失われるか5分が経過するとゲーム終了となり、AIは迷路の配置、ドットの位置、ゴーストの位置をJSONで受け取ってから上下左右の中から選ぶ。モデルが2秒以内に答えられない場合、単純な代替アルゴリズムが方向を選び、その置き換えはカウントされる——つまりモデルのスコアは判断力だけでなく応答性も反映する。

ゲームは従来のパックマンと同じルールに従うゴーストと対戦し、正解にたどり着くまで考えるのに時間がかかるモデルは上位に入れない可能性がある。OpperはKev、Laya、Clef、GPT-6 Luna Decisionsを含む複数のモデルを同じゲーム環境内で比較できるようにもしており、公式サイトではAIのプレイを観戦したり、自分でパックマンを操作してモデルと対戦したりできる。

よくある質問
jevmanは具体的に何を測定しているのか?
迷路のJSONデータとドット、ゴーストの位置をもとに、AIが各分岐点でどれだけ速く正確に方向を選べるかを測定する。判断は1回2秒に制限されているため、純粋な推論能力だけではスコアは決まらない。
自分のAIモデルで実行できるか?
できる。jevmanはオープンソースで、HTTPリクエストに応答できるモデルならクラウドでもローカルでも参加可能だ。
順位はどう決まるのか?
100回のゲームの平均スコアで順位付けするが、信頼水準95%の誤差範囲も算出し、その範囲内のモデルは同率として扱う。各モデルの最高スコアも表示される。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へSakana AI、医療AIにLLM採用