AIToday
大規模言語モデルAI安全性・アラインメントMIT Technology Review AI掲載日時: 2026年8月26日 19:002分で読める

AIの盲点を暴くパズル、人間が勝利

LINEで送る
AIの盲点を暴くパズル、人間が勝利

要点

  • AIモデルは多くのパズルで優れるが、空間認識や視覚テストでは失敗する。

  • 2024年末には最高モデルもコネクションズの18%しか解けなかったが、2025年には改善。

  • 人間が勝る分野もまだある。

3つのポイント

  1. 何が起きたか

    AIモデルはパズル解決で急速に進歩する一方、空間認識や視覚パズルでは依然として失敗する。2024年末、最高性能のモデルでもニューヨークタイムズの「コネクションズ」パズルを解けたのはわずか18%だったが、2025年初頭にはほぼ完璧に解くものも現れた。

  2. なぜ重要か

    これらのテストは、機械と人間の認知の違いを浮き彫りにする。古典的ななぞなぞに微妙な変更を加えるとモデルがつまずくことが多く、視覚パズルは弱点のままで、進歩にもかかわらず限界があることを示している。日本国内のAI開発企業は、視覚パズルでの弱点を踏まえた製品改良を迫られる可能性がある。

  3. 注目点

    心の回転から論理グリッドまで、7つのパズルを自分で試してみよう。中には人間にも難しいものもあれば、SimpleBenchのように最高峰のモデルがつまずくなど、AIの意外な失敗を浮き彫りにするものもある。

この記事についてAIに質問する →

背景と解説

パズルは、1959年にIBMのアーサー・サミュエルがチェッカーをプレイするアルゴリズムを開発して以来、AI発展の中心にあり、現在はモデルの限界を明らかにする役割を果たしている。AIは2025年初頭までにコネクションズをほぼ完璧に解くが、大きなギャップは残る。

空間認識は主要な弱点であり、言語モデルは建築家や機械エンジニアのように3Dオブジェクトを操作できない。同様に、ARC-AGIのような視覚パズルでは、モデルは人間が単純な視覚概念を用いるのとは異なり、汎用化できないルールを使うことが多い。

スケールも影響する。Appleの研究者は、モデルがハノイの塔や川渡りのパズルをうまく解く一方、円盤が6枚以上になったり、人数が6人以上になるとつまずくことを発見した。ワシントン大学、スタンフォード大学、アレン研究所による論理グリッドパズルでも同様の苦戦が見られるが、コメンテーターは、これが独自の推論限界なのか、複雑さが増すにつれて生じる通常の誤りなのか疑問視している。

よくある質問

ARC-AGIとは何か、なぜ重要なのか?
ARC-AGIは、例から抽象的なルールを推測することを求める有名なパズルベースのベンチマークだ。グリッドが数字で与えられるとモデルは改善するが、解けないパズルもまだある。
モデルは「騎士と悪党」パズルでなぜ失敗するのか?
Googleとイリノイ大学による2024年の研究では、パズルが学習データに酷似している場合、モデルが苦戦することが示された。重要な違いを見落とし、記憶した内容で答えてしまうことがある。
MIT Technology Review AI元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へ新型MacでAI処理を端末内に移行