
AIモデルは多くのパズルで優れるが、空間認識や視覚テストでは失敗する。
2024年末には最高モデルもコネクションズの18%しか解けなかったが、2025年には改善。
人間が勝る分野もまだある。
何が起きたか
AIモデルはパズル解決で急速に進歩する一方、空間認識や視覚パズルでは依然として失敗する。2024年末、最高性能のモデルでもニューヨークタイムズの「コネクションズ」パズルを解けたのはわずか18%だったが、2025年初頭にはほぼ完璧に解くものも現れた。
なぜ重要か
これらのテストは、機械と人間の認知の違いを浮き彫りにする。古典的ななぞなぞに微妙な変更を加えるとモデルがつまずくことが多く、視覚パズルは弱点のままで、進歩にもかかわらず限界があることを示している。日本国内のAI開発企業は、視覚パズルでの弱点を踏まえた製品改良を迫られる可能性がある。
注目点
心の回転から論理グリッドまで、7つのパズルを自分で試してみよう。中には人間にも難しいものもあれば、SimpleBenchのように最高峰のモデルがつまずくなど、AIの意外な失敗を浮き彫りにするものもある。
パズルは、1959年にIBMのアーサー・サミュエルがチェッカーをプレイするアルゴリズムを開発して以来、AI発展の中心にあり、現在はモデルの限界を明らかにする役割を果たしている。AIは2025年初頭までにコネクションズをほぼ完璧に解くが、大きなギャップは残る。
空間認識は主要な弱点であり、言語モデルは建築家や機械エンジニアのように3Dオブジェクトを操作できない。同様に、ARC-AGIのような視覚パズルでは、モデルは人間が単純な視覚概念を用いるのとは異なり、汎用化できないルールを使うことが多い。
スケールも影響する。Appleの研究者は、モデルがハノイの塔や川渡りのパズルをうまく解く一方、円盤が6枚以上になったり、人数が6人以上になるとつまずくことを発見した。ワシントン大学、スタンフォード大学、アレン研究所による論理グリッドパズルでも同様の苦戦が見られるが、コメンテーターは、これが独自の推論限界なのか、複雑さが増すにつれて生じる通常の誤りなのか疑問視している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ビル・ゲイツ氏が新たなエッセーを発表し、世界はAIの重大リスクに備えていないと警告した

ビル・ゲイツ氏が新たなエッセーを発表し、インタビューでAIの能力が生物テロ、サイバー攻撃、雇用破壊、心理的依存、そして制御不能の兆候など複数の危険な敷居を越えたと警告した

アップルは8月25日に新型Mac miniとMac Studioの予約受付を開始し、9月22日に出荷を始める

Confluentの調査「Data Streaming Report 2026」で、生成AIを「本番運用している」と答えた日本の企業は17%にとどまった

ビル・ゲイツ氏はSemaforのインタビューで、AIと雇用に関する従来の楽観論を覆し、AIの進展スピードと政府の対応不足により経済的破綻と「はるかに少ない」雇用をもたらすと警告した

Cursorの登壇者が、自身がコードに触れずに月間数百件のPRを生み出すシステム構築の実践経験を共有
