
何が起きたか
OpenAIのGPT-6 Astraがulam.aiのErdosBenchでスコア3.23を記録し首位に。数学問題226問中106問を解き、27問を反証した。
なぜ重要か
ベンチマーク開発者のPrzemek Chojecki氏は「テストされた各種数学研究スキルで確実に5〜10%の向上」と評した。Astraの勝利は数学に特化した最適化なしで達成された。
注目点
論文発表後、OpenAIはより優れた内部数学モデルを訓練したとされ、RSIとAI安全性の話題が急増。Fable 5.1のスコア3.25が維持されるか注目。Astraは依然として最多の問題を解いている。
誰に効くかモデル能力を追うAI研究チームと数学者は、ベンチマークの勝利をより慎重に読む必要がある——最高スコアは狙った取り組みではなく、他の優先事項の副産物を示すかもしれない。数学研究者は、モデルが人間の検証速度を超えて証明を生み続けた場合、誰が証明を検証するのかという実務的な問いに直面する。
こういう要約が、毎朝あなたのメールに届きます。
OpenAIは最初の発表で数学の成果を前面に押し出していただけに、「An Alien Mind」でのPachocki氏の告白は注目に値する。追加の注力で数学研究能力を高められるとしながらも、再帰的自己改善と自動アラインメント研究の緊急性を理由に、あえてそうしないというのだ。このトレードオフこそ、記事が唱えるAI開発の「とがった」論——全タスクにわたる広範で漸進的な改善ではなく、特定領域での極端な強さ——の中心的な証拠である。
ケンブリッジ大学の研究者Adam Hunt氏の可視化は、広範で漸進的な改善という「主流AGI」の道と、コーディングと数学が急伸する一方で言語品質や常識、社会的推論が停滞・後退するとがった軌道を対比する。記事はPachocki氏の発言を後者の証拠として提示し、最先端のAIラボでさえ全ての方向に同時に最大の進歩を押し進めることはできないと指摘する。しかしRSI優先の背後には、いずれモデル自身がそれらの最適化を担い、数学を含む全領域でより速くスケールするという期待がある。
Astraが前身より5%優れているか50%優れているかにかかわらず、数学にとってより深い問いは残る。2026年国際数学者会議でTerence Tao氏が提起したように、AIモデルが人間の検証速度を超えて証明を生み続ければ、この分野は証明の希少から証明の過多へと移行する恐れがあり、どの結果が本当に重要かを見極めることが最重要課題となる。最難問は今なお未解決で、それが分野に猶予を与えているかもしれないが、方向性は定まったように見える——人間のような創造性なしに言語モデルが真の突破を生み出せるか疑問視する数学者がいるとしても。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した
100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する

Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した

Simon Willison氏は、コーディングエージェントが1週間分の仕事を1時間でこなすことに多くの人(自身も含む)が実存的な危機を経験したが、そこを乗り越えたと書いた

ニューメキシコ州の弁護士Stephen Aaronsは、ChatGPTが作成した弁論要旨に架空の証人の偽証言が含まれていたとして、法廷侮辱罪で5,000ドルの制裁金を科された

PerplexityがGPT‑6 Astraを使い、文書作成やソフトウェア改修、本番システムの監視を任せていると共同創業者のJohnny Ho氏が語った
