
何が起きたか
スケーリング予測で実績を持つ影響力あるAI研究者Gwernが、1万3千語のエッセイを公開。LLMが人間のように汎化できない理由は「グロッキング」という能力の欠如にあると主張している。グロッキングとは、限定的なデータセット上で過度に学習させたときに起こる理解の急激な飛躍のこと。現在の慣例と逆に、フロンティア企業は数百兆パラメーターのモデルを小規模データセット上で学習させるために数百億ドルを費やすべきと提案している。
なぜ重要か
現在のLLMは人間が犯さないエラーを犯し、特定領域で人間レベルの性能を示しながらもタスク間での汎化に失敗している。Gwernが正しければ、進むべき道は単なるデータとモデルサイズのスケーリングではなく、根本的に異なる学習アプローチである。推論と自動強化学習の最近のブレークスルーが停滞している中、この方向性は機械スーパーインテリジェンスをもたらす可能性があり、極めて重要な意味を持つ。
注目点
最大の障害は技術的な問題というより組織のリスク許容度かもしれない。Gwernの手法に従う学習実行は、数百億ドルを消費しながら数週間から数ヶ月間テスト性能がまったく改善しない状態が続く。どのフロンティア企業がこの実験を試みるかが、グロッキングを人間レベルのAI推論への道として研究界がどの程度真摯に受け止めているかを示す。
こういう要約が、毎朝あなたのメールに届きます。
GwernのエッセイはAI予測における確立された信頼性に基づいている。彼はGPT-3リリース直後の2020年に「スケーリング仮説」を発表し、その後の10年間のスケーリング継続と1兆ドル規模のGPUクラスター軍拡競争を正確に予測した。これらの予測はChatGPTとAIブームの2年前に行われたもので、現在の提案は最近数年の主流のスケーリング正統性と矛盾するものの、彼の実績はこの提案に重みを与えている。
このポストが指摘する問題は実証的に本物である。LLMは特定領域で人間レベルの性能を示しながらも、広範な汎化で人間に劣ることが明らかになっている。ニューラルネットワークがいかなる汎化にも能力を持つべき理由は何か、そしてなぜ現在のLLMのレベルで止まるのかという疑問は原理上なかなか反論できない。未解決の問題は、言語と推論がグロッキングが単純な数学領域で示した種類の深い発見可能なルールを含むか、それとも人間の汎化がニューラルネットワークが複製できないアーキテクチャ上の特徴に依存しているかである。
実践上の障害は技術的というより文化的側面が大きい。ラボは数百億ドルと工学的資源をコミットする必要があるが、その実験は長期間にわたってまったく進展が見えない。2024年の純スケーリングの停滞(より大規模なGPT-4バリアントが性能低下)と、その後の推論と自動RLの成功を考えると、業界はすでに単純なスケーリングを放棄している。Gwernの根本的に異なるアプローチを採用するかは未解決の問題である。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
NVIDIAのDGX Spark(約113万円)が、価格比較サイト「価格.com」のデスクトップPC注目ランキングで2026年9月8日時点で1位を獲得した

OpenAIでCodexを率いるThibault Sottiaux氏が9月7日、同日午後6時(米東部時間)に全有料ユーザーの利用制限を一括リセットすると発表した

OpenAIのITエンジニア、シャリフ・シャミーム氏が9月6日にXで、GPT-6 AstraがCAPTCHA風ゲーム「I'm Not a Robot」の全48レベルをクリアと投稿

GoogleがGemini 3.8 Flashの一般提供を開始

オープンAIの主席科学者ヤクーブ・パチョッキ氏は日曜、主要AIラボに対し、安全基準が確立するまでモデル開発の自主的な減速を求める声明を発表した
Polaris.AIは2026年9月7日、製造業向け「図面×AI活用ソリューション」の提供開始を発表
