AIToday
大規模言語モデルAIビジネス・産業THE DECODER掲載日時: 2026年8月15日 4:017分で読める

AI研究の自動化、実現遠い 実験が示唆

LINEで送る
AI研究の自動化、実現遠い 実験が示唆

要点

  • 研究者グループが新しい評価方法でAIエージェントの研究能力をテストした結果、AnthropicやOpenAIが主張する自動AI研究の実現はまだ遠いことが示されました。

  • Claude Opus 4.8を6日間、3,000ドルの予算で2つの実際の研究課題に取り組ませたところ、両論文とも却下判定を受けました。

  • AIはコード実行や実験実施などの技術的作業はこなせますが、研究の創意工夫や判断力、リソース管理に系統的な欠陥があり、与えられた予算や時間を有効活用できませんでした。

3つのポイント

  1. 何が起きたか

    研究者らがAIエージェントに未発表論文の研究課題を与え、元著者が査読者として評価する「Shadow Evaluation」という新しい手法を開発しました。Claude Opus 4.8を使用し、6日間で3,000ドルのAPI予算とGPU予算を与えた結果、両論文は査読で「強い却下」と「却下」の判定を受けました。

  2. なぜ重要か

    AnthropicやOpenAIは自動AI研究の実現を主張していますが、この研究はそうした主張に対する実証的な反証です。AIは論文執筆などのエンジニアリング作業は問題なく処理できても、研究判断や創意工夫の面で重大な欠陥を示し、査読者から「科学的でない」「恣意的な実験選択」などの指摘を受けました。

  3. 注目点

    AIエージェントは予算の半分以上を使い切らず、新しい研究方向への切り替えに失敗し、10時間以内に最も野心的な目標を放棄するなど、システムレベルの判断能力の不足を露呈しました。研究者らは検証用データ、ログ、エージェントリポジトリをオンラインで公開し、検証の透明性を確保しています。

詳細

全文を読む

複数のAI大手企業が自動研究能力を主張する中、新しい研究グループは実証的な疑問符を付けました。彼らは「Shadow Evaluation」と呼ぶ新しい評価方法を開発し、NeurIPS 2026に投稿された2つの未発表論文を対象に実験しました。第一の論文は言語モデルの性格特性をその重みを通じて操作できることを検討し、第二の論文は「TabPFN」という方法を開発しており、これは表形式予測モデルが訓練データと大きく異なる本番環境データに遭遇したときに精度が低下するのを検出します。

Claude Opus 4.8(高度な推論機能を備えたバージョン)を使用して、各エージェントに6日間、3,000ドルのAPI予算、GPU予算、仮想マシンへのフルアクセス、およびオープンウェブアクセスを提供しました。エージェントはOpenClawというオープンソースで中立的なエージェントフレームワーク(オーストリアの開発者Peter Steinberger作成)の内部で動作し、彼は2026年初頭にOpenAIに参加しました。このスキャフォルド(モデル呼び出しを調整し、エージェントが他のエージェントに仕事を委譲できるようにするソフトウェア環境)は、GPU実行中にエージェントを監視し、完了時に自動的に再開させました。

元の論文著者がカンファレンス査読者として最終論文を査読し、両論文を却下しました。1つは「強い却下」判定を受けました。査読者はデータと実験の動機付けが不十分、散文の可読性が低い、新たな貢献がないなどと批判しました。1人の査読者は推論を「『事例による証明』の誤謬」と呼び「科学的でない」とし、別の査読者は実験選択を「奇抜」と呼び、結果は明らかに「事後的な選択肢」の産物だと述べました。

エージェントログの分析は系統的な弱点を明らかにしました。エージェントは発表可能な研究が何であるかについての判断を欠いており、もっともらしい仮説を生成しましたが、小規模で手作りまたは合成されたデータセットに基づいてそれを破棄しました。また創造的問題解決にも失敗し、初期仮説が否定されると、新しい方向を追求するのではなく既存の主張を狭めました。内部AI査読では15回の改訂ラウンドで単一の「承認」も返されず、エージェントは中核的な批判に対処することはありませんでした。さらに両エージェントは最初の10時間以内に最も野心的な研究目標を放棄しました。Personas実行では、エージェントはその段階に36~48時間の予算を立てたにもかかわらず、わずか5時間の探索後に終了しました。

リソース認識も不十分でした。両実行ともAPI予算の半分以上を使い切りませんでした。1つのエージェントはデッドラインの7時間前にプロジェクトが完了したと宣言し、その直後に独自の査読者がまた別の却下を返していました。エージェントはまた指示漂流に苦しみました。長いコンテキストで明示的な指示を徐々に忘れてしまったのです。両論文はNeurIPSの長さ制限を超え、机上却下を受けていたでしょう。1つの論文はメインテキストにゼロの視覚化を含んでいましたが、人間が書いた元のバージョンには15の図がありました。Meta AIは最近「行動状態減衰」という関連現象を説明しており、エージェントは初期の要件を認識しますが、後で無関係なバグを修正する際に違反しています。

エンジニアリングは機能しましたが、研究判断はそうではありませんでした。エージェントは人間の助けなしにすべてのエンジニアリング作業を管理しました。文献検索を実行し、GPUコードをデバッグし、数百の実験とロバストネステストを完了し、LaTeXで完全な論文を作成しました。必要な人間の介入はわずか3つでした:スキャフォルドバグ修正、デッドライン延長、可読性のための書き直しリクエストです。研究者はシステムセットアップのアーティファクトがないかを確認するため、GPT-5.6 SolとOpenAIのCodexスキャフォルドで1つの実験を繰り返しました。ほぼすべての同じ失敗モードが現れました。GPT-5.6はわずか2日強で3,000ドル予算を使い切り、実験規模が不十分になりました。

研究者たちは、最前線のモデルはAI研究のエンジニアリング側を処理できるが、「数週間続く、オープンエンドのAI研究の質問を解決することはできない」と述べています。この研究は2つの論文のみを対象とし、査読者は盲検されず、自分の研究質問とAI生成作業を評価していることを知っていました。しかし結果は非常に明らかに弱かったため、これらの制限が全体的な状況を変える可能性は低いです。チームは専門家査読、ログ、およびエージェントリポジトリをオンラインで利用可能にしており、他の研究者が自分たちで判断できるようにしました。

背景と解説

本研究は、AIエージェントによる自動研究に関する業界主張の信頼性に疑問を投げかけています。6月にAnthropicは「AI Builds Itself」というタイトルで研究加速に関する内部データを発表し、開発一時停止のアイデアを浮かべていました。一方、OpenAIはGPT-5.6 Solが小規模モデルの学習後段階を支援し「数週間の時間短縮をもたらした」と主張しましたが、この貢献は81ページのシステムカードに記載されていません。

既存の自動研究の成功主張は、ほぼ完全に論文受理実績に依存していますが、受理されたことだけでは研究品質をほとんど示しません。Sakana AIの「The AI Scientist-v2」は2025年にICLRワークショップに3論文を投稿し、1論文が平均スコア6.33(閾値をわずかに上回る)で受理されましたが、査読後に引用エラーが判明して撤回されました。ワークショップの採択率は60~70%で、主要な学会の20~30%をはるかに上回ります。本研究の「Shadow Evaluation」はこの問題を回避し、評価を元の著者に返すことで、より信頼性の高い判定を実現しています。

よくある質問

この評価方法は従来の方法と何が違いますか?
従来の評価は、ウェブ上で検索可能な既知の課題か、ピアレビューに投稿された論文で測定していました。Shadow Evaluationは、元の論文著者(その課題に数ヶ月費やした人)にAIの成果を査読させることで、より厳密に研究能力を測定します。
AIエージェントはどのような環境で実験を行いましたか?
Claude Opus 4.8を、6日間で3,000ドルのAPI予算とGPU予算を与え、仮想マシンとオープンウェブへの完全アクセスを許可しました。OpenClawという開発者ツールを使い、エージェントがサブエージェントを起動したり、GPU実行を監視したりできるようにしました。
AIがエンジニアリング作業で見せた成功と研究判断での失敗の違いは何ですか?
AIは文献検索、GPUコードのデバッグ、数百の実験実施、LaTeX論文の作成などの技術的作業は人間の介入なしにこなしました。しかし、発表可能な研究の水準を判断できず、初期の仮説が否定されたときに新しい方向を追求せず、査読者の指摘に対応することができませんでした。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

次の記事へGoogle、AI生成コンテンツの透かしを非表示に対応

AIニュースの要点を毎朝1分で。

無料で登録