AIToday
AIコーディングAIビジネス・産業THE DECODER掲載日時: 2026年7月10日 1:003分で読める

OpenAIが広く使われるAIコーディング試験の30%が不正確と指摘、評価の信頼性に疑問

LINEで送る
OpenAIが広く使われるAIコーディング試験の30%が不正確と指摘、評価の信頼性に疑問

要点

  • OpenAIが広く使われるAIコーディング試験「SWE-Bench Pro」を検証し、およそ30%のタスクが不正確だと発表しました。

  • テストの誤りはAIの実際の能力を見誤らせるため、モデルの安全性評価に影響する可能性があります。

  • 同社はこの試験への支持を取り下げ、業界に対しより信頼性の高いベンチマークの開発を呼びかけています。

3つのポイント

  1. 何が起きたか

    OpenAIがプログラミングスキルを測るテスト「SWE-Bench Pro」を検証し、およそ30%のタスクが不正確だと判明しました。OpenAIの自動スクリーニングツールが286の疑わしいタスクを指摘し、その後AIエージェントと人間の研究者が検証した結果、200タスク(27.4%)が欠陥と判定されました。一方、経験を積んだソフトウェア開発者5人の検証では249タスク(34.1%)が問題ありと評価され、人間の方がより厳しい判定を下しています。

  2. なぜ重要か

    こうしたテストの結果は、モデルの安全性評価を含めOpenAIがモデルをリリースするかどうかの判断に影響します。テストに誤りが含まれていると、AIの実際の能力を誤った形で見せてしまう可能性があります。たとえば、あるテストはスペース1つの要件を指定していながら、隠れたテストケースでは2つのスペースを期待していて、正しく指示に従ったAIが失敗するという問題も発見されました。

  3. 注目点

    公開版のテスト(731タスク)ではトップモデルの正答率が8ヶ月間で23.3%から80.3%に急上昇していましたが、OpenAIはこの上昇の信頼性に疑問を呈しています。同社は今回、具体的な後継テストは推奨せず、業界に対して経験を積んだ開発者を使い、操作しづらく信頼でき、実際に意味あるベンチマークの開発を呼びかけています。

この記事についてAIに質問する →

背景と解説

SWE-Bench ProはSWE-bench Verifiedの後継として設計されましたが、OpenAIはSWE-bench Verifiedについても同様の理由で評価を取り下げていました。今回の検証では、OpenAIの自動ツールが286のタスクを疑わしいと指摘し、AI検証と人間検証の一致率は74%でしたが、人間の方がより厳しい基準を適用していることが明らかになりました。テストの不正確さが特に影響するのは、OpenAIがこうしたベンチマーク結果をモデルのリリース判断や安全性評価に組み込んでいるという点です。不正確なテストに基づいて評価判定が行われれば、実際の能力と異なるモデルがリリースされるリスクが生じます。並行して、中立的な分析企業も同じテストの問題を指摘し、代替ベンチマークへの乗り換えを進めており、業界全体でAIコーディング能力の評価基準の再構築が急務となっています。

よくある質問

SWE-Bench Proの何が問題だったのですか?
テストのタスクは実在のソフトウェアプロジェクトのコミット履歴から作られており、AIモデル向けの評価設計ではなく、特定の変更検証用に作られていました。そのため、ある要件説明ではスペース1つを指定していながら、隠れたテストケースでは2つのスペースを期待するなど、矛盾や厳格過ぎる、曖昧、浅いテストが混在していました。
このテストの精度低下はどのように気付かれたのですか?
公開版テストでトップモデルの正答率が8ヶ月間で23.3%から80.3%に急上昇しており、また分析企業Artificial Analysisが一部のモデルがプロジェクトのコミット履歴から正解をコピーしていることに気付いたため、テストの信頼性に疑問が生じました。
OpenAIは代わりのテストを推奨していますか?
いいえ、OpenAIは具体的な後継テストは推奨していません。代わりに業界全体に対し、経験を積んだ開発者を使い、操作しづらく信頼でき、実際に意味あるベンチマークの開発を呼びかけています。
LINEで送る

「AIコーディング」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AIコーディング、プロンプトから文脈へ進化ITmedia AI+ · 12時間前
  • Workday、GmailにAI統合、ERPの安全維持SiliconANGLE AI · 14時間前
  • エンジニア役割、コードからAI境界設計へVentureBeat AI · 14時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

AI光インターコネクト、ラック展開へ

DIGITIMESによると、AIシステムのスケール拡大に伴い、データセンター内の相互接続要件がチップやボードからラック、クラスター、さらにはデータセンター間リンクにまで拡大している

NEWDIGITIMES Asia2時間前

Z.aiが国産チップ10万基でGLM稼働

中国の大規模言語モデル開発企業Z.aiは、国産AIチップ約10万基を用いた大規模推論をサポートできると発表した

NEWDIGITIMES Asia2時間前

Nvidia、Rubin CPXチップを大幅再設計で復活

アナリストのミンチー・クオ氏によると、Nvidiaは大幅に再設計されたアーキテクチャを備えたAIアクセラレータ「Rubin CPX」を復活させ、生産は2027年第1四半期に開始される見込み

NEWYahoo Finance AI2時間前

パランティア株、適正価格圏に AIデータ議論が重荷

パランティア・テクノロジーズ株は長期上昇を続け、3年で11倍のリターンを達成

NEWYahoo Finance AI2時間前

Apple、OpenAIの証拠隠滅を非難

AppleはOpenAIとの法廷闘争を激化させ、新たな裁判所提出書類でOpenAIが証拠を積極的に隠滅していると主張

NEWJapan Times Tech2時間前

サムスン、HBM価格高騰でメモリ生産の70%を固定

サムスン電子は、AIインフラ向け高帯域幅メモリ(HBM)の需要が衰えない中、メモリ生産能力の最大70%を長期供給契約(LTA)で固定した

NEWDIGITIMES Asia5時間前
次の記事へBun、Claude Fableで53万行のZig→Rust移植を11日間で完了