
OpenAIが広く使われるAIコーディング試験「SWE-Bench Pro」を検証し、およそ30%のタスクが不正確だと発表しました。
テストの誤りはAIの実際の能力を見誤らせるため、モデルの安全性評価に影響する可能性があります。
同社はこの試験への支持を取り下げ、業界に対しより信頼性の高いベンチマークの開発を呼びかけています。
何が起きたか
OpenAIがプログラミングスキルを測るテスト「SWE-Bench Pro」を検証し、およそ30%のタスクが不正確だと判明しました。OpenAIの自動スクリーニングツールが286の疑わしいタスクを指摘し、その後AIエージェントと人間の研究者が検証した結果、200タスク(27.4%)が欠陥と判定されました。一方、経験を積んだソフトウェア開発者5人の検証では249タスク(34.1%)が問題ありと評価され、人間の方がより厳しい判定を下しています。
なぜ重要か
こうしたテストの結果は、モデルの安全性評価を含めOpenAIがモデルをリリースするかどうかの判断に影響します。テストに誤りが含まれていると、AIの実際の能力を誤った形で見せてしまう可能性があります。たとえば、あるテストはスペース1つの要件を指定していながら、隠れたテストケースでは2つのスペースを期待していて、正しく指示に従ったAIが失敗するという問題も発見されました。
注目点
公開版のテスト(731タスク)ではトップモデルの正答率が8ヶ月間で23.3%から80.3%に急上昇していましたが、OpenAIはこの上昇の信頼性に疑問を呈しています。同社は今回、具体的な後継テストは推奨せず、業界に対して経験を積んだ開発者を使い、操作しづらく信頼でき、実際に意味あるベンチマークの開発を呼びかけています。
SWE-Bench ProはSWE-bench Verifiedの後継として設計されましたが、OpenAIはSWE-bench Verifiedについても同様の理由で評価を取り下げていました。今回の検証では、OpenAIの自動ツールが286のタスクを疑わしいと指摘し、AI検証と人間検証の一致率は74%でしたが、人間の方がより厳しい基準を適用していることが明らかになりました。テストの不正確さが特に影響するのは、OpenAIがこうしたベンチマーク結果をモデルのリリース判断や安全性評価に組み込んでいるという点です。不正確なテストに基づいて評価判定が行われれば、実際の能力と異なるモデルがリリースされるリスクが生じます。並行して、中立的な分析企業も同じテストの問題を指摘し、代替ベンチマークへの乗り換えを進めており、業界全体でAIコーディング能力の評価基準の再構築が急務となっています。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
DIGITIMESによると、AIシステムのスケール拡大に伴い、データセンター内の相互接続要件がチップやボードからラック、クラスター、さらにはデータセンター間リンクにまで拡大している

中国の大規模言語モデル開発企業Z.aiは、国産AIチップ約10万基を用いた大規模推論をサポートできると発表した

アナリストのミンチー・クオ氏によると、Nvidiaは大幅に再設計されたアーキテクチャを備えたAIアクセラレータ「Rubin CPX」を復活させ、生産は2027年第1四半期に開始される見込み

パランティア・テクノロジーズ株は長期上昇を続け、3年で11倍のリターンを達成

AppleはOpenAIとの法廷闘争を激化させ、新たな裁判所提出書類でOpenAIが証拠を積極的に隠滅していると主張

サムスン電子は、AIインフラ向け高帯域幅メモリ(HBM)の需要が衰えない中、メモリ生産能力の最大70%を長期供給契約(LTA)で固定した
