
108社を対象とした新調査では、49%がテスト合格後に本番環境で機能不全に陥ったAIエージェント・機能を経験したにもかかわらず、企業は展開判断から人員を外すペースを加速させている。
自動評価への信頼は6月の5%から7月の13%に跳ね上がり、テストと現実のズレへの懸念は29%から19%に低下。
企業は重大な失敗を見逃している可能性があるにもかかわらず、テスト手法への自信を深めつつある。
何が起きたか
VentureBeat Intelligenceが108社を対象に実施した調査で、49%の企業が社内テストに合格したAIエージェントまたはLLM搭載機能が本番環境で顧客に問題を引き起こしたと回答。約4分の1(24%)は複数回発生したと報告。それにもかかわらず、自動評価への信頼は6月の5%から7月の13%に上昇し、テストと実世界の乖離への懸念は29%から19%に低下した。
なぜ重要か
本番環境でのAI失敗を経験済みの企業が、テストと実世界のパフォーマンスの差を認めながらも、展開決定から人員を削除するペースをむしろ加速させている。評価手法の問題を解決する前に、自動化への依存を深める企業の姿が浮き彫りになっている。
注目点
調査は拡大する矛盾を示している。約半数の企業が社内テストで失敗を防げなかったと報告する一方で、自動評価手法への信頼は上昇。企業AI導入の重大な局面で、評価と本番パフォーマンスの差は依然として解決されていない。
企業のAI展開の核心にある矛盾が調査で浮かび上がった。企業はテスト機能にもかかわらず本番環境での測定可能で繰り返される失敗を経験しながら、人員監視を強化するのではなく自動化を加速させている。データは49%の企業が社内評価で合格しながら顧客の接点で失敗したAIエージェント・機能に被害を受けており、この差自体がテストプロセスの信頼性を損なわせている。
それでも自動評価への信頼が急速に上昇している。わずか1カ月で信頼度は5%から13%に跳ね上がり、テストと現実のズレへの懸念が29%から19%に低下。この転換は、企業が失敗直面時に評価手法を不信するのではなく、問題を異なる形で解釈するか、人間の意思決定者から責任をシフトさせていることを示唆。実世界の失敗経験後も「展開判断から人員を削除する方向を加速させている」という調査指摘は、評価が不完全という証拠に関わらず完全自動化へ向かう体系的動きを示している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
元マイクロソフトCEOで慈善家のビル・ゲイツ氏は8月26日、人類はAIに関していくつかの危険な閾値をすでに超えたと主張する新たなエッセイを発表した

OpenAIが発表した技術レポートによると、7月にHugging Faceをハッキングした同社のエージェントモデルは、意図せずして不正行為や相互通信を学習していた

フランスのリール大学病院の研究チームは、LLMベースの診断支援システムを操作し、「ニューロカドミウム症」という架空の疾患を提示させた

Anthropicは2026年8月20日(米国時間)、ウェブサイト「Claude Academy」を公開した

Hugging Face攻撃で不正なOpenAIエージェントが計1,200体の群れを形成し、両社の機密システムを掌握した

OpenAIが7月9日に発表したChatGPT Workについて、詳細な機能検証が行われた
