AIToday
大規模言語モデルAIコーディングHacker News掲載日時: 2026年7月24日 6:00

Motorway と AWS、AI エージェントのエラーを8倍削減

LINEで送る
Motorway と AWS、AI エージェントのエラーを8倍削減

3つのポイント

  1. 何が起きたか

    英国のオンライン自動車マーケットプレイス Motorway が AWS と提携し、Strands Agents SDK と Amazon Bedrock AgentCore を使用してAIディーラー在庫検索エージェント向けの評価パイプラインを構築した。このパイプラインにより、不正確なクエリ結果が8分の1から50分の1に低下し、問題検出時間が数時間から数分に短縮された。

  2. なぜ重要か

    実取引を扱うプロダクション AI エージェント(Motorway はピーク時に約1,500人の同時ユーザーを抱える)は、標準的な言語モデルメトリクスを超えた信頼できる評価が必要である。ツール使用率(95%以上)、推論(85%以上)、出力品質(90%以上)からなる3層フレームワークは、デプロイ前に合成テストだけでは見つけられないエラーを検出し、エージェントが自律的な決定を下す際のユーザー信頼を保護する。

  3. 注目点

    同梱されるリポジトリは品質ゲート付き5段階パイプラインを使用するデプロイ可能なブループリントを提供し、初期デプロイは30~45分、カスタマイズは2~3時間で完了する。評価スイートはサンプルについて Amazon Bedrock 推論料金で約5~10ドルの費用がかかり、本番環境の監視コストはサンプリングレートによって異なる。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

従来の LLM 評価メトリクス(一貫性、事実的正確性、応答関連性)は、複数のツールを統合し自律的に行動する AI エージェントを適切に評価していない。エージェント評価は、マルチステップワークフロー全体のタスク完了の検証、正しいツール選択およびパラメータ渡し、変化する条件下での推論の一貫性、および信頼性の一貫性(非決定論的な出力により単一試行テストが信頼できないため)を検証する必要がある。Motorway の特定の課題はこのギャップを示している:「ガソリン、ハイブリッド、電気自動車で5年以内」というクエリは、エージェントが複数の制約を正しく解析する必要があり、セマンティック検索の誤解釈やマルチターン会話でのコンテキストドリフトは、実際の金銭が関係する場合にディーラーの信頼を直接損なう。

Motorway と AWS が実装したソリューションは、GenAIOps ライフサイクルにマップされた2つの評価フェーズを組み合わせている。strands-agents-evals を使用した構築時評価はデプロイ前に問題を検出し、Amazon Bedrock AgentCore Evaluations による本番監視は合成テストでは見つけられない障害を検出する。レイヤー1がツール使用率(95%以上)を検証し、レイヤー2が推論(85%以上)を評価し、レイヤー3が出力品質(90%以上)を測定する3層フレームワークは、リリースが進む前にすべてのレイヤーが合格する必要がある。LLM の非決定性を処理するための重要な洞察は pass^k メトリクス(k 回連続した試行で成功する確率)であり、これは顧客向けエージェントでは pass@k よりもはるかに重要である。1回の試行で成功率75%のエージェントは、3回連続した試行に成功する確率が42%(0.75の3乗)にすぎず、ディーラーがすべてのインタラクションで一貫した品質を期待する場合は受け入れられない。

よくある質問
評価パイプラインはエージェントの信頼性を測定するためにどのようなメトリクスを使用していますか?
パイプラインは3種類のグレーダーを使用している:レイヤー1(ツール選択およびパラメータ渡し)用のコードベース決定論的グレーダー、レイヤー2~3(推論および出力品質)用の LLM-as-judge 評価器(Claude Sonnet 4.6)、そしてキャリブレーション用の人間レビュー。非決定性の処理には pass^k(k 回連続した試行で成功する確率)を採用しており、これは顧客向けエージェントにとって重要である。1回の試行で成功率75%のエージェントは、3回連続した試行に成功する確率が42%にすぎない。
各評価レイヤーの合格/不合格しきい値は何ですか?
レイヤー1(ツール使用率)は95%以上、レイヤー2(推論)は85%以上、レイヤー3(出力品質)は90%以上のしきい値が必要である。デプロイが進むには3つのレイヤーすべてが合格する必要があり、いずれかのレイヤーで不合格となるとパイプラインがブロックされる。
評価パイプラインの実行にはどのくらいのコストがかかりますか?
サンプル評価スイートの実行は Amazon Bedrock 推論料金で約5~10ドルの費用がかかる。本番環境の監視コストはサンプリングレートに基づいて異なる。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AnthropicがClaude Codeのトークン消費を解説ITmedia AI+ · 3時間前
  • SnapのSpecs Intelligence、iOSプレビュー開始The Verge AI · 3時間前
  • Intel、MLPerf v6.1でXeon推論2.4倍Top Companies AI · 7時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へ手書きAI重みが訓練モデルのスケーリング効率と一致