AIToday

Motorway と AWS、AI エージェントのエラーを8倍削減

Hacker News1日前
Motorway と AWS、AI エージェントのエラーを8倍削減

要点

Motorway と AWS は、構築時テストとstrands-agents-evals の組み合わせおよび Amazon Bedrock AgentCore Evaluations による本番監視を通じて、不正確な検索結果を8分の1から50分の1に削減するエンドツーエンドの AI エージェント評価パイプラインを構築した。3層フレームワークはツール使用率、推論、出力品質を特定のしきい値(それぞれ95%以上、85%以上、90%以上)に対して評価し、デプロイ前に従来の LLM メトリクスでは見つけられない問題を検出することで、エージェントが実世界のトランザクションを制御する際の信頼性を確保する。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    英国のオンライン自動車マーケットプレイス Motorway が AWS と提携し、Strands Agents SDK と Amazon Bedrock AgentCore を使用してAIディーラー在庫検索エージェント向けの評価パイプラインを構築した。このパイプラインにより、不正確なクエリ結果が8分の1から50分の1に低下し、問題検出時間が数時間から数分に短縮された。

  • なぜ重要か

    実取引を扱うプロダクション AI エージェント(Motorway はピーク時に約1,500人の同時ユーザーを抱える)は、標準的な言語モデルメトリクスを超えた信頼できる評価が必要である。ツール使用率(95%以上)、推論(85%以上)、出力品質(90%以上)からなる3層フレームワークは、デプロイ前に合成テストだけでは見つけられないエラーを検出し、エージェントが自律的な決定を下す際のユーザー信頼を保護する。

  • 注目点

    同梱されるリポジトリは品質ゲート付き5段階パイプラインを使用するデプロイ可能なブループリントを提供し、初期デプロイは30~45分、カスタマイズは2~3時間で完了する。評価スイートはサンプルについて Amazon Bedrock 推論料金で約5~10ドルの費用がかかり、本番環境の監視コストはサンプリングレートによって異なる。

詳細

Motorway は、毎日最大8,000人のディーラーが最大2,500台の車両に入札するオンライン自動車オークションを運営している。ディーラーは伝統的に CSV ファイルと固い フィルタを使用してリスティングを手作業で閲覧するのに何時間も費やしていた。同社は AI 駆動のディーラー在庫検索エージェントを構築してこのワークフローを置き換え、ディーラーが「ディーゼル SUV で25,000ポンド以下を見つけてくれ、近所で」や「家族向けのスポーティで自動変速のもの」といった自然言語クエリを送信できるようにした。ピーク時に約1,500人の同時ユーザーがいるため、エージェントの信頼性はミッションクリティカルである。

Motorway と AWS Prototyping and AI Customer Engineering(PACE)チームは基本的な問題を特定した:エージェント評価は LLM 評価とは異なるということである。従来の LLM メトリクスはテキスト生成品質(一貫性、事実的正確性、応答関連性)を評価するが、エージェントが正しいツールを選択したか、正しいフィルタパラメータを渡したか、またはマルチターン調整を処理したかは測定しない。エージェントは4つの特定の障害モードに直面していた:ツール選択エラーによる間違った検索結果、セマンティック検索の誤解釈による無関係な結果(例:「ガソリン、ハイブリッド、電気自動車で5年以内」は複数の制約を解析する必要がある)、会話ターン全体でのディーラー調整の喪失、および単一試行テストを信頼できなくする非決定論的出力。

エージェント自体は Strands Agents SDK と Amazon Bedrock AgentCore で実行され、大規模に AI エージェントをデプロイして運用するためのフルマネージド サービスである。89 個を超える車両属性全体の構造化フィルタリングを組み合わせた8つのツールと、LanceDB と Amazon Titan Text Embeddings V2 によって駆動されたベクトル類似性検索を公開している。エンドツーエンドのリクエストフローは、ディーラークエリを Web インターフェース経由で Amazon Bedrock AgentCore Runtime にルーティングし、Claude を推論用、Amazon Titan をエンベッディング用に使用しながらツール呼び出しをオーケストレーションしている。ツール応答は runtime を通じて最終結果を生成するためにフローバックしている。

評価パイプラインは不正確な結果を8分の1から50分の1に削減し、問題検出時間を数時間から数分に短縮した。ブループリントは2段階戦略を実装している:strands-agents-evals(Strands Agents 用のオープンソース評価ライブラリ)での構築時テストと Amazon Bedrock AgentCore Evaluations での本番監視である。コア評価は3つのレイヤーを使用する。レイヤー1(ツール使用率、95%以上のしきい値)は ToolSelectionGrader および TrajectoryOrderGrader のような決定論的コードベース グレーダーを使用して正しいツール選択およびパラメータ渡しを検証している。「£7,000~£20,000 のディーゼル車」というクエリは、型付きフィルタ(fuel_type=diesel、min_price=7000、max_price=20000)で search_vehicles を呼び出すべきであり、「低走行距離の現代的ハッチバック」は セマンティック エンベッディングと構造化フィルタを組み合わせた hybrid_search をトリガーすべきである。レイヤー2(推論、85%以上のしきい値)は LLM-as-judge スコアリング(Claude Sonnet 4.6)を使用して論理的意思決定を評価しており、HelpfulnessEvaluator と TrajectoryEvaluator 経由である。エージェントが不合理な推論を通じて正しい応答に到達する場合、条件が変わるため予測不可能に失敗する。レイヤー3(出力品質、90%以上のしきい値)は LLM-as-judge 評価を使用して応答の有用性と正確性を測定しており、OutputEvaluator と GoalSuccessRateEvaluator 経由である。ユーザーは有用で、適切にフォーマットされた応答を受け取る必要がある。

ブループリントはまた、メトリクスがしきい値を下回るとリリースをブロックする品質ゲート付き5段階デプロイパイプラインも導入している。LLM の非決定性を処理するために、run_all_layers() 関数は num_trials パラメータを受け入れ、コード生成研究から2つのメトリクスを採用している:pass@k(k 回の試行の少なくとも1回成功する可能性、1つの正しいソリューションで十分な場合に有用)および pass^k(k 回連続した試行で成功する確率、すべてのインタラクションで信頼できる動作を期待する顧客向けエージェントにとって重要)。1回の試行で成功率75%のエージェントは、3回連続した試行に成功する確率が42%(0.75の3乗)にすぎず、本番環境のデプロイでは pass^k がなぜ重要かを示している。同梱されるリポジトリはコア原則(3層評価フレームワークと pass^k メトリクス)を任意の AI エージェントに適応させるデプロイ可能なブループリントを提供している。初期デプロイは30~45分、カスタマイズは2~3時間で完了する。サンプル評価スイートの実行は Amazon Bedrock 推論料金で約5~10ドルの費用がかかり、本番環境の監視コストはサンプリングレートによって異なる。

背景と解説

従来の LLM 評価メトリクス(一貫性、事実的正確性、応答関連性)は、複数のツールを統合し自律的に行動する AI エージェントを適切に評価していない。エージェント評価は、マルチステップワークフロー全体のタスク完了の検証、正しいツール選択およびパラメータ渡し、変化する条件下での推論の一貫性、および信頼性の一貫性(非決定論的な出力により単一試行テストが信頼できないため)を検証する必要がある。Motorway の特定の課題はこのギャップを示している:「ガソリン、ハイブリッド、電気自動車で5年以内」というクエリは、エージェントが複数の制約を正しく解析する必要があり、セマンティック検索の誤解釈やマルチターン会話でのコンテキストドリフトは、実際の金銭が関係する場合にディーラーの信頼を直接損なう。

Motorway と AWS が実装したソリューションは、GenAIOps ライフサイクルにマップされた2つの評価フェーズを組み合わせている。strands-agents-evals を使用した構築時評価はデプロイ前に問題を検出し、Amazon Bedrock AgentCore Evaluations による本番監視は合成テストでは見つけられない障害を検出する。レイヤー1がツール使用率(95%以上)を検証し、レイヤー2が推論(85%以上)を評価し、レイヤー3が出力品質(90%以上)を測定する3層フレームワークは、リリースが進む前にすべてのレイヤーが合格する必要がある。LLM の非決定性を処理するための重要な洞察は pass^k メトリクス(k 回連続した試行で成功する確率)であり、これは顧客向けエージェントでは pass@k よりもはるかに重要である。1回の試行で成功率75%のエージェントは、3回連続した試行に成功する確率が42%(0.75の3乗)にすぎず、ディーラーがすべてのインタラクションで一貫した品質を期待する場合は受け入れられない。

よくある質問

評価パイプラインはエージェントの信頼性を測定するためにどのようなメトリクスを使用していますか?
パイプラインは3種類のグレーダーを使用している:レイヤー1(ツール選択およびパラメータ渡し)用のコードベース決定論的グレーダー、レイヤー2~3(推論および出力品質)用の LLM-as-judge 評価器(Claude Sonnet 4.6)、そしてキャリブレーション用の人間レビュー。非決定性の処理には pass^k(k 回連続した試行で成功する確率)を採用しており、これは顧客向けエージェントにとって重要である。1回の試行で成功率75%のエージェントは、3回連続した試行に成功する確率が42%にすぎない。
各評価レイヤーの合格/不合格しきい値は何ですか?
レイヤー1(ツール使用率)は95%以上、レイヤー2(推論)は85%以上、レイヤー3(出力品質)は90%以上のしきい値が必要である。デプロイが進むには3つのレイヤーすべてが合格する必要があり、いずれかのレイヤーで不合格となるとパイプラインがブロックされる。
評価パイプラインの実行にはどのくらいのコストがかかりますか?
サンプル評価スイートの実行は Amazon Bedrock 推論料金で約5~10ドルの費用がかかる。本番環境の監視コストはサンプリングレートに基づいて異なる。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます