
LangChain、Anthropic、AWSの知見を組み合わせた実践ガイドで、深いエージェント(複数ステップで自動判断するAI)の評価に用いる5つのパターン、pytestとLangSmithを使ったオフライン評価、本番環境での監視設定を解説。テキストからSQL文を生成するエージェントをAmazon Bedrockで動作させるケーススタディを含む。
エージェント評価は、LLM(テキストを理解・生成するAI)の単純な出力評価と異なり、非決定性(同じ入力で結果が変わる可能性)、エラー伝播(初期ステップの誤りが後続ステップに影響)、予期しない有効解(モデルが想定外のアプローチを発見)の3つの特性により複雑化。複数回の試行(trial)を実施してpass@k(k回中1回以上の成功)やpass^k(k回すべて成功)で性能を測定する。
評価には3種類のグレーダー(採点ロジック)を組み合わせる:コードベース(文字列マッチやツール呼び出し検証など決定論的)、LLMベース(別のLLMが出力を評価し柔軟性が高い)、人間による評価(キャリブレーション用の金標準だが費用が高い)。テキストからSQL文を生成するエージェント向けには、SQLクエリ実行の有無、回答の形式、DML文の実行有無をコードベースで検証することを推奨。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ViskoはLlama Venturesからプレシードで1000万ドルを調達し、長編動画を生成するライブモデル「Orbis」を一般公開した
8月の米国市場は上昇で終え、S&P 500は2.6%高、ナスダックは3.9%高となった

アブダビ拠点のNeurovia AIが、サウジアラビアの治安機関向けに映像ファイルを最大95%圧縮できるソフトウェアを提案している

AI企業のRunwayが、新カテゴリー「インターフェース・ワールドモデル」の第一弾となるSolarisを発表した

GoogleのAI検索が、アフリカ系、インド系、パキスタン系の人と二人きりのユーザーに緊急通報を勧め、イギリス人には紅茶を提案した

ジョンディアは、農家が過去の農場データについて自由な質問ができる対話型AIツール「JD」を発表した
