
何が起きたか
AWSは2026年8月25日、AIコーディングエージェント「Kiro」のシステムプロンプト評価の仕組みを明らかにした。実運用の会話をLLMジャッジで分析し、15の観点でスコアリングする。
なぜ重要か
システムプロンプトは、モデル・ツール・コードベース・タスク・ユーザーの組み合わせで挙動が変わるため、事前のテストでは全パターンを検証できない。ベンチマークだけでは不十分とみられる。
注目点
Kiro CLIでは無害な不満が5%減、推論ミス32%減、タスク未完了10.6%減と改善した。一方、新モデル更新で推論ミスの改善は4%にとどまり、陳腐化への継続的なチューニングが焦点となる。
誰に効くか自社でAIエージェントを運用する情報システム部門や開発チームは、モデル更新のたびにシステムプロンプトを見直す必要がある。Kiroの評価手法は、プロンプト変更の効果測定や陳腐化防止の参考になる。
こういう要約が、毎朝あなたのメールに届きます。
AIコーディングエージェントのシステムプロンプトは、モデル、ツール、コードベース、タスク、ユーザーの組み合わせによって挙動が変わる。そのため、事前に用意したテストスイートでは全てのパターンを検証できないという根本的な課題がある。AWSはKiroにおいて、実運用の会話データとLLMジャッジを組み合わせた評価フレームワークを導入し、この課題に対処している。具体的には、タスクの達成度や推論の正確さなど15の観点でスコアリングし、A/B比較で変更の効果を検証する仕組みだ。過去の検証では、27個の変更を一括でスクリーニングし、内容が悪化したものを即座に排除したという。また、推論の度合いを設定変更する仕組みも採用され、過度に高い設定にすることでデバッグなどのコードインタスクにおいて誤った改善を招くことを抑止している。
評価の結果、Kiro CLIでは無害な不満が5%減、推論ミスが32%減、タスク未完了が10.6%減となった。Kiro IDEでは推論ミスが20%減、タスク未完了が21%減、実行されていないアプローチが36%減、スタイルの不一致が54%減といった改善が見られた。しかし、利用可能な新モデルへの更新やプロンプト変更による推論ミスの改善は4%にとどまった。これはプロンプトの変更効果が限定的だったわけではなく、新モデル自体が最初から高い推論力を持っていたため、プロンプトで改善できる余地が少なかったことを意味する。さらに、新モデルは指示をより文字通りに解釈するようになり、古いモデル向けに書かれた過剰な制約がボトルネックになるケースも確認された。このためAWSでは、モデル更新と1対1で差分を当てるのではなく、新しいモデルとプロンプトの組み合わせとして一から再チューニングしている。
自社でエージェントシステムを評価・運用するチームにとって、この取り組みはプロンプトの陳腐化を防ぐための具体的な指針となる。AWSは、標準的なベンチマークテストではなく、ユーザー固有のコンテキストや外部サービス、ツールといった本番環境のノイズを含むデータで評価することを推奨している。また、基盤モデルを更新する際には、既存プロンプトの単純な流用を避け、指示や望ましい変化を踏まえた全面の再検証とチューニングを行うべきだとしている。さらに、プロンプトの改善においては不要になった指示を削除し、古くなったツール利用の指示などを廃止してプロンプトをシンプルに保つことが、モデルの能力と性能を引き出すために有効だと結論付けている。このような継続的な評価とメンテナンスの仕組みをどう運用に組み込むかが、今後のエージェント活用の成否を左右するとみられる。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Google DeepMindがコーディングや企業向けナレッジワーク、サイバー防御向けにGemini 4 Argonを投入

パナソニック コネクトは個人向けのレッツノートに13.3型NC7を追加し、11月18日から直販サイト「Panasonic Store Plus」限定で販売する

VRAM 32GB環境で4ビット量子化のQwen3.8 27Bを試し、Q4_K_Sに切り替えるとVRAM使用量26GBで推論が高速化、記事要約をトラブルなく完了した

GeneLabが314.6Mパラメータで学習した日本語専用の判断モデルsokudanを公開

Ollama 0.35は意思決定モデル対応リリースの第1弾で、Nimble、Tev1、Tev1:0.8bをローカルで実行できる

SpaceXAIのGrokipediaがv0.3アップデートを公開
