AIToday
大規模言語モデルAIコーディングITmedia AI+掲載日時: 2026年10月1日 13:00

Kiroのシステムプロンプト陳腐化対策、AWSが評価手法を公開

LINEで送る
Kiroのシステムプロンプト陳腐化対策、AWSが評価手法を公開

3つのポイント

  1. 何が起きたか

    AWSは2026年8月25日、AIコーディングエージェント「Kiro」のシステムプロンプト評価の仕組みを明らかにした。実運用の会話をLLMジャッジで分析し、15の観点でスコアリングする。

  2. なぜ重要か

    システムプロンプトは、モデル・ツール・コードベース・タスク・ユーザーの組み合わせで挙動が変わるため、事前のテストでは全パターンを検証できない。ベンチマークだけでは不十分とみられる。

  3. 注目点

    Kiro CLIでは無害な不満が5%減、推論ミス32%減、タスク未完了10.6%減と改善した。一方、新モデル更新で推論ミスの改善は4%にとどまり、陳腐化への継続的なチューニングが焦点となる。

誰に効くか自社でAIエージェントを運用する情報システム部門や開発チームは、モデル更新のたびにシステムプロンプトを見直す必要がある。Kiroの評価手法は、プロンプト変更の効果測定や陳腐化防止の参考になる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

AIコーディングエージェントのシステムプロンプトは、モデル、ツール、コードベース、タスク、ユーザーの組み合わせによって挙動が変わる。そのため、事前に用意したテストスイートでは全てのパターンを検証できないという根本的な課題がある。AWSはKiroにおいて、実運用の会話データとLLMジャッジを組み合わせた評価フレームワークを導入し、この課題に対処している。具体的には、タスクの達成度や推論の正確さなど15の観点でスコアリングし、A/B比較で変更の効果を検証する仕組みだ。過去の検証では、27個の変更を一括でスクリーニングし、内容が悪化したものを即座に排除したという。また、推論の度合いを設定変更する仕組みも採用され、過度に高い設定にすることでデバッグなどのコードインタスクにおいて誤った改善を招くことを抑止している。

評価の結果、Kiro CLIでは無害な不満が5%減、推論ミスが32%減、タスク未完了が10.6%減となった。Kiro IDEでは推論ミスが20%減、タスク未完了が21%減、実行されていないアプローチが36%減、スタイルの不一致が54%減といった改善が見られた。しかし、利用可能な新モデルへの更新やプロンプト変更による推論ミスの改善は4%にとどまった。これはプロンプトの変更効果が限定的だったわけではなく、新モデル自体が最初から高い推論力を持っていたため、プロンプトで改善できる余地が少なかったことを意味する。さらに、新モデルは指示をより文字通りに解釈するようになり、古いモデル向けに書かれた過剰な制約がボトルネックになるケースも確認された。このためAWSでは、モデル更新と1対1で差分を当てるのではなく、新しいモデルとプロンプトの組み合わせとして一から再チューニングしている。

自社でエージェントシステムを評価・運用するチームにとって、この取り組みはプロンプトの陳腐化を防ぐための具体的な指針となる。AWSは、標準的なベンチマークテストではなく、ユーザー固有のコンテキストや外部サービス、ツールといった本番環境のノイズを含むデータで評価することを推奨している。また、基盤モデルを更新する際には、既存プロンプトの単純な流用を避け、指示や望ましい変化を踏まえた全面の再検証とチューニングを行うべきだとしている。さらに、プロンプトの改善においては不要になった指示を削除し、古くなったツール利用の指示などを廃止してプロンプトをシンプルに保つことが、モデルの能力と性能を引き出すために有効だと結論付けている。このような継続的な評価とメンテナンスの仕組みをどう運用に組み込むかが、今後のエージェント活用の成否を左右するとみられる。

よくある質問
Kiroのシステムプロンプト評価はどのように行われるのか?
実運用の会話セッションをLLMジャッジで分析し、タスク遂行や推論、ツール使用の適切さなど15の観点でスコアリングする。また、A/B比較で変更の効果を検証する。
プロンプト変更の効果はどのくらいあったのか?
Kiro CLIでは無害な不満が5%減、推論ミスが32%減、タスク未完了が10.6%減となった。Kiro IDEでも推論ミスが20%減、タスク未完了が21%減などの改善が確認された。
システムプロンプトの陳腐化を防ぐにはどうすればよいか?
AWSは、標準的なベンチマークテストではなく、ユーザー固有のコンテキストや外部サービス、ツールなどのノイズを含むデータで評価することを推奨している。また、不要になった指示を削除してプロンプトをシンプルに保つことが有効としている。
ITmedia AI+元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へsokudan、部署振り分け0.880でLaya超え