AIToday
AIコーディング大規模言語モデルHacker News掲載日時: 2026年7月17日 13:006分で読める

巨大プロンプトは分解してルーティング

LINEで送る
巨大プロンプトは分解してルーティング

要点

  • ほとんどの AI 製品は、すべてのルール、例、知識を含む巨大なシステムプロンプトを毎回のリクエストで高価なモデルに送信しているため、過剰に支払い、不要な遅延を経験している。ソリューションはより廉価なベンダーを見つけることではなく、ワークフローを再設計することである:リクエストを個別のステップに分解し、プロンプトにすべてを詰め込む代わりに関連するコンテキストのみを検索し、静的部分をキャッシュし、安価なモデルを分類とルーティングに使用し、高価なモデルは本当に高度な推論が必要な 1 つのステップのために予約する。

  • Qolca の本番営業アシスタントはこのアプローチを使用している。

  • 2 つの安価な分類器が並列実行され、その後安価なオプションのサマリ、その後応答生成のための単一の高価な呼び出しであり、同じユーザー体験をコストと遅延の一部で実現している。

3つのポイント

  1. 何が起きたか

    Qolca が AI 製品におけるトークン効率に関するガイドを発表し、すべてのルール、例、知識を含む巨大なシステムプロンプトを毎回のリクエストで最も高価なモデルに送信する標準的な慣行が、コストと遅延の両方を無駄にしていると主張した。同社の本番 AI 営業アシスタントは代わりに 4 段階パイプラインを採用している:2 つの安価な並列分類器(言語検出、意図分類)、条件付きコンテキスト要約(会話が長い場合のみ)、および精選されたコンテキストを持つ高価なモデルでの最終応答生成。

  2. なぜ重要か

    フロンティアティアのモデルへの入力トークンコストは数ドル/百万トークン程度であり、すべてのトークンがリクエストのたびに再請求される。4,000 トークンのシステムプロンプトが 10 ターンの会話で再読み込みされると、同じ指示の繰り返しだけで 40,000 トークンのコストが発生する。すべての会話と日数を通じて、この無駄は製品の成功に比例して拡大する。遅延も製品特性である。より大きなプロンプトは、モデルが最初のトークンを出力する前により多くのコンテキストを処理することを強制し、チャットボットをユーザーにとって遅く感じさせる。遅い応答や高い請求を理由に挙げるチームは、多くの場合、ベンダー問題ではなくアーキテクチャ問題を抱えている。

  3. 注目点

    ガイドは既存プロンプトの具体的な改装シーケンスを推奨している:まず凍結された部分に対してプリフィックスキャッシングを有効にする(通常の入力価格の約 10 分の 1 で請求される)、次に知識ベースのような大規模な静的ブロックをレトリーバルベースのスライスに分離し、安価な分類決定を個別の小規模モデル呼び出しに分割し、分類または抽出をフロンティアモデルから廉価の代替品にダウングレードする。最終生成ステップのみ高価なモデルに留まるべきであり、その際は実際に必要な精選されたコンテキストのみを伴う。

この記事についてAIに質問する →

背景と解説

この記事は AI 製品に蔓延するアーキテクチャアンチパターン、つまり一体型プロンプトを特定している。チームは包括的なシステムプロンプトを構築してすべてのルール、例、企業の知識を詰め込み、その後そのコンテキスト全体を毎回のリクエストで最も高価なモデルに送信する。本能的には廉価なベンダーを見つけることで最適化しようとするが、記事はこれが問題を誤診していると主張している。真の問題は、トークンを無料またはほぼ無料のリソースとして扱うことであり、実際にはメータリングされた高価なリソースである。

経済的な理由は明白である:4,000 トークンのプロンプトが 10 ターンの会話を通じて再読み込みされると、静的な指示を繰り返すだけで 40,000 トークンのコストが発生する。数ドル/百万入力トークンで、リクエストあたりのコストはわずかに見えるが、すべてのユーザーとすべての日数にわたって掛け合わされると、その無駄は製品自体の成功に比例して拡大する。遅延コストも同様に実在するが、あまり明白ではない。モデルはプロンプト全体を読むまで最初のトークンを出力できないため、肥大化したプロンプトは、ユーザーが画面に何かを見る前に、モデルが数千トークンを処理することを強制する。記事はこれを同じ過ちに対して 2 回支払う:ドルで 1 回、秒で 1 回と説明している。

Qolca は、"モデルが可能性として必要とするかもしれないもの"から"このステップが実際に必要とするもの"へと心の持ち方をシフトさせる 5 つのパターンを提案している。複雑なリクエストを個別のステップ(言語検出、意図分類、コンテキスト検索、応答生成)に分解することにより、各ステップはその必要なコンテキストのみを保持することができる。レトリーバルはコンテキスト詰め込みに取って代わり、知識ベース全体ではなく 2~3 の関連する段落を引き込む。プリフィックスキャッシングは静的コンテンツを通常価格の約 10 分の 1 で請求する。廉価なモデルは分類とルーティング決定を処理する。高価なモデルは本当にフロンティアレベルの流暢性が必要な 1 つのステップのために予約されている。同社の本番アシスタントは、2 つの並列安価分類器、オプションの条件付きサマリ、応答用の単一の高価な呼び出し、およびルーティング用の決定論的コードで、コストと遅延の一部で同じユーザー体験を実現することで、これを例証している。

よくある質問

入力トークンのコストはいくらで、再請求はいくらか?
フロンティアティアのモデルのコストは数ドル/百万入力トークン程度である。プロンプト内のすべてのトークンは毎回のリクエストで支払われるため、4,000 トークンのシステムプロンプトが 10 ターンの会話を通じて再読み込みされると、第 1 ターンで既に吸収された指示を再度述べるだけで 40,000 トークンのコストが発生する。
プリフィックスキャッシングとは何か、どの程度節約できるか?
プリフィックスキャッシングはプロンプトの静的な部分(ペルソナ、固いルール、フォーマット指示)を保存し、毎回ゼロから再処理されないようにする。キャッシュされた入力トークンは通常の入力価格の約 10 分の 1 で請求され、処理がより高速だが、キャッシュは静的コンテンツがプロンプトの最初に配置され、変動するコンテンツ(ユーザーメッセージ、タイムスタンプ、リクエストごとのデータ)が最後に配置されている場合にのみ機能する。
Qolca の本番営業アシスタントはどのステップで構成されているか?
4 つのステップで実行される:第 1 に、小規模で高速なモデル上の 2 つの安価な分類器が言語を検出し意図を分類する(パラレルで実行される小さな呼び出し)。第 2 に、コンテキスト要約ステップは会話が長い場合のみ安価なモデルで条件付きで実行される。第 3 に、高価なモデルが検出された言語、意図、コンパクトなコンテキスト、およびメッセージを使用して応答を生成する。第 4 に、5 番目のステップが決定論的コードを使用してどのモデルも使用せずにコールトゥアクションを決定する。
LINEで送る

「AIコーディング」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • OpenClaw 2.0発表、企業向けAIチームを標的VentureBeat AI · 7時間前
  • AIコーディング、プロンプトから文脈へ進化ITmedia AI+ · 14時間前
  • Workday、GmailにAI統合、ERPの安全維持SiliconANGLE AI · 16時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAI安全シーディング・イニシアティブが大学グループ構築を開始