
ほとんどの AI 製品は、すべてのルール、例、知識を含む巨大なシステムプロンプトを毎回のリクエストで高価なモデルに送信しているため、過剰に支払い、不要な遅延を経験している。ソリューションはより廉価なベンダーを見つけることではなく、ワークフローを再設計することである:リクエストを個別のステップに分解し、プロンプトにすべてを詰め込む代わりに関連するコンテキストのみを検索し、静的部分をキャッシュし、安価なモデルを分類とルーティングに使用し、高価なモデルは本当に高度な推論が必要な 1 つのステップのために予約する。
Qolca の本番営業アシスタントはこのアプローチを使用している。
2 つの安価な分類器が並列実行され、その後安価なオプションのサマリ、その後応答生成のための単一の高価な呼び出しであり、同じユーザー体験をコストと遅延の一部で実現している。
何が起きたか
Qolca が AI 製品におけるトークン効率に関するガイドを発表し、すべてのルール、例、知識を含む巨大なシステムプロンプトを毎回のリクエストで最も高価なモデルに送信する標準的な慣行が、コストと遅延の両方を無駄にしていると主張した。同社の本番 AI 営業アシスタントは代わりに 4 段階パイプラインを採用している:2 つの安価な並列分類器(言語検出、意図分類)、条件付きコンテキスト要約(会話が長い場合のみ)、および精選されたコンテキストを持つ高価なモデルでの最終応答生成。
なぜ重要か
フロンティアティアのモデルへの入力トークンコストは数ドル/百万トークン程度であり、すべてのトークンがリクエストのたびに再請求される。4,000 トークンのシステムプロンプトが 10 ターンの会話で再読み込みされると、同じ指示の繰り返しだけで 40,000 トークンのコストが発生する。すべての会話と日数を通じて、この無駄は製品の成功に比例して拡大する。遅延も製品特性である。より大きなプロンプトは、モデルが最初のトークンを出力する前により多くのコンテキストを処理することを強制し、チャットボットをユーザーにとって遅く感じさせる。遅い応答や高い請求を理由に挙げるチームは、多くの場合、ベンダー問題ではなくアーキテクチャ問題を抱えている。
注目点
ガイドは既存プロンプトの具体的な改装シーケンスを推奨している:まず凍結された部分に対してプリフィックスキャッシングを有効にする(通常の入力価格の約 10 分の 1 で請求される)、次に知識ベースのような大規模な静的ブロックをレトリーバルベースのスライスに分離し、安価な分類決定を個別の小規模モデル呼び出しに分割し、分類または抽出をフロンティアモデルから廉価の代替品にダウングレードする。最終生成ステップのみ高価なモデルに留まるべきであり、その際は実際に必要な精選されたコンテキストのみを伴う。
この記事は AI 製品に蔓延するアーキテクチャアンチパターン、つまり一体型プロンプトを特定している。チームは包括的なシステムプロンプトを構築してすべてのルール、例、企業の知識を詰め込み、その後そのコンテキスト全体を毎回のリクエストで最も高価なモデルに送信する。本能的には廉価なベンダーを見つけることで最適化しようとするが、記事はこれが問題を誤診していると主張している。真の問題は、トークンを無料またはほぼ無料のリソースとして扱うことであり、実際にはメータリングされた高価なリソースである。
経済的な理由は明白である:4,000 トークンのプロンプトが 10 ターンの会話を通じて再読み込みされると、静的な指示を繰り返すだけで 40,000 トークンのコストが発生する。数ドル/百万入力トークンで、リクエストあたりのコストはわずかに見えるが、すべてのユーザーとすべての日数にわたって掛け合わされると、その無駄は製品自体の成功に比例して拡大する。遅延コストも同様に実在するが、あまり明白ではない。モデルはプロンプト全体を読むまで最初のトークンを出力できないため、肥大化したプロンプトは、ユーザーが画面に何かを見る前に、モデルが数千トークンを処理することを強制する。記事はこれを同じ過ちに対して 2 回支払う:ドルで 1 回、秒で 1 回と説明している。
Qolca は、"モデルが可能性として必要とするかもしれないもの"から"このステップが実際に必要とするもの"へと心の持ち方をシフトさせる 5 つのパターンを提案している。複雑なリクエストを個別のステップ(言語検出、意図分類、コンテキスト検索、応答生成)に分解することにより、各ステップはその必要なコンテキストのみを保持することができる。レトリーバルはコンテキスト詰め込みに取って代わり、知識ベース全体ではなく 2~3 の関連する段落を引き込む。プリフィックスキャッシングは静的コンテンツを通常価格の約 10 分の 1 で請求する。廉価なモデルは分類とルーティング決定を処理する。高価なモデルは本当にフロンティアレベルの流暢性が必要な 1 つのステップのために予約されている。同社の本番アシスタントは、2 つの並列安価分類器、オプションの条件付きサマリ、応答用の単一の高価な呼び出し、およびルーティング用の決定論的コードで、コストと遅延の一部で同じユーザー体験を実現することで、これを例証している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した
SK海力士はSEMICON Taiwan 2026で、ベースダイに演算機能を組み込んだカスタムHBMの構想を発表

エヌビディアの決算は注目に値する一方で退屈な内容となり、統合された世界を避ける姿勢が反映された

AnthropicがNvidia支援のクラウド事業者Lambdaと、$35bnのクラウドコンピューティング契約を結んだ

最高裁判所は2027年度予算案にAI関連費用として約6000万円を計上

消費者庁は24日、全国の消費生活センターに寄せられる年間約90万件の相談を生成AIで分析し、詐欺の手口や事業者の経営破綻の早期サインを検出すると発表した
