AIToday
大規模言語モデルAIビジネス・産業Amazon AI Blog掲載日時: 2026年9月16日 4:00

Amazon Bedrock最大90%削減

LINEで送る
Amazon Bedrock最大90%削減

3つのポイント

  1. 何が起きたか

    Amazonは、Amazon Bedrockのプロンプトキャッシュでキャッシュ済み入力トークンのコストを最大90%削減でき、1万トークンの文書を多数の質問で再利用できると発表した。

  2. なぜ重要か

    文書ごとに毎回満額を払う代わりに、`cacheReadInputTokens`は標準入力より90%安く、cacheWriteInputTokensは25%高くなる。

  3. 注目点

    削減効果は後続リクエストがtime-to-liveウィンドウ内に届くかどうかにかかっており、デフォルトは5分で、期限切れのリクエストはより高いレートで新たなキャッシュ書き込みを発生させる。

誰に効くかこれが最も強く影響するのは、同じ長い文書、システムプロンプト、ツール定義、テナント固有のコンテキストを繰り返し送信するAmazon Bedrockアプリケーションを構築する開発者や技術チームだ。彼らの中心的なトレードオフは、プロンプトやコンテキストウィンドウを削ることから、キャッシュの寿命とトークン閾値の管理へと移る。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Amazonの投稿は、プロンプトキャッシュをよく知られたコスト問題に対するインフラレベルの解決策として位置づけている。キャッシュがなければ、1万トークンの契約書を50件のユーザー質問とともに送ると、内容の多くがすでに処理済みであっても、50万入力トークンが満額で課金される。記事は3つの回避策とそのトレードオフを挙げている。プロンプトを短くするとコンテキストの品質が下がる可能性があり、コンテキストウィンドウを小さくすると完全な情報に基づく推論が弱まり、レスポンスキャッシュは同じコンテキストに異なる質問を組み合わせた場合には何の役にも立たない。プロンプトキャッシュは、これらの妥協を避ける第4の道として提示されている。

仕組みが重要であるのは、そこに削減の源泉があるからだ。cachePointマーカーは、Amazon Bedrockに先行するコンテンツを既存のキャッシュエントリと比較するよう指示し、範囲は個々のAWSアカウントとリージョンに限定される。キャッシュヒットは再処理を省き、キャッシュされた状態から生成を開始する。キャッシュミスはすべてを処理し、新しいエントリを書き込む。Amazonはまた、cacheWriteInputTokensとcacheReadInputTokensという2つの新しいトークンカテゴリを挙げ、それぞれ標準入力より25%高く、90%安く価格設定している。90%の削減はキャッシュ読み取りに適用され、繰り返し使う文書で約75%の純削減という数字は、後続のリクエストがtime-to-liveウィンドウ内に収まることを前提としている。

購買者にとっての実践的な試金石は、自分たちのトラフィックパターンが実際にそのウィンドウに収まるかどうかだ。デフォルトのtime-to-liveは5分で、一部のモデルは最大1時間に対応し、期限切れ後のリクエストはより高いレートで新たなキャッシュ書き込みを引き起こす。モデルの選択も重要で、Anthropic Claude Sonnet 4.5とSonnet 4.6はチェックポイントごとに少なくとも1,024トークン、Opusモデルは少なくとも4,096トークンが必要だ。長い文書や安定したシステムプロンプトを定期的に送信するチームは最も明確な効果を得られる可能性が高い一方、散発的または小規模なペイロードのワークロードでは、書き込みの割増を正当化しにくいかもしれない。

よくある質問
cacheWriteInputTokensとcacheReadInputTokensの違いは何か?
cacheWriteInputTokensは最初のリクエストでキャッシュに書き込まれるトークンで、標準入力より25%高くつく。cacheReadInputTokensは後続のリクエストでキャッシュから読み出されるトークンで、標準入力より90%安い。
1つの文書に複数の質問を送った場合、どれくらい節約できるか?
繰り返し使うコンテキストについて、Amazonは入力トークンのコストで約75%の削減が達成されるとしている。ただし、後続のリクエストがすべてキャッシュのtime-to-liveウィンドウ内に行われることが前提だ。
キャッシュを機能させるための最小サイズ要件はあるか?
ある。各キャッシュチェックポイントは最小トークン閾値を満たす必要がある。例えば、Anthropic Claude Sonnet 4.5とSonnet 4.6はチェックポイントごとに少なくとも1,024トークン、Opusモデルは少なくとも4,096トークンが必要だ。
Amazon AI Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • CertiniaのVeda AI、サービス提供成果に軸足SiliconANGLE AI · 4時間前
  • Emergence AI:8件の安全テスト全滅Semafor Tech · 4時間前
  • Gemini 3.8 Live音声部門首位THE DECODER · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

次の記事へ元DeepMind研究者、AIが人類を滅ぼすと警告