AIToday

LLM APIゲートウェイが実キーをマスク

Hacker News1日前
LLM APIゲートウェイが実キーをマスク

要点

新しい API ゲートウェイが DeepSeek、OpenAI、Anthropic の実認証情報を不透明なトークンの背後に隠し、各トークンは単一プロバイダーにスコープされ、有効期限、IP許可リスト、USD 支出予算を備えています。ゲートウェイは各トークンを検証した後、実際の上流シークレットに置き換えてリクエストを転送し、認証情報の露出を減らし、細粒度の支出管理を実現します。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    開発者が、DeepSeek、OpenAI、Anthropic などの LLM プロバイダーとクライアント間に配置される API ゲートウェイを構築しました。実際の API キーを公開する代わりに不透明なトークンを使用し、各トークンを有効期限、IP許可リスト、USD 支出予算に対して検証した後、リクエストを上流に転送します。

  • なぜ重要か

    チームは実際の API 認証情報を共有することなく、スコープを限定した予算制限付きトークンを開発者またはツールに発行できるようになります。これにより キーリークのリスクが減少し、上流プロバイダーの統合を変更することなく、クライアントまたはプロジェクト単位で支出制限を実施できます。

  • 注目点

    実装には 2 つの既知の制限があります。予算の強制は厳密ではなく、1 つの大規模なリクエストまたは並行リクエストがトークンの予算制限を超える場合があります。また、クライアント、ゲートウェイ、または上流接続が急に失敗した場合、コスト追跡は確実に信頼できません。ゲートウェイはリクエストを提供しても、正しく請求されないことがあります。

詳細

ゲートウェイは Cloudflare Worker であり、クライアントからの API リクエストをインターセプトして DeepSeek、OpenAI、または Anthropic にユーザーに代わってルーティングし、実際の API 認証情報をクライアント側から隠します。

クライアントは管理者が作成し D1 データベースに保存している不透明なトークンを使用して認証します。各トークンは厳密に 1 つのプロバイダーにスコープされ、3 つの制約を適用します:有効期限(Unix エポック以降のミリ秒として保存)、IP 許可リスト(Cloudflare の CF-Connecting-IP ヘッダーに対して確認)、および USD でのプロビジョニング予算。受信リクエストごとに、ゲートウェイはトークンを検索し、期限切れでないこと、許可された IP から発信されていること、および予算の全額をまだ使用していないことを確認します。すべてのチェックが成功すると、ゲートウェイは実際の上流 API キー(Worker のシークレットに保存)に置き換えてリクエストを転送します。チェックが失敗した場合、リクエストは拒否されます。

実装は 3 つのプロバイダーにわたる 5 つの API エンドポイントをサポートし、@er91 が 2026-07-14 に検証しています:DeepSeek の /deepseek/chat/completions および /deepseek/v1/messages エンドポイント、OpenAI の /openai/v1/responses エンドポイント、Anthropic の /anthropic/v1/messages エンドポイント。ゲートウェイは OpenCode、Claude Code CLI、Codex CLI を含むエージェント的コーディングツールと連携します。

デプロイメントには、新しい Cloudflare Worker の作成、提供されたスキーマを使用した D1 データベースのセットアップ、および Rust ツールチェーン(wasm32-unknown-unknown ターゲットをビルドするため)のインストールが必要です。管理者は Worker のシークレットを使用して上流 API キーを構成し、トークンテーブルに行を挿入してテストトークンを発行します。例えば、トークンは USD で最大 $1.00 の支出を許可し、指定された Unix タイムスタンプで期限切れになり、単一クライアント IP に制限されるか、または ["*"] を使用してすべての IP に開放される場合があります。

ゲートウェイには 2 つの記録された制限があります。第 1 に、予算強制は厳密ではありません。ゲートウェイはリクエスト開始時のみトークンが予算を超えたかどうかを確認するため、1 つの大規模なリクエストまたは複数の並行リクエストが拒否される前に予算を超える場合があります。第 2 に、コスト追跡は完全には信頼できません。クライアント接続または上流接続が急に失敗した場合、またはゲートウェイがコスト計算または永続化中にクラッシュした場合、リクエストは引き続き提供されますが、請求されない場合があります。著者はこれらのギャップに注意し、強化案(利用可能な予算に基づいて max_tokens を動的に設定する、または請求の失敗を検出するための監視を実装するなど)を提案していますが、ゲートウェイをシンプルに保ち、リクエストを変更しないようにするため、初期バージョンではこれらを実装しないことを選択しています。

背景と解説

このゲートウェイは実践的なセキュリティ上の懸念に対応しています。複数の開発者またはツールに API アクセスを配布するチームは、利便性と認証情報のセキュリティの間でジレンマに直面しています。実際の API キーを広く共有するとリーク のリスクが増加し、ユーザーまたはアプリケーションごとの支出監査と制限が困難になります。トークンベースのレイヤーを導入することで、ゲートウェイは認証情報配布の問題と支出管理の問題を分離します。

設計スコープは狭く意図的です。ゲートウェイは静的認証情報(API キーと長期間有効なアクセストークン)のみをサポートし、リフレッシュトークンフローはサポートしていません。ゲートウェイ内でトークンリフレッシュを実装すると、不安定な内部 API へのアクセスか、変更するトークン間でユーザーを確実に識別する方法が必要になりますが、どちらも 3 つのプロバイダーすべてで実行不可能です。ゲートウェイは Cloudflare Workers と D1 データベース向けに構築されており、デプロイメントは Cloudflare のインフラストラクチャに密結合されていることを意味します。

記録されている 2 つの制限(厳密でない予算強制と障害中の信頼できないコスト追跡)は、意図的なトレードオフを表しています。著者は意図的にリクエスト(例えば max_tokens を固定化)を変更せず、完全な監視と再試行ロジックを実装しないことを選択し、リクエストをそのまま転送するシンプルなゲートウェイを優先しています。厳密な支出制限または完全な請求精度に依存するユーザーは、外部監視を追加するか、リクエスト変更を自分で実装する必要があります。

よくある質問

このゲートウェイはどの LLM プロバイダーをサポートしていますか?
ゲートウェイは DeepSeek、OpenAI、Anthropic をサポートしています。また、DeepSeek の Anthropic 互換 /v1/messages エンドポイントを Claude Code CLI の Anthropic 代替として使用することもできます。
予算管理システムの主な制限は何ですか?
予算の強制は厳密ではなく、ゲートウェイはリクエスト開始時のみチェックするため、1 つの大規模なリクエストまたは並行リクエストが予算を超える場合があります。コスト追跡も完全には信頼できません。クライアント、上流、またはゲートウェイが急に失敗した場合、リクエストは提供されても正しく請求されない可能性があります。
実際の API キーはどこに保存する必要がありますか?
実際の上流 API キーは Cloudflare Worker のシークレットにのみ保存され、クライアントには決して公開されません。クライアントは代わりに D1 データベースに保存されている不透明なトークンで認証します。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます

毎朝1分、AIの要点だけ。

200媒体以上・Email/LINE/Slack 対応

無料で受け取る →