AIToday
大規模言語モデルDaily Dose of Data Science掲載日時: 2026年9月12日 10:003分で読める

100のファインチューニング、1GPUで1.5TBから19.3GBに

LINEで送る
100のファインチューニング、1GPUで1.5TBから19.3GBに

3つのポイント

  1. 何が起きたか

    100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する。

  2. なぜ重要か

    マージされたレイアウトでは各バリアントが独自のエンドポイントとワーカーを持ち、1つのアイドルワーカーが別のモデルのリクエストを処理できず、別のワーカーが起動する間GPUが未使用のままになる。

  3. 注目点

    共有ベースのレイアウトでは全アダプタが同じベースモデル由来で、GPUメモリ消費が余裕を減らすため、カタログのサイズと変更頻度が起動時登録かリクエスト時解決かを左右する。

誰に効くか自社で複数のファインチューニング済みモデルを運用するMLエンジニアやインフラ担当者は、ベースモデルを共有してLoRAアダプタを分離することでGPUメモリとワーカー数を削減できる可能性がある。特に同じベースモデルから派生した多数のバリアントを提供するチームに影響する。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

ファインチューニングされたモデルを提供する際、多くのチームは各バリアントをマージして個別のエンドポイントを立てる。これは単純だが、ベースモデルが同じでも完全なモデルコピーとワーカープールをバリアントごとに複製する。記事は、このレイアウトがメモリとワーカーの両方を浪費することを示す。

代わりにベースモデルを1回ロードし、小さなLoRAアダプタを並べてロードする。vLLMがリクエストごとに必要なアダプタを適用するため、抽出、SQL、ルーティングのリクエストが同じGPUを共有できる。新しいバリアントの追加は15.2GBではなく約40MBのアダプタメモリで済む。ただし、すべてのアダプタが同じベースモデルから来る必要があり、アダプタはGPUメモリを消費する。

起動時にアダプタを登録する方法は小規模で安定したカタログに向く。リクエスト時にロードする方法は、数百の顧客アダプタがあり少数しか同時にリクエストされない場合に適するが、未ロードのアダプタへの最初のリクエストは遅くなる。

Runpod Serverlessでの実験では、共有エンドポイントは別々のエンドポイントよりもワーカーを再利用でき、コールドスタートの影響を抑えられた。別々のレイアウトは短時間のテストでは請求ワーカー秒が少なかったが、それはリクエストの完了数が少なく、ほとんどが2分以上待たされたためだ。この結果は、メモリ節約だけでなくワーカー再利用が運用上の利点であることを示す。ただし、コストはGPUタイプやワーカーモード、トラフィックのパターンに依存するため、実際の導入では自身の計測値で評価する必要がある。

よくある質問
なぜ100個のモデルを1つのGPUで提供できるのですか?
各ファインチューニングをマージすると15.2GBの完全なモデルコピーができるが、LoRAアダプタは約40MBのタスク固有の重みしか含まない。1つの15.2GBのベースモデルと約4GBのアダプタを共有すれば、80GBのGPUに収まる。
共有エンドポイントと個別エンドポイントの違いは何ですか?
共有エンドポイントはすべてのリクエストを同じワーカープールにルーティングするため、ワーカーが相互に助け合える。個別エンドポイントでは、アイドル状態のワーカーが別のモデルのリクエストを処理できず、新しいワーカーが起動する間GPUが未使用のままになる。
コストはどう変わりますか?
フレックスのワーカーでは、起動とアイドル時間はエンドポイントごとに支払う。3つの個別エンドポイントは同じトラフィックサイクル中にそのオーバーヘッドを3回支払う可能性がある。アクティブワーカーの場合、1つの共有エンドポイントは1つのウォームフロアが必要だが、3つの個別エンドポイントは3つ必要になる。
Daily Dose of Data Science元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Dynatrace、Arize AIを買収SiliconANGLE AI · 3時間前
  • OpenAIエージェントがRubyGems攻撃Simon Willison's Weblog · 3時間前
  • Simon Willison氏、AIコーディングエージェントはソフトウェアエンジニアを終わらせないと語るSimon Willison's Weblog · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へOpenAIエージェントがRubyGems攻撃