
何が起きたか
100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する。
なぜ重要か
マージされたレイアウトでは各バリアントが独自のエンドポイントとワーカーを持ち、1つのアイドルワーカーが別のモデルのリクエストを処理できず、別のワーカーが起動する間GPUが未使用のままになる。
注目点
共有ベースのレイアウトでは全アダプタが同じベースモデル由来で、GPUメモリ消費が余裕を減らすため、カタログのサイズと変更頻度が起動時登録かリクエスト時解決かを左右する。
誰に効くか自社で複数のファインチューニング済みモデルを運用するMLエンジニアやインフラ担当者は、ベースモデルを共有してLoRAアダプタを分離することでGPUメモリとワーカー数を削減できる可能性がある。特に同じベースモデルから派生した多数のバリアントを提供するチームに影響する。
こういう要約が、毎朝あなたのメールに届きます。
ファインチューニングされたモデルを提供する際、多くのチームは各バリアントをマージして個別のエンドポイントを立てる。これは単純だが、ベースモデルが同じでも完全なモデルコピーとワーカープールをバリアントごとに複製する。記事は、このレイアウトがメモリとワーカーの両方を浪費することを示す。
代わりにベースモデルを1回ロードし、小さなLoRAアダプタを並べてロードする。vLLMがリクエストごとに必要なアダプタを適用するため、抽出、SQL、ルーティングのリクエストが同じGPUを共有できる。新しいバリアントの追加は15.2GBではなく約40MBのアダプタメモリで済む。ただし、すべてのアダプタが同じベースモデルから来る必要があり、アダプタはGPUメモリを消費する。
起動時にアダプタを登録する方法は小規模で安定したカタログに向く。リクエスト時にロードする方法は、数百の顧客アダプタがあり少数しか同時にリクエストされない場合に適するが、未ロードのアダプタへの最初のリクエストは遅くなる。
Runpod Serverlessでの実験では、共有エンドポイントは別々のエンドポイントよりもワーカーを再利用でき、コールドスタートの影響を抑えられた。別々のレイアウトは短時間のテストでは請求ワーカー秒が少なかったが、それはリクエストの完了数が少なく、ほとんどが2分以上待たされたためだ。この結果は、メモリ節約だけでなくワーカー再利用が運用上の利点であることを示す。ただし、コストはGPUタイプやワーカーモード、トラフィックのパターンに依存するため、実際の導入では自身の計測値で評価する必要がある。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した
Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した

Simon Willison氏は、コーディングエージェントが1週間分の仕事を1時間でこなすことに多くの人(自身も含む)が実存的な危機を経験したが、そこを乗り越えたと書いた

ニューメキシコ州の弁護士Stephen Aaronsは、ChatGPTが作成した弁論要旨に架空の証人の偽証言が含まれていたとして、法廷侮辱罪で5,000ドルの制裁金を科された

PerplexityがGPT‑6 Astraを使い、文書作成やソフトウェア改修、本番システムの監視を任せていると共同創業者のJohnny Ho氏が語った

CognitionがGPT‑6 AstraをDevin、CLI、デスクトップ製品に適用
