AIToday
大規模言語モデルAmazon AI Blog掲載日時: 2026年6月2日 4:001分で読める

AWSがAmazon FSx for LustreとNVIDIA GPUDirect Storageを組み合わせてLLMのモデル読み込み時間を短縮、TurboQuantによるコンテキストウィンドウの拡大についても説明

LINEで送る
AWSがAmazon FSx for LustreとNVIDIA GPUDirect Storageを組み合わせてLLMのモデル読み込み時間を短縮、TurboQuantによるコンテキストウィンドウの拡大についても説明

3つのポイント

  1. AmazonはAmazon EC2 P6eおよびP6インスタンスファミリー(NVIDIA Blackwellアーキテクチャ搭載)を最近立ち上げた。P6e UltraServerは単一のNVLinkドメイン内に72個のNVIDIA Blackwell GPUを搭載し、130 TB/sのバイセクション帯域幅、13.4 TB のHBM3e、360 petaflopsのFP8コンピュート(FP4で720)を備えている。

  2. Amazon FSx for LustreとNVIDIA GPUDirect Storage(GPU High Bandwidth Memoryへのダイレクトメモリアクセス)を組み合わせることで、従来のCPUベースのモデル読み込み(CPUメモリを経由し、PCIe経由で各GPUに順序立てて重みをコピー)をバイパスし、シャード化された並列モデル読み込みが可能になる。テスト構成では、Persistent_2 EFAファイルシステム(1000 MBps/TiBで20個のObject Storage Targets搭載、容量96 TiB)が約94 GiB/sのファイルシステムスループットを提供する。

  3. 従来のCPUベースのモデル読み込みでは、Llama 3.1 405B(BF16で約800 GBのチェックポイントデータ)を単一スレッドで読み込むと10~20分かかるが、GDSを使用することで分単位のコールドスタート遅延の問題(新規インスタンスがモデル読み込み完了まで通信できない、オートスケーリングが分単位で遅延、インスタンス障害時の交換容量オンライン化に分単位を要する、GPU時間が読み込み中に無駄になる)が緩和される。

この記事についてAIに質問する →

Amazon AI Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • LLMベンチマーク監査法 BenchMIRT公開Hugging Face Blog · 5時間前
  • グーグル、ハリウッドにAI契約持ちかけThe Verge AI · 5時間前
  • OpenAI「Astra」公開間近、脆弱性攻略に優位TechCrunch AI · 5時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へCitizens JMPがMicrosoftに「Market Outperform」格付けで新規カバレッジを開始、株価上昇