NVIDIA と Hugging Face が NeMo Automodel 学習ライブラリを Diffusers エコシステムに統合し、研究者や開発者が FLUX.1-dev、Wan 2.1、HunyuanVideo といった大規模拡散モデルをチェックポイント変換や独自コード書き換えなしでスケール学習することが実用的になった。
この協業では、NVIDIA の分散学習機能(シャーディング、潜在キャッシング、マルチレゾリューション バケッティング、並列処理オプション)と Hugging Face のモデルハブが統合され、ユーザーはハブ上の任意の Diffusers モデルを指定して既存の YAML 設定とコマンドライン引数で学習を開始できる。
何が起きたか
NVIDIA と Hugging Face は、NVIDIA の NeMo Automodel ライブラリと Hugging Face の Diffusers を統合し、FLUX.1-dev、Wan 2.1、HunyuanVideo などの拡散モデルを Hugging Face Hub から直接、チェックポイント変換やモデル書き換えなしで本番レベルの分散学習を可能にすると発表した。
なぜ重要か
この統合により、大規模な画像・動画モデルをファインチューニングまたは一から学習させたい研究者や開発者の技術的障壁が取り除かれる。従来はスケーリング学習に独自スクリプトと複雑な変換が必要だったが、今は単一の YAML 設定とコマンドライン引数で済み、並列処理(FSDP2、テンソル、パイプライン、コンテキスト並列)がコード書き換えではなく設定選択となった。
注目点
このライブラリは完全ファインチューニングと LoRA スタイルのパラメータ効率的学習の両方に対応し、8 個の NVIDIA H100 GPU で性能を測定している。例えば FLUX.1-dev 完全ファインチューニングは 512×512 で 35.51 ± 1.55 画像/秒を達成し、LoRA では 53.73 ± 0.48 画像/秒となる;HunyuanVideo 1.5 LoRA は動画(512×512×49 フレーム)で 1.433 ± 0.006 クリップ/秒に到達する。この統合は Apache 2.0 のオープンソースで、Diffusers 学習ガイドに記載されている。
この統合は拡散モデル学習における長年の課題に対処している。研究から本番運用へのスケーリングには、メモリ効率的な技術(FSDP2、テンソル並列、マルチレゾリューション バケッティング、潜在キャッシング)が必要だったが、それらは従来、独自スクリプトに分散していたか全く利用できなかった。これらの機能を NeMo Automodel に組み込み、オープンソース拡散モデルの事実上の標準インターフェースである Diffusers とリンクさせることで、NVIDIA と Hugging Face は領域特化化への障壁を低くした。研究者は FLUX.1-dev(12B)や HunyuanVideo(13B)のようなモデルを LoRA を使って単一ノードで、または完全ファインチューニングで大規模クラスタで、モデル書き換えなしにファインチューニングできるようになった。実演例(78 枚の Rider–Waite タロットデータセットで FLUX.1-dev をファインチューニング)は、小規模データセットでも学習スタイルを獲得できることを示している。ファインチューニング後モデルの生成画像は、学習済みトリガートークンでプロンプトされると、クリーム色、赤、黒のヴィンテージパレット、インク輪郭、寓意的なカード構成を示し、ベースモデルは写真的なままである。レシピスタック(FSDP2、チェックポイント処理、生成)が変わらずに実行されるため、新しい拡散モデルを NeMo Automodel に組み込むには、完全な独自学習スクリプトではなく、データ前処理ハンドラとモデルアダプタのみが必要である。この設計選択により、新しい拡散モデルの急速なリリースサイクルに対応することが実用的になった。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ViskoはLlama Venturesからプレシードで1000万ドルを調達し、長編動画を生成するライブモデル「Orbis」を一般公開した
イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した
中国の大規模言語モデル開発企業Z.aiは、国産AIチップ約10万基を用いた大規模推論をサポートできると発表した

味の素公式XがAI編集画像を投稿、飲食店のメニューサンプルに生成AI使用などが相次ぎ炎上

BroadcomはVMware Explore 2026で、VMware Private AI Cloud向けのソフトウェア定義基盤となるVMware AI Factoryを発表した

OpenClawは過去最大となるアップデート、バージョン2.0(リリース番号2026.8.1)を公開した