
AppleのLuceは単一画像から再照明可能な3Dアセットを生成する。
ジオメトリとPBRマテリアルを捉え、FIDを最強ベースライン比28%改善。
テキストやロゴなどの微細なディテールも保持する。
何が起きたか
Appleの研究者が、ジオメトリとPBRマテリアルをボクセル化したマルチモーダルなガウシアンクラウドに統合する3D表現「Luce」を発表した。単一画像から、修正フロートランスフォーマーを用いて潜在表現を生成し、3Dアセットを作り出す。
なぜ重要か
Luceは、Toys4Kベンチマークで単一画像からの3D生成において最先端の性能を達成し、最強のベースラインに対してFIDを28%改善した。また、AI生成画像の新ベンチマークでも最良のベースラインを上回り、CLIP画像整合スコアは0.8519(ベースラインは0.8299)を記録した。
注目点
Luceは、テキストやロゴ、碑文などの微細なディテールを保持し、再照明可能なPBRガウシアンまたは接線空間法線マップ付きのテクスチャメッシュを出力できる。これにより、AI生成3Dアセットが標準的なレンダリングパイプラインでより利用しやすくなる可能性がある。
AppleのLuce論文は、3Dアセット生成における重要な限界、つまり標準的なレンダリングパイプラインに統合できるモデルの生成に取り組んでいる。ジオメトリとPBRマテリアルを単一の表現に統合することで、ゲームや映画でのリアルなレンダリングに必要な再照明を可能にする。変分オートエンコーダーと修正フロートランスフォーマーの使用は、潜在空間を圧縮・生成する技術的アプローチだが、実際の結果はより重要である。テキストやロゴなど、他の手法では問題となることが多い微細なディテールを保持したアセットを生成できるのだ。
Toys4KでのFIDの28%改善は、単一画像から3D生成の品質における顕著な進歩を示している。AI生成画像のベンチマークの導入も、これらのモデルを評価する新しい標準を提供する可能性がある。企業にとって、この技術は3Dコンテンツ作成の障壁を下げ、Eコマース、バーチャルリアリティ、プロダクトデザインなどの業界に影響を与える可能性があるが、論文では商業的応用については議論されていない。オプションのテクスチャメッシュ出力は既存のワークフローとの互換性を示唆しており、導入を容易にするかもしれない。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ホッキョクグマの救出から迷子ペットまで、AI生成の動物動画や画像が氾濫し、視聴者は動物投稿を額面通り受け取れなくなっている

Netflixの新作映画『ハムネット』が、プロモーション画像の誤りらしき箇所を理由にAI使用疑惑を持たれたが、実際は歴史的な背景によるものだ

Stable Diffusionの開発元であるStability AIが、シリーズBで7600万ドルを調達し、累計調達額は2億3200万ドルとなった

Appleの研究者が、Pretzelアーキテクチャを基盤とする新モデルSTARFlow2を発表した

Asicsは9月1日からAI搭載のクマ検知アプリ(AI-App クマ検知)の提供を開始すると発表した

ソフトウェアエンジニアが「By-Its-Cover」という推薦システムを開発した
