
AIが多くの応用分野で手設計システムに置き換わっているにもかかわらず、H.264やH.265といった従来の動画コーデックは依然として実運用で主流である。MLVC(Multi-platform Learned Video Codec)という新しい研究プロジェクトが2つの主要な障壁に取り組んでいる。
第1に、ハードウェアアクセラレーションが施された従来のコーデックと比較して、神経コーデックの計算量と電力消費の高さである。
第2に、クロスプラットフォーム互換性という重大な問題で、Apple NPUやIntel NPUなど異なるデバイスプラットフォーム上のエンコーダーとデコーダーの間で数値のわずかな違いがエントロピー復号化を失敗させ、動画ストリーム全体を崩壊させる。
何が起きたか
MLVC(Multi-platform Learned Video Codec)と呼ばれる研究プロジェクトが、H.264やH.265、AV1といった従来の手設計システムに対し、AIベースの動画コーデックが過去14年間にわたって他の多くの分野で手設計システムに置き換わっているにもかかわらず、実際の運用ではいまだ導入されていない理由に取り組んでいる。
なぜ重要か
神経コーデックは2つの大きな障害に直面している。第1に、ハードウェアアクセラレーションが至る所にある従来のコーデックと比べて、計算量が多く電力を消費する点である。第2に、プラットフォーム間の互換性の問題で、あるデバイス(AppleのNPUなど)のエンコーダーと別のデバイス(Intel NPUなど)のデコーダーの間で数値のわずかな違いがあると、エントロピーモデルの計算が一致しなくなり、動画ストリーム全体が崩壊する。クロスプラットフォーム互換性は導入の重大な課題である。
注目点
本研究では、NPU(ニューラルプロセッシングユニット)が神経コーデックの実用的な解決策となり得るかどうか、また完全に指定された固定小数点演算またはその他の技術が、現在異なるメーカーのハードウェア間で単一のエンコード済みストリームが確実に動作することを阻害している数値互換性の問題を解決できるかどうかが焦点である。
多くの分野でのAIの支配と手設計動画コーデックの継続的な使用のギャップは、純粋なアルゴリズム革新だけでは解決できない実践的なエンジニアリング問題を明らかにしている。2012年のAlexNetがコンピュータビジョンおよび他の分野で手設計システムに置き換わる神経ネットワークの始まりを示す一方、動画コーデックは注目すべき例外のままである。この報告書では2つの異なる障壁を特定している。1つは経済的かつインフラストラクチャ的なもの(従来のコーデック用ハードウェアアクセラレーションは遍在しているが、神経コーデックは大きな計算能力を必要とする)だが、より根本的な障壁は技術的なもの——クロスプラットフォーム互換性の問題である。エンコーディングとデコーディングが異なるメーカーのニューラルプロセッシングユニット上で発生する場合、各プラットフォームがエントロピーモデルを計算する方法の数値精度の違いがストリームの完全な失敗を引き起こす。研究はNPUが効率性の観点から前進の道を提供する可能性があることを示唆しているが、それは数値決定性の問題が完全に指定された固定小数点演算またはそれに類する手法を通じて解決できた場合に限る。これらの手法は異なるハードウェア実装全体でビット完全な再現性を保証する可能性がある。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
RedditユーザーがMLコミュニティに対し、ワールドモデルの定義を問いかけ、現在の構築物は高度な動画生成モデルに過ぎないと指摘した

AI動画制作会社BearJamが、2年間の経験を踏まえ、AIと人間の判断を組み合わせたハイブリッドモデルを重視する責任ある自動化の手法を公開した

GoogleはGemini Omni Flashをバージョン1.1に更新し、シーン拡張の分析対象を最大10秒の動画(従来は最後の1秒のみ)に改善した

独立系プラットフォームFlow AIが、GoogleのVeo技術を活用したオンラインAI動画生成機を公開

アリババの動画生成モデルWan3.0がベータ版で公開された

AIによるオープンソース動画生成プロジェクト「Oneiric」が公開された
