AIToday
オープンソースAITHE DECODER掲載日時: 2026年8月29日 19:023分で読める

LAIONが1000万時間の動画データセット公開

LINEで送る
LAIONが1000万時間の動画データセット公開

要点

  • LAIONが大規模な公開動画データセットを公開した。動画1000万時間、クリップ5500万件を含む。

  • これを学習したモデルはInternVid学習モデルを最大2.1ポイント上回る。

  • 研究目的のみの提供だ。

3つのポイント

  1. 何が起きたか

    LAIONはAI研究向けの大規模公開動画データセット「Big Video Dataset(BVD)」を公開した。動画1000万時間、自動生成された説明文付きのクリップ5500万件、静止画像3億点で構成される。

  2. なぜ重要か

    BVDで学習したモデルは、InternVidで学習した同等モデルを一般的な動画・テキスト変換ベンチマークで最大2.1ポイント上回る。データセットは研究目的のみに提供され、LAIONの法的根拠は、非営利研究向けの著作権コンテンツ収集を認めた2024年のハンブルク裁判所の判決にあるとみられる。国内のAI研究者は、公開された大規模動画データセットを研究目的で利用できる可能性がある。

  3. 注目点

    データセットとコードは無償公開されるが、クリエイターの権利尊重が求められる。データはCommonCrawlで見つかった13億URLのうち、ダウンロードされた8000万本の動画から抽出されており、多くはYouTube由来で、主に英語コンテンツだ。

この記事についてAIに質問する →

背景と解説

LAIONによるBig Video Datasetの公開は、その規模だけでなく、そこで得られる学習成果の点でも注目に値する。付随する論文によれば、このデータで学習したモデルは、標準的な動画・テキスト変換ベンチマークにおいて、InternVidで学習したモデルより最大2.1ポイント高い性能を示す。これは、13億URLから抽出された8000万本の動画というデータの規模と多様性が、AIの映像と説明・音声の結びつけ能力を向上させ得ることを示唆している。

研究目的限定という制約は、慎重な法的姿勢を反映している。LAIONは、非営利研究目的での著作物収集を認めた2024年のハンブルク裁判所の判決に依拠しているようだ。この判決が組織を保護する一方で、商業利用には別途ライセンス取得や他のデータソースの活用が必要となる。クリエイターの権利尊重を求める姿勢は、AIのデータ需要と著作権の間にある継続的な緊張関係を浮き彫りにしている。

ビジネス関係者にとっての関心事は、これが何を可能にするかだ。検索、翻訳、自動キャプション生成などの製品に応用し得る、より高度な動画理解モデルの開発が進む。ただし、研究目的限定という制約から、商用利用には明確な法的枠組みの整備か、独自データによる代替が必要となる。また、データが主に英語圏のコンテンツであることから、言語によっては効果にばらつきが出る可能性もある。

よくある質問

データセットの規模は?
動画1000万時間、自動生成された説明文付きのクリップ5500万件、静止画像3億点が含まれる。CommonCrawlで見つかった13億URLのうち、ダウンロードされた8000万本の動画から収集された。
誰がこのデータセットを使える?
研究目的のみに公開されている。LAIONは元のコンテンツクリエイターの権利を尊重するよう求めており、コードとともに無償で提供される。
なぜLAIONは著作権コンテンツを使えると考えているのか?
2024年にハンブルク地方裁判所が、非営利研究目的での著作権コンテンツ収集を認める判決を下しており、これが根拠となり得る。
LINEで送る

「オープンソースAI」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • 自宅PCで無料オフラインのチャットボットWIRED AI · 1時間前
  • エヌビディア、Hugging Face買収報道TechCrunch AI · 19時間前
  • Anthropic、AI制御機器向け新標準MHSを公開SiliconANGLE AI · 1日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へレディット株36.7%安、適正価格に接近