
何が起きたか
TwelveLabsは自視点映像向け初のモデル「Pegasus 1.6」を公開。動作のセグメンテーションとラベリングなど5業務に対応する。
なぜ重要か
一人称映像を構造化された検証可能な学習データに変える狙い。遠隔操作データより収集・拡張が容易だとTwelveLabsは説明する。
注目点
特定のカメラや専用ハードは不要で、既存映像から有効な学習データを作れるかが焦点。大量映像処理の高速化・低コスト化も訴える。
誰に効くかロボティクス開発者やデータチーム、特に梱包や組み立て、清掃といった器用さ・操作系の作業に取り組むチームは、遠隔操作データを集める代わりに、既存の一人称映像をPegasus 1.6でラベリング・選別できる。
こういう要約が、毎朝あなたのメールに届きます。
2021年創業でソウルに拠点を置くTwelveLabsは、MarengoとPegasusのモデルを軸に動画インテリジェンス基盤を築いてきた。Pegasus 1.6で同社はその基盤を企業向け動画ライブラリからフィジカルAIへと広げる。自視点(一人称)映像向けの初モデルだと説明する。これは作業者が料理や部品組み立て、ロボット遠隔操作の際に撮影する種類の映像で、専用ハードと操作者を要することが多い遠隔操作データより大規模に集めやすいとTwelveLabsは主張する。
今回の公開はPegasus 1.5を土台にする。1.5のTime-Based Metadata機能では独自スキーマを定義し、動画からタイムスタンプ付きの構造化データを取得できる。Pegasus 1.6はクリップをまたいで手や物体、工具を追跡するエンティティ認識を強化し、大量処理の高速化と低コスト化も実現した。ロボティクス研究所やデータチームとの既存の協業と並んで登場するが、顧客名や成果の数値は公表していない。
焦点は、ロボティクスチームが普通の一人称映像を、実際の機械の動作を改善する学習データに変えられるかどうかだ。TwelveLabsはロボットの触覚やアクチュエータレベルのセンシングを置き換えるものではないと明言し、映像で起きていることを記述し、チームが自前のセンサーデータと組み合わせられるようにする役割だと位置づける。その組み合わせがロボット訓練を速めるか、自視点映像が同社の主張通り拡張可能かが、既に試験中の研究所の外にこの手法がどれだけ早く広まるかを左右しそうだ。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
中国製物流ロボットが日本で普及し、トヨタやコマツなどが採用

三菱重工とAlgomatic Dynamicsは、熟練者と訓練生の映像を比較し滞留時間や軌道の違いを指摘するTIG溶接向けAI動画解析ツールを開発

AppLovinが生成AI動画ツールの遅延と広告モデル改善鈍化の開示をめぐり、米国で連邦証券詐欺集団訴訟に直面した

大和ハウスのCVCが、産業用ヒューマノイドロボットを開発する米ペルソナAIに出資した

テキサス大学オースティン校のRohan Ghuge氏が率いる研究で、自律走行体は経路を2〜3回再計算するだけで、完全適応型の経路計画の利点のほとんどを得られることが分かった

PhAI Labs率いるチームがJEPA-Anythingを発表
