AIToday

脳波がロボット学習データに加わる

TechCrunch AI3時間前LINEで送る
脳波がロボット学習データに加わる

要点

データツール企業 Encord が、脳波測定によってロボット学習データを改善できるかをテスト中。スタートアップは眼球運動と脳活動を両方追跡するヘッドセットをパイロットに装着させて物理作業を実施させ、エラーと意図といった精神状態をキャプチャすることを目指している。試験はロボット企業が現実世界の学習データの深刻な不足に直面しているなか実施されており、この制約は物理 AI の進歩にとってモデル設計そのものより重要な要因になる可能性がある。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    AI モデル学習向けデータツールを開発する Encord が、ドイツの神経科学スタートアップ Zander Labs との試験を進めている。ロボット学習データに脳波測定値でタグ付けするもので、眼球運動と脳活動を追跡するヘッドセットを装着したパイロットが、ジェンガのブロック引き抜きなど物理的作業を実施。エラーや意図、驚きといった精神状態をキャプチャしたアノテーション付き学習データを生成している。

  • なぜ重要か

    ロボット業界は現実世界の物理的学習データの極度の不足に直面しており、この制約がモデルアーキテクチャそのものより重要になる可能性がある。Encord の内部分析によれば、ロボットに大規模言語モデルがインターネットテキストで達成した水準の操作能力を教えるには、YouTube の動画コーパスの約 5 倍の規模のデータセットが必要になるという。物理データはスクレイピングではなく製造する必要があるため、高品質なラベル付き学習データのコストと希少性がビジネスのボトルネックになっており、脳波信号はモデル学習にとって最も重要な時点を明らかにして効率を向上させる可能性を持つ。

  • 注目点

    Encord は脳波でタグ付けされたデータが実際にロボットモデルの性能を改善するかどうかを評価する試験として実施中で、スケール拡大を決める前の段階にある。同社の San Leandro 倉庫では筋肉の電気信号を検出する前腕センサーを使って 3D 手の位置データを作成するなど、他の新しいデータモダリティも実験中。Encord は世界中の工場から自己視点動画を取得し、遠隔操作ロボットアーム(リーダーフォロワーリグ)を使って特定タスク向けの学習データを生成している。

詳細

カリフォルニア州 San Leandro の倉庫では、Encord のパイロット(同社がロボット訓練者に付ける名称)の一人、Andrew Ceja が、眼球運動を追跡するカメラ搭載のヘッドセットを装着してジェンガから木製ブロックを慎重に引き抜いていた。しかし、このヘッドセットには追加のイノベーションが含まれていた。彼が作業する中での脳波を計測するセンサーである。機械視覚アプリケーション向けのデータアノテーションを支援するために設立されたデータツール企業 Encord は、ドイツの神経科学スタートアップ Zander Labs と提携して、脳活動の計測がロボットの学習データを拡張できるかどうかをテストした。

試験は基本的な認識から生まれた。ロボット業界は現実世界の物理学習データの深刻な不足に直面している。Encord のロボット学習責任者で OpenAI のロボット研究室と倉庫自動化企業 Berkshire Grey の経験者である Vineeth Velmurugan は、「データが単に存在しない」と説明した。Encord のロボット顧客が操作のエンドツーエンド学習を追求し始めた際、同社はデータを単に管理するのではなく、製造する必要があることに気づいた。Velmurugan は、ロボットが大規模言語モデルが達成したような種類のブレークスルーに到達するには、YouTube 全体の動画コーパスの約 5 倍の規模の学習データセットが必要になると見積もっており、これがなぜデータ生成がそれ自体でビジネスになっているのかを説明している。

Zander の貢献は精神状態の推論に焦点を当てている。当該作業を監督する Zander の神経科学者 Lucas Gehrke によれば、特定のタスク中に使用された脳活動の量は、モデルが最高性能の計算をいつ展開する必要があるかについてのヒントを提供する。Encord の計画は、初期の脳波でタグ付けされたデータセットを構築し、顧客ロボットモデルを通して実行し、スケール拡大を決定する前に実際に性能を改善するかどうかを評価することである。並行して、San Leandro 施設は他のデータモダリティを追求している。パイロットがペアのロボットアーム(リーダーフォロワーリグ)を操作して、コーヒー注ぎ、ポーカーチップの積み重ね、サーバーバックからのイーサネットケーブルの抜き差しなど、特定の操作タスク向けのデータを生成する。一方、別の新興モダリティは前腕センサーを使って筋肉の電気信号を検出し、動画だけでは取得できない場合に 3D 手の位置を推論することを可能にしている。Encord はすべてのデータセットに密集した物理的説明(「右手がボルトを締める」)でアノテーションを付け、LLM ベースのモデルがタスク内容を理解するのを支援している。Velmurugan の分析によれば、この種のアノテーションは、特定タスク訓練用としてはアノテーションなしの自己視点データの 100 倍の価値があり、製造コストは 20 倍にとどまるという。ただし、価値向上と比較して経済的に有利であるにもかかわらず、この 20 倍のコスト乗数は実質的な障壁のままであり、LLM 訓練用にインターネットテキストをスクレイピングするのにかかる無料同然のコストと根本的に異なる。パイロットの Ceja と Infante は両者とも別の AI データアノテーション企業 Scale 出身で、施設の約 12 人の労働者は物理 AI モデルの構成要素を製造する急成長する労働力の一部を形成している。

背景と解説

物理 AI を制限する要因はモデルアーキテクチャから、現実世界の学習データの単純な希少性へとシフトした。インターネットから無料同然でスクレイピングしたテキストで構築された大規模言語モデルと異なり、ロボットは手作業で行われ、物理的に根ざした学習データが必要であり、それを意図的に製造する必要がある。Encord が単なる顧客データ管理から製造へとピボットしたことはこの新しい現実を反映している。同社は、ロボット企業が操作タスクのエンドツーエンド学習を試みるにあたり、「データが単に存在しない」ことに気づいた。この経済的シフト――収集から製造へ――は物理 AI 開発全体の方程式を変える。

Encord の脳波測定に関する実験は、各学習サンプルの情報密度を高めるための試みである。動画だけでなくパイロットの精神状態(エラー検出、意図、驚き)もキャプチャすることで、モデル訓練用のより豊かな信号を生成することを目指している。そのような密集したアノテーションが生動画の 100 倍の価値があり、製造コストは 20 倍にとどまるという Velmurugan の主張は、本当の効率向上を示唆している。ただし「20 倍以上のコスト」は依然として実質的なコスト障壁である。同社の多くモーダル的アプローチ――自己視点動画、遠隔操作ロボットアーム、筋肉の電気信号、そして脳波を組み合わせる――は、ロボット業界での次の競争優位は最高忠実度の学習データを最も効率的に製造できる者のものになるという、より広い賭けを反映している。

よくある質問

脳波ヘッドセットは何を計測するのか
Zander Labs が開発したヘッドセットは脳活動を計測してエラー、意図、驚きといった精神状態を推論する。Zander の神経科学者 Lucas Gehrke は、タスク実行中のいかなる時点での脳活動量も、最高性能のモデルをいつ展開する必要があるかを判断しようとするモデル開発者にとって手がかりになると説明した。
アノテーション済み物理学習データと生動画ではコストにどの程度の差があるか
Velmurugan は、密集したアノテーション(「右手がボルトを締める」といった物理的説明)を施したデータは、特定タスク訓練用としてはアノテーションなしの自己視点動画の 100 倍の価値があり、製造コストは 20 倍にとどまると見積もっている。
ロボットが大規模言語モデルが達成した水準に匹敵するには、どれだけの学習データが必要か
Velmurugan は、ブレークスルーに到達するには YouTube 全体の動画コーパスの約 5 倍の規模のデータセットが必要になると述べており、この規模がなぜデータ生成そのものが単なる研究課題ではなくビジネスになっているのかを説明している。

「ロボティクス」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます