AIToday

ヒューマノイドロボット産業、AI技術より人間操作に依存

The Robot Report17時間前
ヒューマノイドロボット産業、AI技術より人間操作に依存

要点

ヒューマノイドロボット産業は過去18ヶ月で数十億ドルの資金調達を行ったが、その多くが人間労働者にロボットを遠隔操作させるための給与として密かに使われている。この手法が物理AI システムの学習の主流となっている。問題は、テレオペレーションのデータセットが言語・ビジョンモデルのものより10万倍以上小さい上に、現実世界は常に変化する(ドアの位置が変わる、棚が動く、新しい荷物タイプが出現する)ため、あらゆるバリエーションに対して新たな人間デモンストレーションが必要となり、データの問題は労働力が対応できるスピードより速く増加する。ロボットが真に機能するために人間からの恒久的な入力が必要なら、それは人間労働を代替するのではなく、単なる労働システムである。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    ヒューマノイドロボット産業は過去18ヶ月で数十億ドルの資金調達を行ったが、その大半は遠隔操作(テレオペレーション)でロボットを操作する人間労働者の雇用に充てられており、真の自律システムの構築ではない。テレオペレーションのデータセットは現在の言語・ビジョンモデルの学習に使われるものより10万倍以上小さく、人間は変化する現実世界に対応するための新たなデモンストレーションを必要なスピードで提供できないため、オペレーターを増やしてもこのギャップは埋まらない。

  • なぜ重要か

    ヒューマノイドロボットの本来の売り文句は、高齢化と労働不足により人間が担えなくなった労働を代替することだ。しかし、ロボットが機能するために人間のデモンストレーションの恒久的な流れを必要とするなら、それは自律性の解決策ではなく、単なる労働システムにすぎない。つまり企業は人間労働への依存を深め続けるインフラを構築している可能性があり、問題を解決していないのだ。

  • 注目点

    シミュレーション環境での強化学習が代替手段となる可能性がある。テレオペレーションと異なり、強化学習システムはループ内に人間オペレーターを必要とせず、数百万回の試行錯誤を通じて学習し、シミュレーション環境ではその訓練を直接的に計算力でスケールできる。より多くのGPUで高速な反復が可能になり、人間労働の利用可能性に制限されない。

詳細

Flexion のco-founder兼CEOのNikita Rudinは、ヒューマノイドロボット産業は進歩に見せかけたデータの罠に陥っていると主張している。過去18ヶ月でヒューマノイドロボット企業は数十億ドルを調達したが、その大半はロボットを遠隔操作する人間労働者の給与に密かに充てられている。この実践はテレオペレーション(遠隔操作)として知られ、物理AI システムの学習の主流手法となり、多くの資本を集め、業界の進歩の証拠として熱心に報道されている。しかし Rudin は、この手法の根底にある前提、すなわち十分なデモンストレーションが最終的に実環境全体で一般化できるロボットを生み出すという仮定に、より多くの精査を向ける価値があると主張している。

核心的な制約はスケールである。テキストで訓練された言語モデルはAI時代以前に蓄積された数十年分の執筆物、記事、書籍から利用できる。ロボットにはそうしたアーカイブがない。すべてのデモンストレーションを人間が生成する必要があり、データは人間労働の速度でしか増加できない。より重要には、テレオペレーションのデータセットは現在の言語・ビジョンモデル学習に使われるデータセットより10万倍以上小さい。このギャップはオペレーターを増やしても埋められない。現実世界は静的ではないからだ。棚が動き、ドアハンドルが少し異なり、組立ラインに新しい荷物タイプが現れる。あらゆるバリエーションに新たなデモンストレーションが必要になる。問題は労働力の拡大より速く増加する。データ品質が別の難しさを加える。オペレーターは触覚を感じられず、深度判定も信頼できないため、動きが遅く過度に補正し、ロボットはコントローラーを扱うのに苦労する人間の映像から学習することになる。つまり、ロボットがそうした苦労を実践することになるのだ。

業界の対応は労働者をより多く採用することで、主に低賃金経済地域の労働者を募って家事ビデオ撮影、ロボット遠隔操作、またはカメラ装置を装着した施設移動を行わせている。テレオペレーションデータを、かつて企業が言語モデル用にラベル付きテキストを販売していたのと同じ方法で販売するスタートアップが、中国、インド、ヨーロッパ、米国全体で出現し、商業エコシステムが生まれている。皮肉は鮮烈だ。ヒューマノイドロボットの本来の売り文句は、人口動態シフト、労働不足、高齢化により人間が担えなくなるジョブを埋めることである。しかし、業界が実際に構築しているものが新しいことに対応するために恒久的な人間デモンストレーション流を必要とするなら、その人間たちはむしろ直接その仕事をしたほうがいい。新しいもので対応するために新たな人間入力が必要なシステムは、本質的には単なる労働システムである。

標準的な弁明はテレオペレーションは橋である、つまりより優れたロボット訓練技術が追いつく間の一時的な手法だという主張である。限定的で繰り返しのタスクが管理された環境にあれば、その議論はいくぶん成り立つ。しかし、業界の多くは無限にデモンストレーションを生成するためのインフラを構築しており、その依存がどのように、いつ終わるかについて明確な説明がない。この分野は進歩のように感じるメトリクスを追跡している。デモンストレーション数の増加、記録されたフッテージの時間、管理された設定内で完了したタスク。だが、これらのメトリクスはロボットが特別に設定されていない環境で以前見たことのないもに対処できるかどうかを明かさない。より多くのテレオペレーション基盤を構築することは、人間への依存を解決するのではなく深める。

Rudin は強化学習が前進の道だと指摘する。言語モデル研究者が大量のテキストで初期システムを訓練した時、シェークスピアのスタイルを模倣できるが完全には意味をなさないシステムが生まれた。ブレークスルーは合成環境での強化学習によってもたらされ、推論、コーディング、複雑な指示に従うことができるシステムが生まれた。ロボット産業は主にその初期模倣段階に留まっている。テレオペレーションデータをスケールすることは、10万倍少ないデータでの事前学習のスケールに相当する。腕をやや動かし、ときどき何かを掴み、ときどき失敗し、人間オペレーターが示したことをうっすら模倣できるが、見たことのない状況を論理的に解決できないロボットが得られる。エゴセントリック動画キャプチャとUniversal Manipulation Interface(UMI)のようなデバイスなど中間的なアプローチがある。UMIはオペレーターがロボットを遠隔制御するのではなく、ハンドヘルドグリッパーを装着してより自然にタスクをデモンストレーション可能にし、オペレーター負担を軽減してやや自然な動きデータを生成する。これらは限定的で明確に定義されたタスクの有用なステップストーンになるが、業界の人間への依存全体を解決しない。強化学習がこれを変える。人間オペレーターを模倣するのではなく、強化学習で訓練されたシステムは試行錯誤によってものごとを理解し、タスクを試し、失敗し、調整し、ループ内に人間がいないまま数百万回の反復を重ねて再度試す。シミュレーションは自然に続く。数百万回のRL反復を現実世界で実行するとハードウェアが破壊され、年がかかる。しかしシミュレーションではインスタントにリセット可能で、並列実行でき、人間労働力がいかなる規模でも達成できない規模でバリエーションを生成できる。テレオペレーションと異なり、シミュレーションでのRL は計算力に直接スケールする。より多くのGPUでより多くの環境、より多くのバリエーション、より高速な反復が可能になる。

背景と解説

ロボット産業は、その資金調達戦略の大半が対処していない構造的課題に直面している。過去18ヶ月でヒューマノイドロボット企業に数十億ドルが流入したが、その大部分がロボットを遠隔操作する人間労働者の雇用に充てられている。この記事はこのデータ生成手法を、技術的な橋渡しを装った永続的な労働解決策として説明している。基礎となる前提は、十分なデモンストレーションが最終的に新しい環境に一般化できるロボットを生み出すというものだが、数字がこの道筋を支持していない。テレオペレーションのデータセットは現在の言語・ビジョンモデル学習に使われるものより10万倍以上小さく、この差はオペレーターを増やしても埋められない。

根本的な課題は、現実世界が静的ではないということだ。棚の配置が変わり、ドアハンドルが異なり、組立ラインに新しい荷物タイプが到着する。あらゆるバリエーションに新たな人間デモンストレーションが必要となり、データ生成の問題は労働力の拡大より速く増加し、より多くの労働では乗り越えられない構造的な壁を生む。データ品質がこの問題を複雑にする。コントローラーを通じて作業するオペレーターは触覚を感じられず、深度判定も信頼できないため、動きが遅く過度に補正し、ロボットにコントローラーとの格闘を実践させるのではなく、効率的にタスクを遂行することを教えない。

この記事が指摘する代替手段はシミュレーション環境での強化学習である。人間デモンストレーションを収集する代わりに、強化学習システムは合成環境内で数百万回の反復を通じて試行錯誤で学習し、ループ内に人間がいない。このアプローチは計算資源に直接スケールする。より多くのGPUでより高速な反復と環境バリエーションが実現するが、テレオペレーションは人間労働に限定される。この記事の主張によれば、産業が真の自律性に向かうためには、人間への依存が実際に時間とともに減少しているかどうかを測定する必要があり、そうしたメトリクスがなければテレオペレーションは一時的な橋ではなく永続的な手法となる。

よくある質問

テレオペレーションデータは言語モデルの学習データのようにスケールしないのはなぜか?
言語モデルはテキストから学習する際、AI時代以前に蓄積された数十年分の執筆物、記事、書籍を活用できる。一方、ロボットの場合はそうしたアーカイブが存在しない。すべてのデモンストレーションを人間が生成する必要がある。さらに、現実世界は常に変化する(棚が動く、ドアハンドルが少し異なる、新しい荷物タイプが出現する)ため、あらゆるバリエーションに新たなデモンストレーションが必要で、問題は労働力が対応できるより速く増加する。
この記事が提案する代替手法は何か?
シミュレーション環境での強化学習である。人間オペレーターを模倣する代わりに、強化学習で訓練されたシステムは試行錯誤を通じて、人間がループ内に存在しないまま数百万回の反復で物事を解決する。シミュレーション内で数百万回の反復を実行することは計算力に応じて直接スケールする。より多くのGPUでより多くの環境とより高速な反復が可能になるが、テレオペレーションは人間労働の利用可能性に制限される。
テレオペレーションのデータ品質の問題は何か?
オペレーターは触覚を感じられず、深度判定も信頼できないため、動きが遅く過度に補正する。これによってロボットはコントローラーを扱うのに苦労する人間の映像から学習することになり、ロボットはそうした苦労する様子を実践することになる。

「ロボティクス」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます

毎朝1分、AIの要点だけ。

200媒体以上・Email/LINE/Slack 対応

無料で受け取る →