AIToday
大規模言語モデルロボティクスZenn AI/ML掲載日時: 2026年10月9日 22:00

OpenAI APIでアーム操作

LINEで送る
OpenAI APIでアーム操作

OpenAIのDecisions APIでgpt-6-lunaを使い「おもちゃが見えるか」「左か中央か右か」に答えるパイプラインを構築しSO-101アームを動かした。各判断は約0.3~0.7秒。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

このプロジェクトは、ロボット専用の学習済みモデルを使わずにClaudeとMCPでSO-101アームを動かした以前の実験を直接土台にしている。それは成功し、アームはオレンジ色のイグアナのおもちゃを掴んだが、1回の判断に数秒かかり、それを何十回も繰り返す必要があったため、プロセス全体が遅かった。今回の試みでは、自由形式のモデル出力を、固定の問いに対する確率を返す型付きAPIに置き換えた。これにより著者によれば答えがより安定し、確信度が低いときにロボットに何もさせない能力が向上した。

記事は、難しさが実際どこにあるかについて率直だ。関節角度を直接加算すると、肩と肘を回転させるとグリッパーの高さも変わるため、アームがテーブル上を這うように動いた。逆運動学に切り替えると概念は修正されたが、新たな問題が表面化した。手首が副作用として−75°から−145°まで回転し、アームは基部から30cmの地点で止まり、カメラ搭載視点では「画像の左」がずれ、画像の方向とテーブルの方向の対応がカメラの取り付け方に依存するため、アームが意図した方向と逆に動いたこともあった。著者は最終的に、アーム自身にポーズを取らせ、グリッパーをマーカーとして使って自分のカメラの向きを測定させ、またURDFを信頼するのではなくlerobot-calibrateが記録した実際の関節限界を読み取ることで、人間をループから外した。

ここまでの結果は、完成したタスクというより動作するパイプラインとして提示されている。著者は、成功した試行を後で模倣学習データとして使えるよう、実行をruns/に記録していると述べ、将来のハイブリッド構成として、π0.5のような学習済みポリシーが細かな位置合わせを担い、Decisions APIはグリッパーが実際にターゲットを掴んだかどうかの判断などに取っておく構想を挙げている。

よくある質問
OpenAI Decisions APIとは何か?
画像やテキストを入力とし、それらに関する問いへの型付きの答えを返すAPI。述語(条件が真である確率)、選択(1つの選択肢と各選択肢の確率)、スコアに対応する。座標や文章は返さない。
コストはいくらで、どのモデルを使うのか?
執筆時点ではパブリックベータで、利用できるのはgpt-6-lunaモデルのみ、価格は入力100万トークンあたり0.10ドルで、出力は無料だった。
以前の手法と比べてどれくらい速いのか?
著者によれば1回の判断あたり約0.3~0.7秒で、1回の判断に数秒かかっていた以前のClaude × MCP方式よりはるかに速い。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へOpenAI、ロシアとイランの工作アカウントを停止