ヒューマノイドに「教科書データ」が足りない理由
今回のテーマは、ヒューマノイドとフィジカルAIにおけるデータビジネスです。前回のゲスト吉川さんの回でもデータの話が出ており、佐野さんはそれをビジネスと技術の観点からもう少し深掘りしたいと切り出しました。
本題の前に、佐野さんは吉川さんが紹介したUBTECH ── 中国のロボットメーカー。人型ロボットの開発・販売を手がけ、人間に近い外見の機種も発表していますのU1シリーズの中に、横山さんにそっくりな顔のモデルを見つけたと報告します。横山さんは「僕のデータ盗まれてるんじゃない?」と返し、スタジオは笑いに包まれました。
僕が乗り換えやすいボディが一個できたってことですね。
本題に入ると、樋口さんは、AIの頭の良さはすでにかなり完成していて、あとはどんなデータを与えるかで成長が決まる段階に来ているのではないかと問いかけます。
佐野さんによれば、LLMなどのAIが2〜3年で爆発的に成長できたのは、人々がインターネット上に大量の情報をアウトプットしてきたからです。AIはそれを教科書として拾うことができました。
ヒューマノイドとかフィジカルAIっていうのは、その教科書データみたいなものが本当に少ないんですよね。
ヒューマノイドの教科書データが少ない理由として、佐野さんは2点を挙げます。1つは、人間の目の高さから、人間が手を動かしている様子を撮った映像がほとんど存在しないことです。監視カメラなどの映像はあっても、一人称の視点では撮れていません。
もう1つは、ヒューマノイドが1体ごとに形や関節、腕の長さが違うことです。そのため機体ごとに動きを教え、映像で撮って分析する必要があり、データづくりに時間がかかっています。
佐野さんは、この状況を打ち破るかもしれないものとして、物理法則から計算して先を予測する「ワールドモデル」を挙げました。ただし、仮想空間だけで済むわけではなく、バーチャルと現実にはズレがあるため、現実のデータを撮り続ける必要は残ると補足しています。
体で覚えるVLAと、頭で先読みするワールドモデル
ロボットの脳の仕組みについては、横山さんが整理します。主流は2つあり、1つ目はVLA ── Vision-Language-Actionの略。カメラで見た情報を言語的に理解し、ロボットの動作に変換するAIモデルの方式ですと呼ばれる方式です。
まず一個目がVLAって呼ばれて、見たものを言語情報で理解してアクションに落とし込むっていうものなんですよ。
横山さんの説明では、VLAはコップを取る動作などを何度も繰り返し練習させることで覚える、いわば「体が勝手に動く」タイプの脳です。人間が自転車に乗るとき、毎回考えなくても体が動くのに近いといいます。
もう一方のワールドモデルは、行動を起こす前に頭の中で「この状況なら次の瞬間こうなる」と想像する力をロボットに与える方式です。例として挙がったのはジェンガで、ここを抜いたら崩れそうだと行動前に考える能力にあたります。
繰り返し練習で覚え、見たものから瞬時に体が動く。慣れた道を自転車で走るような使い方
行動の前に物理法則から次の瞬間を予測する。ジェンガで崩れ方を先読みするような使い方
人間はこの2つを無意識に切り替えています。いつもの道は身体感覚で走り、初めてのカーブでは「この角度で入ったら転ぶ」と考えながら進みます。研究ではこれをロボット向けに言語化し、2つの派閥として進めているといいます。
佐野さんは、ワールドモデルの処理をステップに分けて紹介しました。この流れによって、人力なら1時間で1時間分しか取れなかったデータが、1時間分を元に10時間先の分まで検討できるようになるといいます。
生成
先の動作の映像を大量に生成する
審査
別のAIが、物理法則に反していないかをチェックする
採用
審査を通ったものだけが教科書として使われる
樋口さんが「つまり教師データをAIで生成できるということ」とまとめると、佐野さんは同意します。そうなれば今のAIに近いほどデータ量が増え、指数関数的に伸びる可能性があると言われているそうです。人がデータを集めるモデルが「全部不要になるとまでは言わないが、壊れる可能性はある」というのが佐野さんの見立てです。
データ収集の3つの手法は何が違うのか?
吉川さんの回で出た、人がグローブをつけて作業する「データファクトリー」の話を受けて、主流のデータ収集方法が3つに整理されました。後に佐野さんが「ヨコちゃんが言ってくれてた」と触れているとおり、この整理は横山さんによるものです。
1つ目は遠隔操作です。Play Roboticsが小学校で開いたイベントでも、子どもたちがVRゴーグルとコントローラーを使い、手を前に出すとヒューマノイドも同じように手を出す仕組みを使いました。操作中の各関節の動きやモーターの回転量がデータとして取れます。
2つ目は人間の動画の流用です。人間の目線で作業したときの手元や指先の動きを一人称視点の動画で撮り、学習データにします。ただし、どのくらいの力で物を掴んでいるかは動画だけではわからず、力触覚 ── 物に触れたときの力の強さや手ざわりを感じ取る感覚。ロボット分野では、これをセンサーで計測・再現する研究が進んでいますの情報をどう扱うかは今も議論されています。
3つ目はシミュレーションです。摩擦係数や重力、物の大きさなどの変数を変えたパターンを無限に生成し、GPU上で何万時間分も試します。現実では数秒なのに、パソコンの中では数万時間が経っているという状態を、ドラゴンボールの「精神と時の部屋」に例えていました。
| 手法 | 強み | 課題 |
|---|---|---|
| 遠隔操作 | 関節やモーターの動き、触った感触を実機で取れる | 人が操作する分、量を増やしにくい |
| 一人称視点動画 | 人間の手元や指先の使い方を学べる | 掴む力の強さが動画からはわからない |
| シミュレーション | 条件を変えて大量のデータを作れる | 質感の再現が粗く、現実とのギャップが出る |
シミュレーションの課題について、樋口さんは「ボールの跳ね方くらいなら物理シミュレーションでいけるのでは」と尋ねます。返ってきたのは、物の表面のザラザラ感などの素材感は、粗いモデルはあっても100パーセント同じ質感を再現する数式はまだできていない、という答えでした。
どの手法にもトレードオフがあり、どれが一番優れているとはまだ言えない、というのがこのパートの結論です。樋口さんは、人間もゴムのコップとガラスのコップでは掴み方を変えていると納得していました。
1時間いくら?「たまにミスする人」のデータが強い理由
佐野さんは、質感が特に問題になるのが清掃や家事だと指摘します。液体のヌルヌルや、クシャッとなる布の扱いは難しく、だからこそ遠隔操作や手・ゴーグルに付けたカメラで撮る人間のデータが重要になるといいます。
では、そのデータにどれくらいのコストがかかっているのか。佐野さんがAIに相談して試算したところ、次のような数字が出たといいます。
ただし、118ドルでそのまま売れるわけではなく、実際の売値はもう少し安くなるそうです。それでもデータを欲しがる企業は多く、データを売って稼ぐ人も現れています。背景には、未来の利益を見込んで投資家が資金を出していることがあります。
佐野さんは、データを取る会社になれば、そのデータをベースに多くのロボットが動くため、中央のポジションを取れると話します。吉川さんの回で出た「ボディではなく中身に価値がある」という話は、こういうことだと受け止めています。
樋口さんは、包丁で魚をさばくような習熟が必要な動作のデータは、上手な人でないと取れないのではと考えました。ところが佐野さんは、熟練者のデータだからいいとは限らないと返します。
めっちゃ熟練してる人のデータだからいいってわけでもないみたいなんですよ。
佐野さんが紹介した論文によると、完璧なプロは迷いなく動くためデータにばらつきが出ず、物を落としたときのようなミスからのリカバリー動作が含まれません。プロのデータだけで学習させた成功率は約52パーセントでしたが、たまにミスする人のデータを使うと約68パーセントまで上がったといいます。
この話から佐野さんは、スキマバイトサービスのTimee ── 短時間・単発で働けるスキマバイトのマッチングサービス。事前の面接なしで働き始められる仕組みが特徴ですの担当者が、フィジカルAI用のデータ取得に取り組むと話していたことを紹介します。初めての人がミスとリカバリーを繰り返すデータが取れ、タスクも小さく簡単に切られているため、ロボットが最初に扱うのにふさわしいデータになるのではと見ています。
樋口さんは、そう考えるとほとんどの動作がデータとして価値を持ち、人間が生きているだけで価値が出てくると話を広げました。佐野さんも「生きてるだけで技術の発展に役に立つようなことが起きそう」と応じています。
中国の国家規模の訓練基地と、日本のデータ共有の動き
吉川さんが「中国はやばい」と話していた件について、佐野さんが調べた内容を紹介します。北京には「身体知能ロボットデータ訓練基地」があり、120機種以上の主要ロボットが訓練を受け始めているといいます。
身体知能とは、画面の中で会話するAIとの対比で、体を持って現実世界で動くAIを指す言葉だと佐野さんは説明しています。
この基地では、家庭内サービス、小売、オフィス業務、産業生産、医療、ヘルスケアの6分野でシナリオが作られています。約1万平方メートルの施設に16の訓練シナリオがあり、約100体のヒューマノイドが一日中作業を反復しているそうです。2025年12月時点で、40か所以上のデータ収集センターも発表されています。
さらに、横山さん似のロボットを出しているUBTECHは、データセンター向けに5億6600万元分のロボットを販売しているといいます。佐野さんは、ヒューマノイドが「売れている」と言われる裏では、国に売ってデータを取っているケースが多いと指摘します。大学の研究開発用にユニツリーのロボットが大量に売れているという話も、同じ構図だとしています。
日本がね、ロボットに勝つには、もう国が頑張らないと難しいっすよね。
日本では、データを各社で囲い込まず、日本全体で共有資産にしようという動きが出ています。佐野さんによると、高市政権が今年1月に現場データを活用したプラットフォームづくりを打ち出し、経済産業省の資金でAIロボット協会(AIRoA) ── 日本のAIロボット開発のために設立された協会。多様なロボットの動作データを集めて共有する基盤づくりを進めていますが現場の稼働データを集めるプラットフォームを作り、大企業が参画しているそうです。
樋口さんは「なんか日本っぽい」と感想を漏らしますが、佐野さんは理にかなっていると返します。1社のロボットだけで学習するより、複数社の機体のデータを混ぜたほうが賢くなるという論文があるといいます。
単体のロボットのデータだけで学習:約42.8パーセント
片腕・両腕・四足歩行など22種類の機体のデータを混ぜて学習:約75.8パーセント
佐野さんはこれを、自転車に乗れればバイクの乗り方もなんとなく掴める感覚に例えます。ファナックや安川などの産業用ロボットのデータを共有プラットフォームでミックスすれば、より優れたロボットの脳ができるというわけです。
樋口さんも、多様なパターンから共通因子を見つけられるのだから当然だと同意します。人間も、学校・塾・親のように複数の先生から学んだほうが共通点と違いがわかって賢くなる、と例えていました。
1X「NEO」はなぜユーザーがお金を払ってデータを差し出すのか?
佐野さんが「さすがだ」と感じた事例として挙げたのが、ノルウェーの1Xです。1Xは月7万5000円のサブスクで家庭用ヒューマノイド「NEO」を提供していて、Play Roboticsも予約購入済みですが、まだ届いていないそうです。
佐野さんによると、NEOは買ってすぐに何でもできるロボットではありません。基礎的な動きはできるものの、知らない家事に出会うと1Xの遠隔オペレーターを予約でき、人間が代わりに操作してやり方を見せるといいます。
佐野さんが恐ろしいほどすごいと感じたのは、この構造です。ユーザーはサブスクや一括払いでお金を払い、自宅にNEOを置きます。そして、オペレーターに作業を頼むたびに、ロボットの学習データが生まれます。
企業がお金を払い、アルバイトなどの人にデータを取ってもらう
ユーザーがお金を払って自宅にロボットを置き、オペレーターへの依頼を通じてデータを提供する
樋口さんは、アプリが行動データの送信許可を求めてくるトラッキングデータと同じだと気づきます。佐野さんはさらに、お金を払ってイベントスタッフをするオンラインサロンの仕組み(金子みすぞうさんの名前が挙がっています)になぞらえ、それをビジネスモデルとして組み込んだ点を面白いと評しました。
樋口さんは、各家庭が実験場になる点にも注目します。間取りも家主の性格も違う家で集めるため、理想的な一か所で集めるよりデータが多様になります。佐野さんは、買うのは今のところお金持ちや専門業者で、楽しくていろいろ覚えさせたいモチベーションの高い人たちが協力してくれる構造だと付け加えました。
偏ったデータになるかもしれないですけどね。椅子代わりに使われてるデータだけいっぱいあるみたいな。
一方で樋口さんは、人類全員でロボットを育てるなら倫理観が必要だと指摘します。差別的なコメントを浴び続けて差別的な発言をするようになったAIが過去にあったことを挙げ、悪意があればハックできてしまうと懸念を示しました。
ここ(ロボットの学習)、そろそろ倫理観とセットにしないと危ねえなって思いましたね。
最後は、リスナーと遠隔操作で交代しながら、大根をフレンチの修行のように正方形に切る動作を覚えさせたいという話で盛り上がります。佐野さんは「ゴーグルを買ってくれればできる」「下手な人でも大歓迎、むしろそのほうが上手くなる」と話し、樋口さんは失敗も価値になる時代だと締めくくりました。
まとめ
ヒューマノイドは、ネット上の文章で育ったAIと違い、一人称視点や触覚のデータが決定的に不足しています。その穴を埋めるため、収集手法の工夫、国家規模の投資、データ共有、そしてユーザー自身がお金を払ってデータを提供する仕組みまでが動き出しています。
- ロボットの脳には、繰り返しで体が覚えるVLAと、物理法則から先読みするワールドモデルの2つの主流がある
- データ収集は遠隔操作・一人称視点動画・シミュレーションの3手法が主流で、いずれもトレードオフがある
- 熟練者よりたまにミスする人のデータのほうが、リカバリー動作を含むため成功率が上がったという論文がある
- 22機種のデータを混ぜると成功率が約42.8パーセントから約75.8パーセントに上がったとされ、日本ではAIロボット協会がデータの共有資産化を進めている
- 1XのNEOは、ユーザーがお金を払って家庭にデータ収集装置を置くという逆転の構造を持ち、倫理観の必要性も議論された





