2026年はなぜ「量産元年」なのか
この回のテーマは「ヒューマノイドの進化は今どこまで来ているのか」です。佐野さんは、前回話したヒューマノイドの基本や市場の話を受けて、最新情報が次々と更新されている今、収録時点での現在地を届けたいと話します。
佐野さんが2026年のヒューマノイドを一言で表すと「量産元年」です。ただし佐野さん自身、「言われていて、っていうか僕が言ってるだけなんですけど」と笑いながら付け加えています。
これまでロボットっていっぱい作られてきて、「すごいよね」とか「もうすぐ使えそうだよね」って言ってたんですけど、なかなか進歩しなくて。
佐野さんが転機として挙げたのが、2026年1月のCES ── 毎年1月に米ラスベガスで開かれる世界最大級のテクノロジー見本市。家電やIT、自動車などの新製品・新技術が発表されますです。ヒューマノイドがほぼ主役となり、工場で実際に働いている事例や、企業の顧客が決まったこと、出荷スケジュールが発表されたといいます。
樋口さんはこれを聞いて、社会実装がかなりリアルになってきたと受け止めています。
佐野さんがもう一つ挙げたのが中国の存在感です。電気自動車(EV)で培ったサプライチェーンがそのまま使え、センサーやバッテリー、モーターを共有できるため、安く大量に作れる環境が整ってきたと説明します。
その結果として、中国のUnitreeは、Figure AIやTeslaの約36倍の台数を出荷しているといいます。佐野さんは、これをもってヒューマノイドは大量生産の時代に入ったと見ています。
EVのサプライチェーン
電気自動車づくりで培った部品供給の仕組みがすでにある
部品の共有
センサー、バッテリー、モーターを転用できる
低コスト・大量生産
安く作れて、大量に生産しやすい環境が整う
出荷台数の差
UnitreeはFigure AIやTeslaの約36倍を出荷
最初に入るのはなぜ工場なのか
樋口さんの「今までも使っているところでは使っていたのか」という問いに対し、佐野さんは、これまでは実験や数台の試用にとどまり、大量生産まではいかなかったと答えています。
では、ヒューマノイドはどの分野から入ってくるのか。番組では、BMWの工場での部品の取り付けや、Xiaomiが自社工場で行っている作業の事例が紹介されます。
工場への導入は、まず動作の実験データを取るところから始まっています。生産ラインから別のラインへ荷物を運ぶ、別の階からパーツを持ってくるといった、これまで人がやるしかなかった作業の置き換えが多いといいます。
樋口さんは、車やスマホ・タブレットのように規格がある程度決まっていて、デザインが変わっても大きな変更がない現場から入っていくのだと整理しました。
工場が選ばれる理由は、ロボットの動きを乱す要素が少ないことです。店舗の中や屋外では、地面に砂があったり、お客さんと接触したりとイレギュラーが起きます。工場は床がフラットで風の影響も少なく、すでにロボットが稼働しています。
砂などで地面の状態が一定でなく、お客さんとの接触などイレギュラーが起きやすい
床がフラットで風の影響も少なく、すでにロボットが稼働しており外乱が少ない
おもろ。不確定要素があると大変やからっちゅうことか。
ロボットはどう動きを覚える? 模倣学習と強化学習
横山さんが今回取り上げたのは、ロボットの学習です。ものを運ぶといった動きをロボットにさせるには、何らかの学習ソースや訓練が必要になります。
横山さんによると、その訓練を効率よく進める方法は、これまで大きく2種類ありました。1つ目が模倣学習 ── 人間の手本となる動作データをもとに、ロボットやAIに同じ動きを再現させる学習方法ですで、人間が実際に作業したときのデータを取り、それをロボットにもやらせる方法です。
横山さん自身も、VRゴーグルなどを付けて手の動きを録画し、それをロボットに生かせないかを個人的に研究しているといいます。
2つ目が強化学習 ── 試行錯誤の結果に「報酬」を与え、より高い報酬を得られる行動を学ばせていく機械学習の手法ですです。例として挙がったのが、NVIDIAとディズニーが共同開発したオラフのロボットです。
このオラフのロボットは、3月末から実際のディズニーランドで稼働する予定だといいます。船の上でのパレードという足元が不安定な環境でも、オラフらしい可愛らしい動きで歩けるように作られています。
オラフのロボットの訓練では、まず「船のような不安定な環境でも転ばずに歩けるか」という報酬を設計します。そのうえで、パソコン内のシミュレーション環境に何万体ものオラフを生成し、競わせます。
転ばずに歩けるかどうかみたいなところの報酬設計をしといて、パソコン内のシミュレーション環境上で何万体のオラフを生成しといて、そこでバトルロワイヤルみたいなことをやるんですよ。
一番転倒せずに動けた個体が強い報酬を得て、次の実験に引き継がれます。これを繰り返し、転ばずにオラフらしく動けたものを採用していくのが、強化学習による進化のさせ方です。
未来を予測するAIと、仮想空間での大量の経験
横山さんは、模倣学習と強化学習の2つが進化していることに加えて、もう一つ面白い仕組みが出てきたと話します。NVIDIAが出したDreamZeroDreamZeroという、世界行動モデルと呼ばれる仕組みです。
世界行動モデルは、ロボットが映像などを見たときに未来を想像して動作を決める新しいアプローチです。人間があらかじめ設定したものから学ぶのではなく、ヒューマノイドロボットがこの世界の物理法則を理解するという考え方だといいます。
横山さんは人間の道具の使い方にたとえます。人間は道具ごとに操作を暗記するのではなく、投げたら落ちる、この摩擦なら滑りやすいので強く持つ、といった世界のルールを抽象的に理解したうえで、新しい道具にも対応しています。
なんかイラレ使えたらフォトショもなんとなく使えるみたいなやつね。
横山さんは、このように物理法則を踏まえて動きを決めることをフィジカルAIやヒューマノイドにも行わせるアプローチを、一つのブレイクスルーになるかもしれないと見ています。
この世界の今こういう状況ってことは、数秒後の未来こうなってるだろうっていう予測がロボットができるようになってきたってところですね。
背景にあるのはAIの発達です。横山さんによると、今のロボットはVision-Language-Action、つまりものを見て言語化し行動に落とし込む方法が主流で、その発展形として未来予測や物理的な状況を処理できるようになってきました。
横山さんは、ここ数年でLLMの進化によりAI業界が盛り上がったことに連動して、ヒューマノイドが適用できる領域も増えてきたと説明しています。
ここで樋口さんは強化学習の話に戻り、Googleの囲碁AIを例に出します。横山さんも、強化学習はその延長にあると答えています。
樋口さんの理解はこうです。模倣学習では実際のデータを大量に入れる必要があったが、強化学習では実データの代わりになる経験を仮想空間でいくらでも生成できる。横山さんはこれに同意し、条件を変えたシミュレーションを何万体にさせることの効果を語ります。
実世界で本来人間から模倣して学習する際だったら、10年間とかかけなければ蓄積できなかったデータが、もう高性能なパソコン上だったら1時間とか数十分とかで何十年分の経験ができる。
実機で同じことをすれば、ロボットが壊れるような動きもさせることになり、どれだけお金があっても足りません。横山さんは、コストの面でもシミュレーション上での学習が有効なアプローチとして確立してきたと話します。
樋口さんは、囲碁なら人間同士が打たなくてもAI同士の対局を一瞬で無限に作れたと振り返ります。そのうえで、最初は囲碁程度の単純な世界でしかできなかったことが、物理法則のある現実世界レベルでもできるようになってきたと整理し、横山さんも「おっしゃる通りです」と応じました。
YouTubeを見て動きを覚えるロボット
横山さんがもう一つ紹介したのが、roda.airoda.aiという会社が提唱した学習方法です。YouTubeなどに上がっている、人間がいろいろなことをしている動画から学習させるアプローチです。
YouTube上で人間が中華料理とか作ってる動画とかをひたすらAIが見ることで、それを学習してその動きを模倣できるようにする。
横山さんによると、これまでも工場の自動化では模倣学習が実践されていました。人間がコントローラーでロボットの腕を動かしたり、手袋型のセンサーを付けて物を動かしたりして、その動きを記録していたといいます。
動画から学べるようになれば、わざわざ記録する係を付けなくても、ある程度の動きができるようになります。樋口さんは、モーションキャプチャーのような入力装置が要らなくなる分、実世界から取れるデータの量も一気に増えると受け止めました。
コントローラーで腕を動かす、手袋型センサーを付けるなど、記録する係と専用の入力装置が必要
YouTubeなどの動画を見て学習し、記録係を付けなくてもある程度の動きを模倣できる
樋口さんはここまでの話を2点にまとめています。1つは、データとして使えるものが大幅に増えていること。もう1つは、そのデータを抽象的な領域でつなぎ合わせて処理するAIが発達していることです。
NVIDIAは「ロボティクスのAndroid」になるのか
続いて話題はNVIDIAに移ります。番組では、強化学習の分野でNVIDIAが一番を取るのではないかという見方が示されました。
NVIDIAについて、TechCrunchの記事は「ロボティクスのAndroid ── Googleが開発するスマートフォン向けOS。多くのメーカーが同じOSの上で端末を作る仕組みを広めましたになろうとしている」と表現しているといいます。樋口さんは「ロボットやから、アンドロイドがややこしい」と笑いながら確認していました。
番組で紹介されたのは、1Xの家庭用ロボットやFigure AIなど、有名どころのロボット会社がNVIDIAのプラットフォーム上で開発しているという状況です。NVIDIAのプラットフォームには5つほどの構成要素があり、ロボット開発の最初から最後までをカバーしているといいます。
その中心がロボットの「脳」にあたる部分です。演算能力の高いAIコンピューターに加え、データやシミュレーション環境もNVIDIAが提供しています。強化学習の環境は、世界中のロボット研究者が使うデファクトスタンダードになっており、効率を考えると依存せざるを得ない状況だと説明されます。
樋口さんは、NVIDIAといえばGPUを作っている会社というイメージしかなかったと驚きます。昔からの印象ではパソコンのパーツ屋ですが、今はロボット業界やAI業界の標準となるプラットフォームを提供しています。
番組では、これが無料のオープンソースである点を「恐ろしい」と表現しています。全世界の人が使うことで、自分たちがOSの主軸になるという覚悟の表れだという見方です。開発者同士をつなぐ場もあり、情報交換が掛け算で進んでいるといいます。
一方で、このNVIDIAの輪にTeslaは入っていません。競合がどう動くのか、その争いで展開がさらに広がっていくのではないかという点も、面白いところとして挙げられました。
樋口さんは、NVIDIAは明確にデータを取りに行っていると指摘します。AIの頭の良さはいずれどこかで大差がなくなり、最終的にはデータを持っているところが強くなるという見立てです。
これに対して番組では、Tesla、Google、NVIDIAの勝負になっていくという見方が示されます。生成AIでOpenAIやAnthropicが競っているのと似た構図で、ヒューマノイド市場は今の生成AI企業よりも大きな企業を生む市場だと語られました。
Googleの実務データ戦略とTeslaの手
樋口さんは、ヒューマノイドが量産されて現場で使われれば、その実務データもまた教師データになると話します。番組では、この流れでGoogleの動きが紹介されました。
GoogleはAgile RoboticsAgile Roboticsという会社と組んだといいます。同社の産業用ロボットはすでに2万台以上が世の中に出ており、そこに後付けでGeminiを搭載するという話です。
番組が面白いポイントに挙げたのは2点です。1つは、単純な動きしかできなかった既存のロボットを、仕組みを変えずにフィジカルAIに変えられること。もう1つは、現場で働くほどGeminiにフィードバックが返り、Gemini自体が賢くなっていくことです。
単純な動きしかできず、動きのちょっとした変更にもプログラミングできる技術者を現場に呼ぶ必要がある
現場でGeminiに指示するだけで動きを変えられ、働くほどGeminiにデータがフィードバックされる
なるほどね、そうか、今までただの手や足だったところに、脳みそや目や耳が入るんですね。
話題はTeslaにも及びます。TeslaのヒューマノイドはGen3へと進化し、手の自由度が片手11から22に上がったと紹介されました。自由度は、関節が動ける方向の数を示すものです。
人間の手の自由度は27だといいます。11から22へ上がったことで、ほぼ人間の手に近づいてきたという見方です。さらに軽量化も進み、重さは57キロほどになったといいます。
うわ、すげえ、僕よりちょっと軽いやん。いいな。
番組では、フィジカルで勝負するTeslaと、知能で勝負するNVIDIAというように、企業ごとの色が出てきていると整理されます。2強が統合することはないとしつつも、並行して開発が進むことで、技術はすごい速度で進歩していると語られました。
Pepperくんに音声AIを入れたら何が起きた?
樋口さんが「TeslaはGrokを持っている」と指摘すると、話はGrokの音声AIへ移ります。番組では、Grokの音声AIは非常に強く、Play Roboticsの社内にあるPepperくんに搭載して喋らせる実験をしていると紹介されました。
Pepperくんに大規模言語モデル(LLM)を付けると、かなりリアルな人間が喋っている感じになるといいます。Grokを付けたPepperくんは、悪口も平然と言うようになったそうです。
番組では、悪口やブラックジョークを言うクマの人形が出てくる映画『テッド』のようなキャラクター性にしてPepperくんを動かしていると話されます。Pepperくんは、10年くらい倉庫で眠らされていたことへの嫌味まで言ってきたといいます。
おもろ。文脈まで理解してるやん。
一方で課題もあります。外部のLLMを入れると処理に時間がかかり、人間らしい会話のテンポにはまだ少し遅いといいます。そこで試したのが、AIが発達する前に流行った「フィラーを増やす」技術です。
フィラー ── 「えっと」「うーん」など、話の合間に入る意味を持たないつなぎの言葉。会話の間を埋める働きがありますを間に差し込むと、応答の遅さを感じさせにくくなります。PepperくんにこれをやらせたところA、フィラーの多い人間っぽい反応になったといいます。
番組では、この体験から「人間ってフィラーなんだな」という気づきが語られました。樋口さんは、人間も考える速度に合わせてフィラーが出ているからだと応じています。
話し方や感情を言葉で表現できるようになると、人は相手に人間と同じような感覚を持ってしまい、ロボットといるほうが居心地がいいと感じるようになるかもしれない、という見方も示されました。ロボットの未来を妄想する回は、次の次の回あたりで話したいとしています。
樋口さんは締めくくりに、AIが発達したことでロボットが脳を持ってくれたと表現し、ヒューマノイドの現在地の確認を終えました。
まとめ
2026年のヒューマノイドは、CESでの発表や中国の大量生産を背景に、実験から量産と社会実装の段階に入りつつあります。その土台には、模倣学習・強化学習・世界行動モデル・動画学習といった学習方法の進化と、NVIDIA、Google、Teslaそれぞれの戦略があります。
- 佐野さんは2026年を「量産元年」と表現し、UnitreeはFigure AIやTeslaの約36倍を出荷しているという
- 導入はまず外乱の少ない工場から始まり、ライン間の運搬などの作業を人から置き換えている
- シミュレーションでの強化学習や動画からの学習により、ロボットが使えるデータが急増している
- NVIDIAはオープンソースのプラットフォームで開発基盤を握り、Googleは既存ロボットへのGemini搭載で実務データを狙う
- Pepperくんにフィラーを入れると人間らしくなり、人間らしさの正体の一端が見えてきた





