DruckFin

Physical Intelligence トランスクリプト:セルゲイ・レヴィン氏が語る人型ロボットのスケーリング、汎化、エコシステムの課題

2026年9月2日 | 物理AIとヒューマノイドロボティクスの現状についてセルゲイ・レヴィン氏に聞く

はじめに

セルゲイ・レヴィン:個人的には、ベースモデルが人間のデータを一切学習せずに作られたという点に、ある種の衝撃を受けています。

ホスト:世界有数のロボット工学研究者であるセルゲイ・レヴィン氏をお迎えし、ヒューマノイドロボティクスの現状について話を伺いました。これまでに目にした中で、最も驚異的な自律的(エマージント)能力とはどのようなものでしょうか?

セルゲイ・レヴィン:あの評価テストを見た人の誰もが、ロボットがここまでやれるとは思っていなかったはずです。

ホスト:中国に関する質問もいくつか用意しています。この話題は避けて通れません。もしヒューマノイドロボティクスが1桁年(数年以内)のうちに成功しなかった場合、その最大の理由はなんだとお考えですか? エピソードの完全版はこちらです。

ロボット工学のスケーリングにおける現在地

ホスト:大規模言語モデル(LLM)は、その分野において前例のないインパクトと投資をもたらしました。物理AIやヒューマノイドロボットは、それをさらに上回る可能性を秘めています。本日は、ヒューマノイドロボティクスの現状と、このテクノロジーがどのように世界に実装されていくとお考えかについて伺いたいと思います。

セルゲイ・レヴィン:機械学習に関して、ここ数年、あるいは過去10年間で私たちが学んだことは、規模(スケール)を伴って実行したときに初めて機能するということです。これは今となっては非常に明白ですが、最初からそうだったわけではありません。ただし、ひとつ条件があります。それは「正しい対象」をスケールさせなければならないということです。例えば、人々が言語モデルの研究を始めた当初、主流のデザインはLSTMでした。覚えている人もいるでしょう。それらは悪くありませんでした。それ以前のものよりはるかに優れていましたが、実際にはそこまでうまくスケールしませんでした。Transformerの何が画期的だったかというと、Transformerが数学的に特別に洗練されていたからではありません。単にスケールしやすかったからです。非常に膨大な量のデータと多数のパラメータを使って学習させるのが容易だったのです。

技術は段階を経て進歩します。まず、何をスケールさせることができるか、つまりスケーラブルな技術は何かを見極め、その上で産業規模の努力を注ぎ込んで大量のデータとモデルサイズを追加していく。そうしたときに魔法が起きます。より基礎的な技術開発を行っている段階では、そうしたスケーラブルなレバー(推進力)が何であるかを理解することが鍵となります。デザインを固め、おおよその混合比率を導き出すと、それだけでもかなりクールな成果が生まれますが、それ自体が世界を変えるわけではありません。実際にそのレバーを引き始めたときに、物事が劇的に変わり始めるのです。

LLMの場合、最初のGPTモデルであるGPT-2が登場したとき、いくつかの機能は果たしたものの、一種の「手品」のようなものでした。ペルーのユニコーンに関するストーリーを書かせるといったことはでき、文法的に一貫した英語にはなっていましたが、現実世界の多くの問題を解決するような代物ではありませんでした。この分野に取り組んでいた人たちは、データ量を増やしモデルを大型化していくにつれて、こうした仕組みがより一貫性を持ち、効果的になるという「魔法」が起きることに気づいていました。これをさらに大規模に推し進めれば、圧倒的に強力なものになるという確信があったのです。

ご質問に戻りますと、ロボット工学の現状は、GPT-4からGPT-5への移行期のように、モデルを巨大化させてさらなる性能を引き出すという産業規模の段階にはまだ達していません。現在は、基礎技術を確立しているフェーズにあります。そのため、現時点で予想すべきなのは、予測可能なスケーリング曲線に沿って毎月モデルが巨大化し強力になっていくという事態ではありません。むしろ、適切な技術を開発していく中で、スケーリングの特性そのものが進化しているという段階なのです。

これを現実に引き寄せて言うならば、私たちPhysical Intelligence(フィジカル・インテリジェンス)で行っているデモには非常に満足していますし、他の研究者たちが発表している多くの成果も本当に素晴らしいものだと思っています。しかし、それらを文脈の中に正しく位置付ける必要があります。これらが、スケールの真の威力を示すものだと期待してはなりません。これらは、その後に大規模展開される基礎技術を開発している最中なのだと捉えるべきです。現在私たちがいる地点は、すべてのパズルピースをまさに揃えている最中であり、非常にその瞬間が近づいていると感じています。多くのパズルピースが所定の位置に収まりつつあります。テクノロジーがどこに向かうのかを予測しづらくしているのは、まだ予測可能なスケーリングの段階に達していないからです。今はパズルピースを解明している段階であり、それは本当にエキサイティングですが、同時にその係数(成長率)がどうなるかを予見するのは非常に難しいということでもあります。

最も驚くべき能力と意味論的(セマンティック)なエラー

ホスト:これまでに目にした中で、最も驚異的な自律的(エマージント)能力とはどのようなものでしょうか?

セルゲイ・レヴィン:それこそが最も面白い部分であり、プロジェクトが進展するにつれて、そうした現象をこれまで以上に多く目にするようになっています。ごく初期の段階では些細なことでしたが、ロボット工学においては2024年以前には決して起こり得なかったことだったため、一種の魔法のように感じられました。例えば、2年ほど前に行っていた、洗濯物を畳むポリシーの学習が良い例です。洗濯カゴからシャツを1枚ずつ取り出して畳もうとするタスクです。2024年後半の評価テストの一つで、ロボットがシャツを同時に2枚取り出したときのことを鮮明に覚えています。私はそれを見て、「もう終わりだ、こんなの絶対に処理できるわけがない」と思いました。しかし、ロボットは2枚のシャツをテーブルの上に置き、それぞれの絡まりを解きほぐし、1枚を脇に戻してから、もう1枚を畳み始めたのです。後から振り返って検証すれば、学習データのどこからその挙動を学習したのかを突き止めることはできるでしょうが、あの評価テストを見ていて、ロボットがそんな行動をとると予想できた人は誰もいなかったはずです。それは、人間が持っているはずの「常識」を発揮しているように見えました。

実際、最近私がより興味深いと感じているのは、ロボットが犯す「エラー(間違い)」の方です。LLMについて非常に特筆すべきだった点の一つは、モデルの性能が十分に高まると、そのエラーさえもある程度「筋が通っていた」ということです。それは、常にランダムな文字を出力するような狂ったエラーではなく、意味論的(セマンティック)に理にかなった間違いでした。昨年、私たちのモデル「$\pi_0$」の評価テストを行った際、ロボットが台所の片付けをしていました。スプーンやスパチュラといった調理器具をすべて片付けるよう指示されたのです。ロボットは、カトラリー(食器類)が収まるべきだと思う引き出しを開けようとしましたが、引き出しが開きませんでした。そこで、ロボットは少し横にスライドし、すぐ隣にあったオーブンを開けて、そこに器具を入れ始めたのです。もし子供に片付けをして物をしまうように頼んだとしたら、オーブンも「物を入れられる容器であり、中に物を入れておけば誰にも見られない」という理由で、同じような行動をとるかもしれないと想像できるでしょう。

もう一つの実験は、すべての皿を洗うというものでした。ロボットは皿を手に取り、スポンジで洗って水切りラックに置くという作業を行います。これは、自分が行っているすべての行動を把握し続ける必要があるため、「記憶」に関する実験でした。ロボットは、皿が3枚あったこと、グレーの皿を洗ったこと、緑の皿を洗ったことを書き留めておくような、一時的なスクラッチパッド形式の記憶を持っています。しかし、その途中で皿の1枚を床に落としてしまい、ベース(車体)を移動させて見えないように隠してしまい、「グレーの皿を洗ったからこれで完了だ」と結論づけてしまったのです。もちろん、こうした行動は私たちが見たいものではありませんが、そのエラーの一部が、タスクをこなそうとしている子供に見られるような行動と酷似しているというのは非常に興味深い点です。今は、そのロボットが「成長」するのを待つ段階なのです。

自動運転からの教訓

ホスト:業界全体で進展が起きていると仰いました。人型ロボットを開発している企業は数多く存在します。Figureがあり、テスラがあり、他にも多くの競合がいます。あなたには、何が困難で何が困難ではないかを見極める専門知識があります。競合他社を見渡したとき、「これは本当に見事で素晴らしい」と思うような進歩や達成はありましたか?

セルゲイ・レヴィン:実のところ、業界において私にとって最もインスピレーションを与えてくれることの一つは、自動運転システムが遂げた急成長(テイクオフ)です。ロボット工学の研究者に対して時折向けられる批判の一つに、「ロボット工学はまるで核融合のようなものであり、いつでも『将来の技術』であり続け、いつまで経っても実現しない」というものがあります。自動運転についても、かつては全く同じように言われていました。しかし現在、私たちはサンフランシスコにいて、外に出てWaymo(ウェイモ)に乗れば、運転席に誰も座っていなくても目的地まで実際に連れて行ってくれます。

技術的な詳細に深く立ち入りすぎないようにしますが、本当に感動的なのは、こうした「将来の技術」が現実に着地し得るという、まさにその実例を示してくれた点です。これが2020年中盤の今、実際に実現しているのは偶然ではありません。大規模機械学習のための多くのパズルピースが、実際の物理システムと統合できるレベルに達しつつあるからです。もちろん、運転とロボットの巧緻動作(マニピュレーション)の間には多くの違いがありますが、学習ベースのテクノロジーを現実の物理世界に実際に着地させることができるという実証は、本当にインスピレーションを与えてくれます。

最先端AIラボのロボット工学参入のインパクト

ホスト:もしOpenAIやAnthropicがロボット工学への投資をさらに本格化させた場合、業界にどのような影響を与えるととお考えですか? 競合他社はそれを脅威に感じるでしょうか?

セルゲイ・レヴィン:ロボット工学は、正直に言って、機械学習の他の分野ほどエコシステムが健全ではなかった領域です。どういうことかというと、コンピュータビジョンや自然言語処理(NLP)は、自由に利用できるデータが存在するため、機械学習ベースのエコシステムに自然になじむ分野でした。人々は学習手法の活用を一般的に受け入れており、物理的な安全性に関する過度に深刻な懸念も存在しません(AIの安全性に対する懸念は当然ありますが、物理デバイスが物理的な危害を加えるのとは意味が異なります)。そのため、そうした分野において、非常に本格的かつ大規模な機械学習への取り組みを立ち上げる方が、やや容易だったのです。

一方、ロボット工学は従来、データの共有を積極的に受け入れる文化を持つ分野ではありませんでした。ロボット工学における機械学習の動きが活発化すればするほど、人々の中にある「ロボットは人間が手作業で設計したコントローラではなく、学習済みモデルによって制御されるべきだ」という未来への認識が強まると考えています。データが存在するようになり、そのデータを共有する必要が出てきます。なぜなら、単一の垂直統合型の領域だけで真の基盤モデル(ファウンデーションモデル)を構築できる企業など存在しないからです。これにより、ロボット工学に対する考え方全体が、従来の工場自動化のような発想から、ビジョンやNLPに対する考え方に近いものへとシフトしていくでしょう。その意味において、私たちがPhysical Intelligenceで行っている仕事には誇りを持っていますが、人々の認識をその方向にシフトさせるには、1社の努力だけでは足りないと考えています。

中国のロボット工学とエコシステムのダイナミクス

ホスト:部外者の視点からSNS(X / Twitter)などを見ていると、中国のロボット工学による本当に印象的なデモを目にします。ある意味では彼らがリードしているようにさえ感じられますが、私にはその分野の深い専門知識がありません。中国のロボット工学の現状や、彼らがより進んでいるのかどうかについて、どう思われますか?

セルゲイ・レヴィン:米国や欧州でこうした研究開発を行っている私たちにとって非常に有益で建設的なアプローチは、「そこから何を学ぶべきか」を問うことだと思います。私にとっての教訓の一つは、「健全なエコシステムを持つことが重要である」ということです。エコシステムとは、優れた研究者や優秀なエンジニアがこうした課題に取り組んでいること、そして健全なオープンソースが存在することを意味します。しかし同時に、ロボット工学に寄与するさまざまな産業が、個別に非常に健全でなければならないことも意味しています。それらの産業とは、単に計算機科学、機械学習、モデル構築だけではありません。サプライチェーン、製造業、ハードウェアの研究開発も含まれます。これらはすべて非常に重要な要素です。

こうした側面のうち、米国が非常に得意としている部分もあれば、米国が少し手を緩めてしまっている部分もあります。私たちは世界で何が起きているのかを直視し、中国のラボや他の国のラボが生み出している素晴らしい成果のいくつかに目を向け、「より健全なエコシステムの構築に努めるべきだ」という教訓を汲み取るべきです。それは、この分野に寄与するあらゆる側面に投資することを意味します。私はビジネスや投資の専門家ではないので、それを具体的にどう実行すべきかを知っているとは主張できませんが、これが単なる一面の作業ではなく、あらゆる側面を包括した取り組みであることを全面的に受け入れることが極めて重要です。

ホスト:エコシステムの数ある要素の中で、米国において改善された場合、ロボット工学の進歩に最大のインパクトをもたらすパーツはどれだと思われますか?

セルゲイ・レヴィン:確かに、信頼性が高く低コストなハードウェアの入手可能性は大きな課題です。現在、ロボット工学の研究で使用されるハードウェアの多くは中国製です。それらは性能が良く、比較的安価で、高品質であり、一般的に求められる基準を満たしています。そうしたハードウェアのすべてを国内(米国)で調達できるようになれば、非常に素晴らしいことです。それが不可能だとは思いません。単に、一部のパーツだけでなく、エコシステム全体をサポートする必要があるという事実を受け入れるかどうかの問題なのです。

データフライホイールとスケーリングの節目

ホスト:最初にスケールを達成したラボが、真っ先にブレイクアウト(飛躍的成長)を果たすと想像できます。デプロイ(展開)がさらなる高速成長を促し、成長がさらなるデプロイを加速させるという、この種の指数関数的な成長効果(フライホイール)が働く可能性があります。米国であれ中国であれ、ある特定のラボが何らかのブレイクアウトポイントに到達し、他のすべての競合を引き離して飛び抜けるという現象が、この業界でも起きるとお考えですか?

セルゲイ・レヴィン:そこには多くの真実が含まれています。ただ、心に留めておかなければならない重要な詳細があります。それは「正しい対象をスケールさせなければならない」ということです。デプロイされたロボットの増加がモデルの性能向上に直結するような、効果的なポジティブ・フィードバックループを構築することが鍵となります。難しいのは、間違ったやり方をしてしまう落とし穴が数多く存在するという点です。

分かりやすい例を挙げましょう。私が自動車会社で、組立ラインで自動車の溶接を行うロボットアームを管理しているとします。毎日車を溶接し、毎月100万回の溶接を行っているとします。もしその作業データだけをデータフライホイールとして使用した場合、「車を溶接するロボット」以上の能力を持つものを生み出すことはまずできないでしょう。ロボットはすでにそこに存在し、すでに車を溶接しているため、そこからの限界改善(マージナル・インプルーブメント)の価値はそれほど高くありません。これは、データが電力や石油のように完全に代替可能(ファンジブル)なものではないため、「正しいものをスケールさせなければならない」ということを示す典型例です。単にデータを買えばいいというものではなく、データは多様性に富んでいなければなりません。適切な技術と、多様な学習の正しいソースを用いて、正しい対象をスケールさせる必要があります。データとは、代替可能なコモディティというよりも、ロボットのための「教育プログラム」に近い性質を持っています。

スケーリングのタイムラインと構造化のバランス

ホスト:そのデータフライホイールを念頭に置き、プラットフォームを改善するために不可欠なデータを生み出す適切なプラットフォームを世に送り出すとしたら、このような現象が世界で実際に起こり始めるのはいつ頃だとお考えですか?

セルゲイ・レヴィン:テクノロジーの観点から見ると、物事はその方向に向けて非常に急速に進展しています。そのタイムラインを大きく左右する特有のバランス調整事項は、「どれだけの構造化(ストラクチャー)を受け入れる用意があるか」という点です。極端な例として、家庭用ロボットのような完全に非構造化されたデプロイ環境へ一気に飛び込むというアプローチが考えられます。これは、最初から多様性がふんだんにあるため非常にエキサイティングですが、家庭内には人間の存在という安全性の大きな問題が伴うため、十分な効果と安全性を担保するためのハードルははるかに高くなります。

もう一つの極端な例として、より構造化されたタスクが挙げられます。溶接ロボットとは言わないまでも、廊下の先で少しだけ非構造化された作業を行うロボットのようなものです。これは、訓練された人間の近くで作業が行われ、タスクの予測可能性が高いため、安全性の懸念が少なく、ドメインとしては取り組みやすいと言えます。しかしその一方で、そのドメインで得られるデータ1ビットあたりの限界価値は、多様性が少ないため低くなります。早期にスタートするものの成長勾配が緩やかなアプローチをとるか、あるいは遅れてスタートするものの急勾配を登るか、そのバランスを較正する必要があります。私の感覚では、これら極端なアプローチのどちらを指すにせよ、現在の地点から見て、実現は1桁年(数年以内)の領域であり、2桁年(10年以上)先の話ではありません。より構造化された領域であれば今年あるいは来年には実現している可能性があり、より非構造化された領域であっても数年先、おそらく10年以内には到達するでしょう。

ロードマップ、汎化、そして実世界でのテスト

ホスト:タイムラインについて多くの人が語りますが、それは依然として曖昧なものです。「家庭内のロボット」という北極星(究極の目標)に向けたマイルストーンを置くとしたら、そのロードマップはどのようなものになるでしょうか?

セルゲイ・レヴィン:ロボット工学について語る際に非常に重要でありながら、ハイプサイクルや公開されるデモ映像からは見落とされがちなことが一つあります。それは、ロボット工学における最大の難所は常に「汎化(ジェネラライゼーション)」であったという事実です。誰かが自社のシステムのデモを披露するとき、そのデモ単体では、示されている汎化性能のレベルがどの程度なのかが明確にならないことがほとんどです。例えば、非常にアクロバティックなロボットのデモは見ていて本当にエキサイティングです。しかし、それがステージ上でリハーサルされたものである場合、それは文字通り「ショー」にすぎません。どんな家庭でも、あらゆる状況下で毎回確実にタスクを遂行することとは全く異なります。

汎化という要素は、単体で見た場合にはそれほど印象的ではないことがよくあります。なぜなら、汎化とは「1回の試行」ではなく「多数の試行」の特性だからです。ロボットがやっていることは非常にありふれていて地味に見えるかもしれませんが、何がエキサイティングかといえば、それが「これまで一度も見たことがないオブジェクト」を使い、「これまでにテストされたことがない環境」でそれをやり遂げているという点にあります。それこそが、100万回練習したアクロバティックなバク転をこなすことよりもはるかに難しいのです。

ロードマップの核心は、より優れた汎化性能を達成し、汎化が進むにつれてさらに汎化を促進するメカニズムを確立することにあります。そのロードマップにおける第一歩は、元々の学習環境とは異なる設定で収集された自律的な経験を通じて性能が向上していくロボットシステムを、非常に具体的なデモとして示すことです。モデルをバックエンドで学習させ、家庭や工場といった新しい現場に配置して何らかの現実的な作業をさせると、最初はそこそこの出来栄えですが、時間の経過とともに経験を重ねるにつれてどんどん上達し、50%の成功率で頭打ちになることなく、実用上意味のあるレベルの堅牢性(ロバストネス)に達する。これが大きなマイルストーンとなります。もしそれが、有用な経験を収集するにつれて自動的に改善されていくプロセスであるならば、それを多種多様なドメインに配置して経験を収集させ、人々の求める作業をこなし、モデルを洗練させていくことができます。

もう一つの大きなステップは、堅牢性を達成するために「常識的知識」を転移させるための具体的かつ実用的な方法を実証することです。それは、事前の練習が効かないシナリオのことです。例えば、車を運転していて消防車や道路のカラーコーンに遭遇したとき、たとえその状況に直面したことが一度もなくても、私たちの「常識」が、コーンを強行突破するのではなく減速すべきだと判断させます。ロボットが、例えばスパチュラをオーブンに入れてしまい、「これは取り出さなければならない」と気づくべき場面のような予想外の状況から、その常識を応用して効果的にリカバリーできるようになれば、常識を用いてエラーを修正できることが証明されます。

ホスト:例えば、組立ラインの1つの工程だけを行う人型ロボットのように、よりスコープを絞ったロボットを想像することもできます。私の理解では、あなたはそうしたアプローチにはあまり関心がないように思えます。なぜなら、それは汎用人工知能(AGI)に向けた本当のステップではないからですよね。

セルゲイ・レヴィン:関心がないわけではありません。現実世界には「漏れのある抽象化(leaky abstractions)」が存在するため、そうした限定的なアプローチが思っている以上に複雑になってしまうという理由があります。1990年代、人々が自動運転の開発に本格的に取り組み始めた頃、道路の磁気センサーや車同士のトランスミッター(発信器)を用いて環境を計装(インストルメント)し、航空機のように全員の位置を把握できるようにすれば、難しい問題の多くを回避できるというアイデアがありました。人々は、高度なAIなど必要なく、センサーさえあればうまくいくと考えていました。しかし、そのアプローチはどこにも行き着きませんでした。なぜなら、現実世界にはあまりにも多くの厄介な例外や特殊ケースが存在するからです。たとえ磁気センサーが99%の確率で機能したとしても、誰かが道路に飛び出したり、道路にゴミが落ちていたりする残りの1%のケースが、すべてを台無しにしてしまうのです。

実際に機能したアプローチとは、「難しい問題を回避しようとするのをやめ、サンフランシスコのような泥臭い環境に車を直接デプロイし、正面からその問題に取り組む」というものでした。ロボットの巧緻動作(マニピュレーション)も全く同じ道をたどるでしょう。工場の完全に構造化された世界を一歩でも外に出るならば、たとえ99%のケースで単純明快であったとしても、何かしら奇妙なことが起きる残りの1%のために、問題の全容に対処する必要があるのです。

ホスト:これは、Figure社がパッケージを仕分けするロボットのライブストリーミングデモを行ったときのことを思い出させます。あなたの意見では、あれは汎化を実証していると言えますか?

セルゲイ・レヴィン:はい、そう思います。これは私が非常に心強く感じている点です。ビデオ映像の中で汎化性能を示すことは難しいため、多くの人々がライブデモや長時間のタイムラプス映像を用いるなどして、一目でそれを伝える方法をクリエイティブに模索しています。それは、人々の意識の中で汎化の重要性を高めるための素晴らしい方法です。

昨年後半に私たちが「$\pi^*_0$ RL」プロジェクトに取り組んでいたとき、より長期的なホライゾンの実験を行いたいと考えました。ダンデライオン・チョコレート(Dandelion Chocolate Factory)の工場で、数日間にわたりロボットに箱の組み立て作業をさせました。また、エスプレッソマシンを使ってロボットにエスプレッソを作らせるコーヒー作りのタスクでは、13時間にわたって連続稼働させました。環境に配慮してコーヒーを無駄に捨てないようにしようとしたため、13時間経過した頃には、オフィスの全員がエスプレッソを飲みすぎてカフェインで冴え切っていました。コーヒーの粉をこぼして布で拭き取らなければならないようなミスが何度かありましたが、13時間の稼働を通じて何かが爆発するような事故は一度も起きませんでした。

ホスト:コーヒーの粉をこぼしてそれを掃除したとき、それはロボットが自律的に行ったのですか?

セルゲイ・レヴィン:その実験の仕組みとしては、意味論的に一貫したタスクの合間に、およそ5分おきに高レベルのプロンプトが更新されるという形でした。「エスプレッソを作る」「マシンを掃除する」といった指示は人間によってプロンプトとして与えられており、掃除のコマンドも人間によるものでした。原理的には、それさえも自動化することは可能です。私たちは現在、そうしたコマンドを処理する高レベルのポリシーを改善するために多大な労力を注いでいます。あの実験においては、カフェでラテを注文するのと同じように、次のラテを作る前に掃除をするよう指示しなければならないのと同様に、誰かが5分おきにロボットへの指示を更新していたのです。

ホスト:OpenAI、Anthropic、Cursor、Vercelといった企業は、自社のビジネスをより円滑に進めるためにこのプロダクトを利用しています。それが解決する問題とは、SaaSやAIプロダクトを構築し、それを他の企業に販売したいと考えた際に出くわす、SSO、SCIM、RBAC、監査ログといった数々の要件を満たさなければならないという課題です。これらを自前で統合するには時間がかかりますが、アプリのメインの焦点ではありません。WorkOSは、わずか数行のコードでこれらすべての要件を満たすことを可能にするAPIレイヤーです。詳細を確認してスタートするには workos.com をご覧ください。このポッドキャストをスポンサーしていただいたことに感謝します。

データの種類とクロスエンボディメント(異体型間)転移

ホスト:汎化に至る道筋において、データは非常に重要な要素です。シミュレーションデータと、物理的なインタラクティブデータが存在しますが、どのデータがベストで、どれがワーストなのか、それぞれのメリットとデメリットについてどうお考えですか?

セルゲイ・レヴィン:ロボット工学コミュニティではこの点について多くの議論が交わされており、人によって正反対の意見を持っています。私の見解では、モデルが世界についての徹底的な物理的理解(グラウンディング)に基づいているならば、多様なデータソースを内部に取り込むことが容易になります。

飛行機の操縦を学びたい場合、訓練の一部としておそらくシミュレーターを使用するでしょう。シミュレーターでの訓練があなたにとって意味を持つのは、何が起きているのかを基礎づけるための豊富な世界知識をすでに頭の中に持っているからです。あなたは自分が現実の飛行機で使用するための知識を習得していると理解しています。同様に、誰かが料理をしているところを見る場合、その人の正確な筋肉の動きを体感していなくても、「塩を加える」という抽象的なレベルでそれを分類・蓄積するための事前知識を私たちは持っています。自分自身の身体を使って物理的に物事を行う方法をいったん理解すれば、他のすべての知識ソースもそれに結びつけることができます。なぜなら、あなた自身の身体化された基盤(エンボディド・ファウンデーション)がすべての土台を支えているからです。

もし、豊富な実際の身体化データを用いて学習され、グラウンディングを提供してくれるロボット基盤モデルが存在するならば、それは他の知識ソースを吸収する能力において、実際にはるかに優れている可能性があります。LLMにおけるインターネットデータの成功を見ると、YouTubeのビデオから始めて、その上にロボットデータを追加したくなる誘惑に駆られますが、私の考えはむしろ逆です。同僚のSudeepと、ジョージア工科大学のSamarthは、私たちのロボット基盤モデルをベースにして、その上に人間のビデオデータを追加するという実験を行いました。ロボットデータが最小限の小さなモデルを使用した場合、人間の経験とロボットの経験は、特徴表現の中で完全に分離されていました。しかし、多様な多くのロボットから集められた膨大なロボットデータで学習させたところ、特徴量はエンボディメント(身体の形態)ごとではなく、完全にタスクの同一性ごとにグループ化されました。t-SNE埋め込みにおいてロボットデータの比率を100%に引き上げた際、身体の形態に対する感度は最小限に抑えられ、タスクの同一性がきれいに整列したのです。ベースモデルは人間のデータを一切学習していなかったにもかかわらず、いったん人間データを追加すると、モデルはそれを全く同じ方法で表現するようになったのです。

ホスト:ベースモデルにとって、特定のモーターや関節のセットを使って収集されたデータが存在することが重要なのでしょうか?

セルゲイ・レヴィン:私たちは、多くのロボットタイプを処理できるクロスエンボディメント(異体型間)モデルの開発に多大な労力を注いできましたが、一般的に、優れたパフォーマンスを得るためには、ターゲットとなるロボットからのデータが多少は必要になります。汎化の指標とは、新しいロボットへのゼロショット転移(一度も見たことのないロボットへの即座の適応)ではなく、他のロボットからのスキルの転移によって、新しいロボットでの学習に必要な経験量を減らすことにあるのです。

必要とされる特別なアーキテクチャの量は、驚くほど最小限です。当初、私は異なる形態(モルフォロジー)に対応するための研究アイデアを長々とリストアップしていました。例えば、自由度6のアームと自由度7のアームで表現をファクター化(要因分解)するといったことです。しかし、私たちはそのどれも行いませんでした。モデルは数値のベクトルを出力し、もしロボットの自由度が少なければ、出力の余った部分をゼロパディングするだけです。すべてのロボットにわたって学習が行われ、カメラを通して見えているものに基づいてアクションが出力されます。

ロボット間でスキルを転移させる際には、「中間的な思考」が役立ちます。テキストで考えることは、引き出しを開けてからカトラリーをしまうといった、高レベルの行動構造を転移させるのに優れています。より低レベルの物理的タスクに関しては、思考の段階を「画像」として表現し、タスクの次のマイルストーンとなる画像を生成するという実験を行いました。その手法を用いて、その特定のロボットにおけるTシャツを畳んだデータを一切持っていなかったにもかかわらず、UR5ロボットにTシャツを畳ませることに成功しました。畳まれたシャツがどのように見えるかの画像を生成することは、生成モデルを使えば容易であり、その合成画像から必要な関節角度を逆算することは比較的シンプルです。適切なモダリティ(形式)で中間的な思考を導入すれば、クロスエンボディメントの汎化ははるかに容易になります。

ロボット工学のソフトウェアスタックの簡素さ vs. 自動運転車

ホスト:先ほど、汎用ロボット工学の証明としてWaymoがインスピレーションを与えてくれたと仰いました。人型ロボットの場合、自動運転車が直面したエッジケースのロングテールやポリシーの課題と比較して、1桁年(数年以内)というタイムラインに自信を持てる理由は何ですか?

セルレイ・レヴィン:ロボット基盤モデルと従来のエンジニアリングシステムとの間の大きな違いの一つは、ソフトウェアスタックが非常に「薄い」という点です。基盤モデルの学習はデータのキュレーションやラベリングの面で困難ですが、ロボット上で実際に稼働しているソフトウェアは非常にシンプルです。生コードの行数という観点から見れば、従来の自動運転車のスタックよりもはるかに小規模です。自動運転車は、まったく異なるレガシー技術を用いてより早期にスタートしており、安全性が厳しく求められる重大な制約を抱えています。ロボットマニピュレーターで壊れやすい物体を落としてしまうことは、車が人をはねる事故に比べればはるかに軽微です。

ロボット工学における安全性の課題は現実のものですが、実際のデプロイに対する決定的な停止要因(ハードストップ)になるほどではありません。リスクを管理可能なタスク、環境、ハードウェアを選択すればよいのです。根本的にシンプルなソフトウェアスタック、それほど劇的ではない安全性のハードル、そしてポジティブなデータフライホイールの組み合わせが、1桁年のタイムラインを現実的なものにしています。

人型ロボットが失敗する場合のプレモーテム(事前検死)

ホスト:もし人型ロボットが1桁年のうちに成功しなかったとした場合、失敗する最も可能性の高い理由は何だと思われますか?

セルゲイ・レヴィン:これらのシステムが真に有用であるためには、LLMや生成ビデオモデルに私たちが期待するレベルよりもさらに高い、信頼性と汎化のレベルに到達する必要があります。LLMは、ユーザーがタスクが解決されるまでプロンプトを反復修正できるような人間参加型のツールです。しかしロボットの場合、バリュープロポジション(提供価値)の全体が「自律的な実行」にかかっています。人間が常に介入しなければならない状態では、ロボットの意味が失われてしまいます。

最大のリスクは、その高い水準のロバストネス(堅牢性)に到達することの難しさにあります。自律的な経験を活用する強化学習の手法は、成功率を95%から100%へと引き上げる上で役立ちますが、その最後の区間を突破することは依然として未解決の技術的課題であり、さらなるアルゴリズムの革新を必要としています。

基盤モデル vs. 特化型スペシャリスト

ホスト:ロボット工学のモデリングアーキテクチャにおいて、誰もが同じことをやっているのでしょうか、それとも意見の分かれるホットな見解が存在するのでしょうか?

セルゲイ・レヴィン:見た目以上に多様性(異質性)が存在します。主な境界線は、「基盤モデルの精神を完全に受け入れるアプローチ」と「狭い垂直領域(バーティカル)に特化するアプローチ」の間に引かれています。基盤モデルの精神とは、特化したタスクを解決するためには、幅広いデータにわたって汎用モデルを学習させる方が、エッジケースにおいて特化型スペシャリストを最終的に凌駕するという考え方です。

ロボット工学の世界では、このアイデアは人々に居心地の悪さを感じさせます。倉庫の自動化システムを構築したい場合、キッチンの引き出しにカトラリーをしまうデータを収集することは、直感に反するように思えるからです。しかし、多様なデータを収集することで、倉庫内の予測不可能なエッジケースへと転移する「汎用的なスキル」が養われます。広範さが狭い垂直最適化に勝つという事実を受け入れることは、従来のロボット工学のエンジニアたちにとって依然として困難なことです。

物理世界におけるAIの安全性

ホスト:もしPhysical Intelligenceが並外れて有能な汎用モデルを開発した場合、物理システムにおけるAIの安全性、リスク、規制についてはどのように考えておられますか?

セルゲイ・レヴィン:AIの安全性は長い間研究されてきましたが、テクノロジーが急速に進化する場面では、実際の課題は「社会がそのツールをどのように採用するか」に大きく依存します。私たちの哲学は、実証的実験(エンピリカル・エクスペリメンテーション)です。現実世界にシステムをデプロイし、何が成功し何が失敗するのかを観察し、反復的に調整を行っていく。ソフトウェアだけのAIでさえ重大な安全性への懸念を生み出すのであれば、物理世界と相互作用する能力を持つ物理AIシステムには、当然のことながらさらに厳格な精査が求められることになるでしょう。

経済的インパクトと労働の未来

ホスト:今後10年間ですべてが順調に進んだ場合、人型ロボットの普及は「人間の労働の終わり」を意味するのでしょうか?

セルゲイ・レヴィン:ロボットを単なる「機械の人間」として考えるのは間違いです。パーソナルコンピュータが普及したとき、それらは人間の脳を置き換えませんでした。むしろ、デスク、ポケット、冷蔵庫、自動車などの中にユビキタス・コンピューティングが浸透していきました。それと同様のアナロジーとして、物理AIは、人間を1対1で直接置き換える存在としてではなく、日常的なタスク全体にわたって自動化されたアシスタンスを提供する「ユビキタスな物理的作動(アクチュエーション)」をもたらす可能性が高いでしょう。現代のコーディング・エージェントが良い好例です。それらはソフトウェアエンジニアを淘汰するのではなく、人間の生産性を増幅させるためのレバレッジ(てこ)を提供しています。

不可欠な研究論文:AlohaとACT

ホスト:ロボット工学におけるブレイクアウトの系譜を理解したいと思った場合、どのような基礎的論文を読むべきでしょうか?

セルゲイ・レヴィン:私が挙げたいのは、トニー・ジャオ(Tony Zhao)氏が主導し、私も共著者として参加した、オリジナルの「Aloha」および「Action Chunking with Transformers (ACT)」の論文です。この論文では、Trossen Robotics製の低価格な7,000ドルのホビー用アームを両腕(バイマニュアル)の遠隔操作セットアップで使用し、それをシンプルなTransformerモデルと組み合わせることで、リモコンの電池交換やマネキンの足への靴履かせといった高度に巧緻なタスクを解決できることが示されました。

アカデミックな研究は数学的な複雑さを優先しがちですが、ここでの重要な洞察は、シンプルでアクセスしやすいハードウェアを正しいエンドツーエンドの学習セットアップと組み合わせることで、驚異的な成果を達成できるという点でした。オープンソースのACTコードベースは、シンプルな構成要素がどこまで通用するかを証明しているため、現代のロボット学習における標準的なスターターキットとなっています。

古典的制御から学習型AIへの進化

ホスト:現代の機械学習が登場する前、Boston Dynamics(ボストン・ダイナミクス)社は圧倒的なデモで多大な注目を集めましたが、今日では古典的なアプローチについて耳にする機会は比較的減っています。業界におけるそのパラダイムシフトを駆動したのは何だったのでしょうか?

セルゲイ・レヴィン:ロボット工学には、機械設計、作動機構(アクチュエーション)、高レベルの意思決定にわたる、フルスタックの統合が求められます。かつてのBoston Dynamicsのデモは、卓越したハードウェアと洗練された手作業による制御工学の粋を示していました。当時それは不可欠なものでした。なぜなら、機能するハードウェアがなければ、意思決定ソフトウェアなど無意味だからです。

現在ではハードウェアは十分に優れたレベルに達しており、現在の主要なボトルネックは、非構造化環境における「閉ループ(クローズドループ)の意思決定」にあります。古典的制御と現代のAIを分ける境界線は、ロボットが自分の身体を制御するだけでよいのか、それとも外部世界に反応しなければならないのかという点に行き着きます。平らな地面でのバク転は、主にロボットの身体に関わる制御の問題です。コーヒーカップを拾い上げるには、外部環境の理解が必要です。もし人間のエンジニアが特定の挙動に対する制御則を手作業で設計できるならば、それはコンパクトで汎用的なポリシーが存在し、機械学習を通じて直接学習できることの存在証明(エクスジステンス・プルーフ)となるのです。

若かりし頃の自分へのアドバイス:事前知識の重要性

ホスト:もし、あなたがこの業界に足を踏み入れた頃に戻れるとしたら、過去の自分にどのようなアドバイスを与えますか?

セルゲイ・レヴィン:私なら、「事前知識(プライ・ナレッジ)をもっと真剣に取り入れろ」と自分に言い聞かせるでしょう。初期の頃、私を含め多くの研究者は、ロボットは完全にゼロから(スクラッチから)学習すべきだと信じていました。Googleでの「Arm Farm」プロジェクトの際、私たちは何百万ものオブジェクトを白紙の状態からアームにつかませました。ロボットは掴む動作を学習しましたが、そのデータは、より複雑なスキルを自力で立ち上げる(ブートストラップする)役には簡単には立ちませんでした。

動物や人間は真空状態で学習するわけではありません。観察や、すでに持っている世界のモデルに依存しています。言語、インターネットビデオ、あるいはクロスエンボディメントデータといった広範な事前知識を取り入れることは、効率的な学習のための必要な足場(スキャッフォールド)を提供します。事前知識なしで学習しようと試みることは、自然界がかつて解決する必要のなかった、より厳格に困難な問題をロボットに解かせることになってしまうのです。

ホスト:セルゲイ、お時間をいただき本当にありがとうございました。

セルゲイ・レヴィン:ご質問ありがとうございました。

ホスト:ポッドキャストをご覧いただきありがとうございました。楽しんでいただけましたら、コメントと「いいね」をお願いします。私は現在、エルゴノミクス(人間工学)に基づいた分割キーボードのプロトタイプの開発にも取り組んでいます。Kickstarterでプロジェクトを立ち上げ、わずか8時間で資金調達目標を達成しました。現在ツーリング(金型製作)の段階に入っており、レイトプレッジ(追加支援)も引き続き受付中です。ご視聴ありがとうございました。また次回のエピソードでお会いしましょう。

免責事項: この記事は情報提供のみを目的としており、投資アドバイスや有価証券の売買、保有を推奨するものではありません。 当社のアナリストは企業イベントに関する詳細な情報を提供しますが、間違いを犯す可能性もあるため、常に独自のデューデリジェンスを行ってください。 表明された見解や意見は、必ずしもDruckFinのものを反映するものではありません。 当社は、ここに使用されているすべての情報を独自に検証したわけではなく、誤りや欠落が含まれている可能性があります。 投資決定を下す前に、資格のある財務アドバイザーにご相談ください。 DruckFinおよびその関連会社は、このコンテンツへの依存から生じるいかなる損失に対しても責任を負いません。 完全な規約については、利用規約をご覧ください。