DruckFin

Physical Intelligence:機器人基礎模型展現靈巧度的速度超乎預期,但真正的瓶頸已轉移至常識推理

Podcast 專訪 Physical Intelligence 共同創辦人 Sergey Levine,深入探討通用型機器人研究現狀與公司的技術藍圖

Physical Intelligence 共同創辦人兼研究員 Sergey Levine 在訪談中,罕見地詳細勾勒出通用型機器人目前的技術全貌。呈現出來的情況是:在靈巧度方面的進展,比多數局外觀察者所預期的還要先進,然而卻仍受限於一個先前少有人界定的關鍵瓶頸——中層語意推理,而非純粹的物理控制。這場長篇訪談系列中的對話,與其說是炒作,不如說是坦誠揭露了該公司研究人員自創立以來,有哪些事情令他們感到驚訝,又有哪些沒有。

瓶頸已從物理技能轉移至推理能力

這次對話中最具關鍵性的揭露是:Physical Intelligence 的模型已經跨過了一個門檻,在此之後,進步的來源不再是更多的遠端操作(teleoperation)數據,而是單純與機器人「對話」。Levine 描述了大約六個月前的一項內部實驗:當時團隊停止加入底層的遠端操作數據來修復錯誤,轉而使用更高層次的語意指令來標註現有的機器人經驗。「這實際上提升了它的泛化能力,」他解釋說,「瓶頸其實已經從最底層(也就是機器人實體執行任務的能力),轉移到了這個中層;現在系統面臨的主要瓶頸,在於解讀場景並選擇正確下一步驟的能力,而這可以透過語言來進行監督。」實務上,這意味著機器人的效代表現現在可以透過自然語言教導來改善,而不需要付出高昂代價去收集物理示範數據,這對擴展這些系統的單位經濟效益(unit economics)而言是一項意義重大的轉變。

靈巧度與跨機型泛化能力超出內部預期

Levine 明確表示,靈巧度的進展超越了他先前的預期。「我們在靈巧度上取得的進展,比我原先想像的要多得多,」他指出,同一個模型能夠在具備不同自由度(degrees of freedom)以及多指靈巧手的不同機器人之間轉移,且完全不需要修改架構,甚至不需要被告知它正在控制哪種型態的機器人。這種跨機型(cross-embodiment)的泛化能力,僅僅是透過對新數據進行微調(fine-tuning)而非採用新技術來達成,這對試圖評估基礎模型能否將研發成本分攤到不同硬體平台的投資人來說,是一個意義重大的數據點——這也是支撐整個「機器人基礎模型」投資論點的核心主張。

真實數據與模擬之間的技術分歧仍未解決且影響深遠

其中一項較為尖銳的技術揭露,涉及業界一項被 Levine 認為遭到低估的分歧:表演特技展示的人形機器人幾乎完全依賴模擬,「實際上往往完全沒有真實世界的數據」;而以 Physical Intelligence 為主的機器人操作系統,則高度依賴真實世界數據與大型基礎模型,且僅有極少的模擬。「這確實令人有點驚訝,在機器人的這兩個領域中,主導的方法看起來竟然如此不同,」他表示,目前仍不清楚究竟哪一種典範會勝出,還是會出現某種綜合體。這是一個仍在進行中、尚未解決的架構問題,並直接牽涉到整個產業的資本配置,因為這兩種方法暗示了截然不同的數據取得成本結構與時間表。

硬體成本崩盤,消除了結構性障礙

Levine 量化了支撐當前機器人投資浪潮的硬體降價曲線:他十年前使用的 PR2 機器人造價約 40萬美元;等到他創立柏克萊加州大學(UC Berkeley)實驗室時,一台同等級的機器人造價約 3萬美元;如今,單單一隻機械手臂的成本僅為當時的十分之一,且 Levine 預期未來還會進一步下降。他將此歸因於硬體和軟體進步的結合,並指出低成本機械手臂若搭配傳統的高精度控制方法將無法使用,但一旦與學習型系統(learning-based systems)相結合,便能補償更便宜、精度較低的致動器與極簡感測器的缺點,因而變得可行。Physical Intelligence 自身的平台採用了三部相機,沒有配置觸覺或力覺感測器,刻意保持最精簡的架構,其核心論點正是:學習可以取代感測硬體。

時間表的不確定性,明確繫於未決的數據策略問題

Levine 異常坦率地指出,Physical Intelligence 對自身時間表的信心,取決於一個尚未解答的經驗性問題:未來擴展是主要依賴人類遠端操作示範,還是依賴已部署機器人所收集的自主強化學習(reinforcement-learning)數據——他將這形容為「90/10 或 10/90」的分歧。「自從我們創業以來,我對時間表的看法變得更樂觀了,」他表示,但同時警告說,正確的商業與技術方法「會根據哪一種數據典範勝出而有劇烈改變」,而這只能在未來幾年透過實際經驗來解答。對於一家處在龐大集資敘事核心的公司而言,這是一次相當誠實的揭露,也暗示投資人對於機器人技術實現的時間表,應抱持比該產業創投敘事通常允許的更高謙遜態度。

技術掙扎最久的領域:人類互動,而非物理複雜度

當被問及最困難的剩餘任務為何時,Levine 指出的並不是重度依賴靈巧度的雜務,而是涉及與人類進行物理互動的任務,他舉出老幼照顧(特別是幫嬰幼兒換尿布)很可能是機器人最後才能實現的能力之一。「我想這真的是莫拉維克悖論(Moravec's paradox)的巔峰,」他主張,人類系統性地低估了那些人類歷經演化、能毫不費力完成之任務的難度。這直接關係到按垂直領域來建構總潛在市場(Total Addressable Market, TAM)模型的投資人:照護領域中價值最高、付費意願最高的類別,可能也是技術上最慢實現的領域,而諸如飯店客房清潔或餐廳支援等較為世俗的商業任務,則是近期相對切實可行的機會。

商業採用將仿效編碼 AI 助手,而非全面取代勞動力

Levine 反駁了二分法的「機器人取代工人」框架,並直接類比了 AI 編碼工具重塑軟體工程的方式。「這不像是編碼工具一出現,我們就突然不再需要軟體工程師了,」他預測,機器人的採用也將是一場人類與機器人分工合作的「舞蹈」:有時機器人與人類並肩工作,有時人類配置環境以提高機器人的生產力,反之亦然。對於評估部署時機的企業,Levine 提出警告:盲目假設「只要收集更多數據就行」往往是錯誤的,因為數據的質量與類型比總量更為重要,而這高度取決於業界尚未定案的未決架構押注。

機器人系統最終可能超越人類能力的領域

除了靈巧度達到平權外,Levine 還點出了具體、近期的超人能力:任務速度(因為人類示範者經常為了認知處理而停頓,而這可以透過演算法剝離並加速),以及最終的規模與外型尺寸——一旦系統不再需要為了像外科手術這種需要靈巧精確度的工作,而依賴即時人類遠端操作時,不限於人類可控介面的四軸飛行器群(swarms of quadcopters)或手術機器人,都將成為長遠的可能發展方向。

免責聲明: 本文僅供參考,不構成投資建議或買賣、持有任何證券的推薦。 我們的分析師對企業事件提供詳細報導,但也可能出錯,請務必進行您自己的自行評估與研究。 文中所表達的觀點和意見不一定反映 DruckFin 的立場。 我們未獨立核實本文所使用的所有資訊,其中可能包含錯誤或遺漏。 在做出任何投資決定之前,請諮詢合格的財務顧問。 DruckFin 及其關係企業對因依賴此內容而產生的任何損失不承擔任何責任。 完整條款請見我們的使用條款