• logo

8.86秒跑百公尺卻端不好一杯水?人形機器人「四肢強、大腦弱」

北京人形機器人創新中心的「天工」人形機器人在百公尺賽事跑出8.86秒,刷新紀錄。圖/取自新華社
北京人形機器人創新中心的「天工」人形機器人在百公尺賽事跑出8.86秒,刷新紀錄。圖/取自新華社

人形機器人究竟距離真正走進人類生活還有多遠?答案可能比想像中更複雜。近日在北京舉行的第二屆世界人形機器人運動會上,機器人400公尺賽跑成績已推進至38.15秒,比人類男子400公尺世界紀錄還快近5秒;跳高紀錄則達到2.88公尺,遠超人類2.45公尺的世界紀錄。

8月25日,來自北京人形機器人創新中心的「天工」人形機器人在百公尺賽事跑出8.86秒,刷新紀錄。這項成績也比牙買加「閃電」博爾特(Usain Bolt)保持的人類男子100公尺世界紀錄9.58秒快了0.72秒。

《中國新聞周刊》指出,當機器人從「跑得快」轉向「做得精細」,情況卻完全不同。在靈巧手專項賽中,參賽機器人必須在5分鐘內完成積木組裝、用鑷子夾豆及粉末秤重等精細操作。不少機器人面對物體材質、軟硬程度或擺放角度出現細微變化時,自主判斷仍可能出錯。換句話說,能夠刷新人類紀錄的「鋼鐵飛人」,到了指尖操作,卻未必比得上學齡前兒童。

4月7日,在廣州海珠區的廣東省具身智能訓練場,工作人員在模擬環境下訓練機器人進行電力設備巡檢與維護。圖/取自新華社

4月7日,在廣州海珠區的廣東省具身智能訓練場,工作人員在模擬環境下訓練機器人進行電力設備巡檢與維護。圖/取自新華社

展示看起來很厲害 實際應用有落差

這種「四肢強、大腦弱」的落差,也是目前人形機器人產業面臨的核心問題之一。宇樹科技創辦人王興興8月20日曾提出一項被業界視為重要門檻的標準:當人形機器人在80%陌生場景中,能透過語音指令自主完成80%日常任務,才可能迎來人形機器人的「ChatGPT時刻」。

但就在相關產業持續看好人形機器人未來之際,宇樹科技上市後股價也出現劇烈震盪,上市次日收跌18.70%,單日市值蒸發超過600億元人民幣,凸顯資本市場與產業界對這項技術仍存在不同期待。

《中國新聞周刊》報導,今年5月,美國機器人公司Figure曾連續直播超過19小時,展示機器人在生產線分揀包裹的能力,累計處理超過23.8萬件包裹。不過直播過程中也曾發生機器人無法撿起意外滾落包裹、突然停止工作等狀況。

中國大陸業者同樣積極展示人形機器人的「工作Demo(展示)」。例如智元機器人6月底曾在龍旗科技平板電腦品管生產線進行連續6天直播作業;近期世界機器人大會現場,也可看到機器人進行分揀、理貨等各式展示。

不過,業界工程師指出,許多所謂「機器人幹活」的Demo,其實是在高度控制的特定環境中執行單一任務,只要事前蒐集數百筆資料進行微調,就可能達到七、八成成功率。真正進入工廠、物流中心甚至家庭後,環境條件千變萬化,難度完全不同。

泛化能力不足 人形機器人最大瓶頸

北京人形機器人創新中心具身智能部負責人鞠笑竹解釋,所謂「泛化能力」,就是機器人今天學會拿蘋果,隔天也能夠拿梨子,而不是只有遇到訓練過的物品才會操作。

昆侖行機器人共同創辦人兼技術長郎咸朋則以「拿杯子」為例,如果機器人訓練時只看過空杯子,當杯子裝滿水後,是否仍能穩定拿起,就能直接檢驗它的泛化能力。

問題不只在於「沒看過的東西不會做」,也包括對環境變化的適應能力。例如光線改變,就可能影響機器人取得的視覺資訊,進而導致相同機器人在不同時間執行相同任務時,出現完全不同的表現。

目前人形機器人在特定場景、特定任務中可以達到相當高的成功率,但一旦換成新的場景或任務,表現可能大幅下滑。業界認為,這正是目前具身智能發展最難突破的關卡之一。

8月17日,在北京市海淀區AI原點社區的一處實景試驗室,機器人進行播放唱片訓練。圖/取自新華社

8月17日,在北京市海淀區AI原點社區的一處實景試驗室,機器人進行播放唱片訓練。圖/取自新華社

VLA模型遭遇「資料荒」 實操表現受影響

目前具身智能領域普遍採用的技術之一,是VLA模型,也就是「視覺—語言—動作」(Vision-Language-Action)模型。自2023年興起後,大量相關模型陸續問世。

然而,到了2025年初,業界逐漸發現VLA模型的泛化能力並沒有原先想像中理想。其中一項關鍵問題,就是「資料」。VLA模型目前仍高度依賴真實機器人蒐集的操作資料,而不像大型語言模型可以大量利用網路文字資料進行訓練,因此資料取得速度受到很大限制。

有工程師嘗試利用模擬資料取代部分真機資料,因為模擬環境可以大量產生資料,但問題在於資料品質仍會直接影響模型訓練效果。對VLA模型而言,利用真實機器人產生的動作資料進行訓練,通常能降低誤差並提高實際操作表現。

此外,中國大陸不少企業目前仍主要採取「後訓練」模式,也就是使用既有的開源具身模型,再針對特定任務及場景進行訓練,而真正投入基礎模型預訓練的企業相對有限。

產業「狂卷」後訓練 成本同樣驚人

由於基礎模型能力仍有限,業者只能透過大量真機資料進行後訓練,讓機器人在特定場景中表現更穩定。這也成為目前人形機器人產業競爭的重要戰場。

《中國新聞周刊》舉例,自變量公司仿效Figure進行人形機器人物流分揀直播,公布分揀效率達每小時1816件,高於Figure先前每小時1248件的紀錄,效率提升45%,直播期間成功率超過98%。

不過,為了達到這項成績,自變量據悉投入大量人力進行資料蒐集,數據採集人員超過百人,採早晚兩班制工作。相關人士更透露,為完成直播,該公司使用約10萬小時的真機資料進行後訓練,顯示「機器人學習」背後其實需要付出龐大的人力與資源成本。

優必選副總裁、具身智能與人形機器人研究院院長焦繼超表示,目前機器人在特定場景中的表現,資料差異甚至可能比模型差異帶來更大的影響;例如使用1萬小時真機資料訓練出的模型,效果可能優於使用10萬小時模擬資料訓練的模型。

優必選目前每天約可蒐集8000小時真機資料,但經過資料清洗等程序後,有效資料比例約只有25%,也意味著大量原始資料並不能直接用於模型訓練。

焦繼超認為,未來隨著資料持續累積,人形機器人的能力可能在突破某個臨界點後快速提升。

北京市海淀區機器人在整理家務訓練。圖/取自新華社

北京市海淀區機器人在整理家務訓練。圖/取自新華社

從VLA走向「世界模型」 轉化機器人學習資料

在VLA模型泛化能力遭遇瓶頸後,業界開始把希望放到「世界模型」。支持世界模型發展的學界與產業人士認為,這項技術有機會讓機器人不只模仿曾經看過的操作,而是進一步理解物理世界的規律。

郎咸朋表示,目前VLA模型在單一場景經過後訓練後,精準度仍優於世界模型;但世界模型的優勢在於泛化能力,兩者的差異有些類似早期自動駕駛依賴高精度地圖的模式——如果每換一座城市都必須重新蒐集資料,系統就很難真正普及。

北京人形機器人創新中心也已投入世界模型研究,並在今年8月發布大一統模型「Pelican Unify」。業界期待,世界模型未來能夠利用大量人類在不同環境下工作的影片,轉化為機器人學習資料,降低對真機資料的依賴。

不過,世界模型同樣面臨巨大挑戰。若模型訓練只學到機器人的動作軌跡,而沒有理解背後的物理量與因果關係,最終仍可能只是「模仿」,而不是真正理解物理世界。

此外,世界模型預訓練需要龐大的算力、資料、人才及資金。北京人形方面指出,輝達(NVIDIA)訓練Cosmos模型時,需要大規模GPU算力資源,顯示未來若要發展具身智能基礎模型,單一機器人企業可能很難獨自負擔全部資源。

人形機器人下一步 關鍵不再只是「跑多快」

宇樹科技上市後,也把大筆資金投入模型研發。公司募集的42.02億元人民幣(下同)資金中,有20.22億元將投入模型研發項目,顯示具身智能「大腦」已經成為產業競爭的核心。

不過,目前具身智能的技術路線仍未完全定型。業界人士認為,未來可能還會出現多次技術路線更迭,甚至讓部分現在投入的研發成果被淘汰。

從8.86秒百米紀錄,到連一杯裝滿水的杯子都未必能穩定拿起,人形機器人正處在「身體能力快速進化、大腦能力仍待突破」的尷尬階段。未來若要真正從展示舞台走進工廠、商場甚至一般家庭,泛化能力與對物理世界的理解,恐怕才是決定這項技術能否迎來真正「ChatGPT時刻」的關鍵。