宇樹科技(Unitree Robotics)掛牌上海科創板隔日,創辦人王興興迎來上市後首次公開演講。相較首日股價大漲逾 460% 的市場熱度,他談起人形機器人的實際能力時,給出的判斷相對審慎,指出機器人距離大規模進入工廠與家庭,仍有幾道關卡尚未跨過。
在 2026 世界機器人大會上,王興興首先把問題指向效率與泛化能力。他表示,機器人現在已能完成部分簡單裝配,但效率仍低於人類;一項任務即使在固定場景充分蒐集資料與訓練後,成功率可以逼近 100%,只要更換物品、環境或任務,表現就可能明顯下滑,碰到新工作往往還得重新訓練。他因此把泛化能力不足,視為當前全球機器人產業的核心瓶頸。
《Reuters》則指出,驅動機器人決策與互動的 AI 模型,仍是限制人形機器人大規模部署的主要因素。而宇樹科技目前投入最多資金與人力的方向,也正是世界模型。
什麼才算機器人的「ChatGPT 時刻」?
王興興在演將中也為具身智慧(embodied intelligence)真正跨過門檻,給出一個具體判準。對他來說,如果把機器人帶進一個完全陌生的環境,只靠語音或文字指令,就能在約 80% 的陌生場景完成約 80% 的任務,才算迎來具身智慧的「ChatGPT 時刻」。
至於還要等多久,他估計,在樂觀情況下最快 2 至 3 年,較保守則可能需要 5 至 10 年。但要跨過這個門檻,泛化能力不足還只是表面問題。王興興認為,更棘手的是 AI 模型一旦進入真實物理世界,誤差就開始產生與累積。
最後幾毫米,為何成為機器人難跨過的關卡?
王興興以抓取物品為例,機器人的手看起來已經接近目標,但最後一點觸覺回饋或位置偏差如果無法即時修正,整個任務就可能失敗。真正影響成功率的,往往是最後幾公分,甚至幾毫米。
這也是機器人 AI 與語言模型(LLM)的一項重要差異。他解釋,語言模型的輸入與輸出都留在數位空間,但機器人必須把模型判斷轉成真實動作,每一次執行產生的偏差,又會影響下一次感知與行動,讓誤差持續累積。這也是為什麼機器人學會一項任務,不代表換到陌生環境後還能照樣完成。
王興興在 2025 年也曾表示,當時機器人的硬體能力已基本夠用,雖然成本、可靠性與量產仍要持續改善,相較之下,具身 AI 模型更缺乏足以支撐廣泛應用的突破。
宇樹怎麼解?重押具身 AI 模型,再用 AI 改造研發流程
宇樹對 AI 模型的投入也反映在募資規畫上。該公司原募投計畫規模為 42.02 億元人民幣,其中 20.22 億元投入 AI 機器人模型研發,高於投入機器人機身、關節與運動控制等技術研發的 11.1 億元。
在模型端,宇樹目前同步推進 WMA(World-Model-Action,世界模型-動作)與 VLA(Vision-Language-Action,視覺-語言-動作)等路線。
WMA 希望讓模型不只根據眼前畫面決定下一個動作,還能預測機器人採取行動後,周遭環境可能如何變化,再據此規劃下一步;VLA 則把機器人看到的環境、人類下達的語言指令與最後執行的動作連接起來,提升理解與執行不同任務的能力。宇樹最新招股意向書顯示,該公司近一年也持續推出融合世界模型與 VLA 的模型,強化多步驟規劃、環境干擾下的操作與多任務能力。
資料怎麼來也是王興興關注的問題。他在演講中主張,大量真人與網路資料可以作為主要的預訓練來源,再搭配不可或缺的真機資料,因為機器人最終仍要把模型能力落到真實物理世界。
除了改善模型本身,王興興這次還提出另一個方向:直接用 AI 改造機器人的研發流程。宇樹正在預研一套物理 AI 機器人自進化系統,讓 AI 搜尋論文與開源方案、自行撰寫控制程式,先進入模擬環境測試,再部署到真實機器人,依 AI 與人類評分結果持續修改。目標是讓資料、技能與測試經驗可以累積,降低每遇到新任務都要重新由工程師開發的成本。
不過,這些模型距離廣泛商用仍有一段距離。宇樹在 8 月上市前路演中表示,WMA 與 VLA 目前仍處於持續研發測試階段,主要在自有工廠等試點場景進行部署驗證。
一邊是資金與人力持續往模型集中,一邊是 WMA、VLA 仍在試點驗證。這也呈現宇樹對現階段機器人產業的判斷:AI 模型既是下一階段最重押的方向,也是人形機器人距離大規模應用仍最需要補上的能力。
從實驗室到產線,機器人正重新定義產業的樣貌。如果你也想站在第一線追蹤這場變革、寫出有觀點與洞察力的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷
【推薦閱讀】
◆ 【中國首家人形機器人 A 股掛牌】宇樹科創板首日飆 460%:年出貨 5,500 台、淨利 2.78 億,美國優勢不復存在?
*本文開放合作夥伴轉載,資料來源:《Reuters》、《Bloomberg》、Unitree 1、Unitree 2、《panews》、《Global Times》,首圖來源:擷取自 Unitree Robotics



