李飛飛 World Labs 新成果:要讓機器人 AI 規模化,先讓它學習的「世界」規模化

由李飛飛(Fei-Fei Li)共同創辦的 AI 新創 World Labs 於 7 月 28 日公開最新研究成果,發表一套名為 Real-to-Sim-to-Real(R2S2R)的機器人訓練與評估引擎。這家以生成 3D 世界起家的公司提出一個與主流不太一樣的判斷:要讓機器人真正規模化上工,關鍵瓶頸並非更強的模型架構,而是能否大量打造出訓練與驗證機器人的「世界」。

而它給出的解法,是把一次真實任務變成上千個可反覆訓練的模擬世界,讓機器人在完全沒有真實資料的情況下也能學會複雜動作。

李飛飛是史丹佛大學電腦科學教授,曾主導催化深度學習浪潮的大型影像資料集 ImageNet。她長期以「空間智慧」(spatial intelligence)作為研究主軸,主張無論虛擬或真實的物理世界,都運行在與文字不同的底層之上。

機器人展示驚豔、上工卻不可靠,問題出在哪?

World Labs 指出,當前許多實驗室裡的機器人展示看似進展亮眼,但真正的難題是讓它們在真實世界穩定運作。現實場景中物體會移動、雜物會堆積、光線會改變,每一次物理互動也不盡相同,這道從精彩展示到可靠運作的落差,正是機器人系統難以規模化的主要障礙。

問題出在讓機器人上工的成本。依 World Labs 說法,要讓機器人適應真實世界,需要大量資料收集與在實體硬體上反覆測試,每換一項任務或環境都可能得投入可觀人力,一旦失敗又難以即時察覺、修復代價也高昂。

近年機器人學習方法本身進展快速,例如視覺語言行動模型(vision-language-action models, VLAs)與世界行動模型(world-action models, WAMs),但 World Labs 認為真正的瓶頸不只在架構,而在能否大規模取得經驗與評估。

機器人的經驗資料不像訓練語言模型的網路文本那樣廉價易得:每一輪迭代都在消耗硬體時間,物件要重置、失敗要善後、系統要維護,即便是網路規模的影片資料,也無法有系統地涵蓋機器人可靠部署所需的各種環境、物件、物理特性與失敗情況。也正因為策略評估仍高度綁在實體硬體上,機器人開發的迭代速度比語言模型慢上好幾個量級。

這個判斷呼應著李飛飛先前提出的世界模型功能分類。她把如今統稱「世界模型」的技術分成三種:追求視覺擬真、輸出像素的渲染器(renderer),輸出幾何、物理與動態等真實「狀態」的模擬器(simulator),以及決定「下一步該做什麼」的規劃器(planner)。其中最少受到公眾關注的模擬器,反而是最關鍵的一環,因為視覺外觀與行動後果都能由此推導。

World Labs 先前推出的首款世界模型 Marble 是這個方向的第一步,而這次的 R2S2R,則把「模擬器是關鍵」的主張落到機器人訓練的具體做法上。

一次真實任務,生成上千種模擬世界

R2S2R 的核心,是把一次真實任務轉化為可反覆生成、訓練與測試的模擬世界,藉此降低對實體資料與硬體測試的依賴。這套引擎分為兩個環節。

前半段 real-to-sim(真實到模擬),先把一次實體任務的機器人、感測器、環境、物件與互動,重建為一個保留關鍵觀測與動態的模擬,再系統化地改變外觀、物件配置、雜物、物理條件、機器人狀態與相機視角。同一個任務,就此衍生出上千個可控的變體,湊出機器人要能舉一反三所需的多樣經驗。後半段 sim-to-real(模擬到真實),則是在這些模擬世界裡訓練與測試策略,並判斷模擬表現能否準確預測真實表現。

World Labs 表示,這次最關鍵的成果,是把 real-to-sim 與 sim-to-real 兩端接成一個閉環。據其公布,完全只在模擬中訓練、未使用任何真實資料的策略,可直接遷移到多種不同的實體機器人與任務上:從繞著冰箱布設可變形電源線、插拔纜線,到夾取試管、從雜物堆中逐一抽出麥克筆等動作,都能在無人介入下自主運作達一小時。

評估端的證據,則更能說明「舉一反三」的成色。World Labs 以一項雙臂交接方塊的任務為例,讓每個模型版本在模擬中跑 2,000 次試驗、在真實硬體上跑 100 次對照;無論是在訓練資料涵蓋過的「分布內」(in-distribution, ID)情境,或刻意留在訓練範圍外的「分布外」(out-of-distribution, OOD)情境,模擬中表現較好的策略,在真實硬體上同樣較好。

這代表團隊可以先在模擬裡篩掉大量不理想的版本,把昂貴的硬體測試留給少數最有潛力的候選。這套 R2S2R 能力,則來自 World Labs 於 7 月 21 日納入的模擬新創 SceniX,該團隊專注於讓模擬訓練成果能可靠轉移到真實硬體。

機器人開發的價值重心,正在移動

World Labs 的整套主張,指向對世界模型價值的重新定位:能讓機器人在其中學習、並把成果正確帶回現實的世界,才是價值所在。

這也是一塊商業想像不小的市場。李飛飛先前曾引用 NVIDIA 的估計指出,光是該公司的 Omniverse 平台,可觸及市場規模就超過一兆美元,涵蓋工廠、倉儲、供應鏈與數位分身。

模擬與真實之間的落差長年存在,一直是機器人研究想跨越的目標。R2S2R 的意義,在於把這道過去被視為障礙的落差,轉化成一個可以在模擬裡反覆訓練、評估與改進的工程流程,讓機器人開發有機會擺脫「慢、貴、綁在硬體上」的迭代方式,走向更可規模化、成本更低的訓練與驗證。正如 World Labs 在文章最後所說:「要讓機器人的智慧規模化,就必須讓機器人學習的世界規模化。」

【推薦閱讀】

李飛飛拆解「世界模型」3 大分類,Google、NVIDIA 談的世界模型不是同一件事?

【後 LLM 時代】AI 頂尖研究者競逐的下一個前沿:從預測文字到理解物理世界

AI 為何不再「越大越好」?專家:新一波擴展定律關鍵在「世界模型」

*本文開放合作夥伴轉載,資料來源:A16ZWorld LabsDr. Fei-Fei Liexplainx.ai,首圖來源:擷取自 World Labs