Google Gemini Robotics 2 登場:如何讓人形機器人「餵資料」就能一路變強?

Google DeepMind 在美國時間 7/30 發表了一系列新版 Gemini 模型:Gemini Robotics 2。相較前代只能指揮一支機器手臂從桌面上拿起一個杯子,新模型能指揮整個人形機器人走向桌子、蹲向較低的層架,並將澆水壺放進最底層的綠色箱,官方還展示了綁垃圾袋、轉燈泡等動作,而這一切都在單一學習策略之下完成。這次官方示範用的,是 Apptronik 的人形機器人 Apollo 2。

為什麼這項升級重要?《Tech Times》分析,這消除了機器人 AI 發展之初便存在、長年限制此領域的架構瓶頸:先前系統仰賴各自獨立的控制器分別負責移動與操作,再於交接點縫合在一起。Gemini Robotics 2 將這種分工整併為單一的端到端視覺語言動作(vision-language-action,VLA)策略,代表任何需要協調全身動作的新行為,現在都能直接訓練進模型之中,機器人也因此變得「可用軟體升級」。

根據《Tech Times》,過去第一個實現對人形機器人上半身進行高頻率控制的 VLA 機器人 AI 是 Figure AI 在 2025 年初發表的 Helix 模型,如今 Google DeepMind 將此概念拓展至全身。Google DeepMind 在官方部落格指出,這次發布是其邁向「實體通用智慧(Physical AGI)」的關鍵里程碑。

三款模型一次看:大腦、執行、離線版各司其職

這次發布是一個系列,共三款模型分工協作。核心的 Gemini Robotics 2 是 VLA 模型,能把影像與語言指令轉成馬達控制,是 DeepMind 首個能控制完整人形機器人的 VLA。

第二款 Gemini Robotics ER 2 是所謂的具身推理模型,扮演機器人「大腦」,負責高層次認知推理:接收自然語言、規劃長達數分鐘的多步驟任務、監控進度,並在不確定時判斷何時該向人類求助,再把動作交給 VLA 執行。它透過 Gemini Live API 以雙向串流端點連接,這代表它能一邊推理接下來的步驟,一邊執行當前的動作,消除了讓機器人 AI 看起來吃力笨拙的「停下來思考」停頓。

第三款 Gemini Robotics On-Device 2 則可在地端離線運行,承襲源自 Gemini Robotics 1.5 世代的「動作轉移」(motion transfer)技術,能在數小時內、以不到 200 組示範範例,適應一個全新的機器人形體。

Google DeepMind 強調,要讓機器人在日常環境中協助人類,光是具備精確的空間推理能力還不夠,機器人還必須快速思考,使其決策和推理的速度與現實世界的即時速度保持一致。

推出機器人的安全基礎設施:ASIMOV-Agentic

不過,讓前沿 AI 模型控制機器人,使其能在工作場所或住宅內自由走動、操縱物體也可能存在風險。《WIRED》報導,過去曾有研究指出這麼做可能會產生意想不到,甚至是危險的行為。

Google DeepMind 機器人部門主管 Carolina Parada 表示,Google 採用多層安全策略,在模型每個層級都設定了防護措施。此外,Google 也推出了衡量機器人安全性的新基準 ASIMOV-Agentic,能偵測指令是否會導致有害或不確定的結果。

攤開實際表現:轉得動燈泡,卻綁不好一個垃圾袋

不過這套模型離「隨處可用」還有段距離,DeepMind 也對外坦承系統不完善的地方。根據《Tech Times》揭露的基準數據,新模型全身抓取的成功率為桌面 68.4%、地面則降到 45.7%;精細動作的落差更明顯:轉鬆燈泡達 92%,綁垃圾袋僅約 44%,最低的畚箕任務更只有 32%,最容易與最難者相差約 60 個百分點。

Google DeepMind 機器人部門總監 Kanishka Rao 向《Bloomberg》表示,真正的靈巧度仍是遙遠目標,機器人動作之所以緩慢,是因為它們得停下來思考人類憑直覺就能完成的決策。

背後與 Apptronik 合作,打造實體 AI 的擴展循環

回到產業層級,《Tech Times》分析,人形機器人業界醞釀十年,如今商用機種開始出貨、真實產線任務也正在被執行,卡關的已不是機器人能不能走、能不能抓,而是背後的 AI 能否應付真實環境的各種變化。Gemini Robotics 2 沒有宣稱解決了這道難題,但它把行走與操作的分工整併進同一套軟體之後,硬體不必更換,機器人的能力就能靠餵進更多訓練資料持續長出來。

而這些訓練資料,來自 Apptronik 在美國德州奧斯汀設立的機器人園區(Robot Park):Apollo 2 機器人在那裡不停運作,為 Gemini Robotics 產生真實世界的資料。用統一的軟體策略、靠硬體夥伴餵資料、再用模型更新換來新能力,《Tech Times》認為這正是實體 AI 規模化的方式,而 Gemini Robotics 2 讓這套循環首度跑在一具完整人形機器人上。

【推薦閱讀】

李飛飛 World Labs 新成果:要讓機器人 AI 規模化,先讓它學習的「世界」規模化

讓機器人「看見觸覺」:新型變色感測器成本低廉,還能即時呈現壓力的細微變化

美國封殺中國新型人形機器人、機器狗:宇樹科技首當其衝,禁令能否帶動製造回流?

*本文開放合作夥伴轉載,資料來源:Google DeepMind《WIRED》《The Deep View》《Bloomberg》《The Verge》A3Google《TechTimes》,首圖來源:Google