單次示範就讓機器人學會新任務?Skild AI 推 S1 挑戰數百小時訓練舊模式

Skild AI 發表最新機器人基礎模型 S1,主打上下文學習(In-Context Learning,ICL),讓機器人透過觀看操作示範,就能快速學會新的工作。相較於傳統機器人需要蒐集大量資料、再針對特定任務進行訓練,S1 不必重新訓練模型,就能將示範內容轉化為實際操作。

看一次就會?Skild AI S1 解鎖複雜任務,手沖咖啡、做鬆餅難不倒

Skild AI 指出,目前機器人要學會新的操作任務,仍往往需要先蒐集大量實際操作資料,再針對特定任務進行模型訓練。即使深度神經網路已能讓機器人完成各種複雜工作,面對沒有學過的新任務時,仍可能需要數十甚至數百小時的訓練資料。Skild AI 認為,機器人基礎模型下一步應朝向如 GPT-3 帶來的上下文學習轉變,讓機器人只需觀看少量示範,就能快速掌握新的工作。

S1 採用的方式,就是讓機器人直接觀看影片學習如何完成任務,而不只是依賴文字指令。模型在大量不同任務上接受預訓練後,能從影片示範中理解人類想完成的目標,進一步判斷操作步驟與執行進度,再將這些資訊轉換成機器人的實際動作,而且不需要重新訓練模型。

這種讓機器人透過示範快速學習的做法,也正逐漸成為機器人基礎模型的發展方向。《Tech Times》提及,Generalist AI 本月發布的 GEN-1.5,同樣主打類似的上下文學習能力,讓機器人觀看人類或機器人自身的操作示範後,就能直接執行新的任務,不必重新調整模型。GEN-1.5 的測試顯示,機器人只需觀看 3 至 12 秒的示範,就能學會拉開鉛筆袋拉鍊、開罐等操作。

不過,相較於目前以短時間操作為主的示範學習,Skild AI 更強調 S1 處理複雜、長時間任務的能力。測試結果顯示,S1 能根據單一影片示範,完成最長達 10 分鐘的任務,而且這些工作在預訓練階段從未出現,包括栽種盆栽、製作鬆餅、手沖咖啡及組裝工具套件等。

「影片教做法、文字只給目標」:揭機器人掌握精細長程任務關鍵

S1 的學習速度也相當快。以栽種盆栽為例,Skild AI 團隊在晚上將土壤、花盆、澆水壺和植物送到辦公室,完成場景準備後錄製操作示範。從錄製示範到 S1 開始自主執行,只花了 11 分鐘。S1 在處理訓練資料中沒有出現過的任務時,也比單純依靠語言指令的視覺—語言—動作模型(VLA)表現更好。Skild AI 以相同資料和運算資源進行測試,當預訓練資料增加至 10 萬小時後,語言提示模型的任務成功率僅約 9%,S1 則達到 66%,相差約 7 倍。

Skild AI 認為,關鍵在於影片示範能直接告訴機器人「怎麼做」。相較之下,語言指令通常只能描述想達成的目標,同一句話可能有多種完成方式。對於翻鬆餅、沖咖啡等需要一連串精細動作的工作,直接觀看示範能讓機器人掌握更具體的操作方式。除了學習新任務,S1 也能根據現場狀況調整做法。例如,示範影片中是用澆水壺替植物澆水,但實際執行時若只有一個杯子,S1 會改用杯子完成工作;又或者示範者在處理雞蛋時不小心將雞蛋摔落,S1 並不會照樣重現錯誤,而是改用較穩定的動作完成同一步驟。

Skild AI 認為,這種學習方式有機會降低機器人進入真實環境後的訓練成本。目前 S1 已開始與 Skild AI 的商業合作夥伴進行實際應用。Skild AI 表示,接下來將持續擴大上下文學習的訓練規模,並從機器人在真實環境中的操作經驗取得更多資料,再將這些資料用於模型預訓練,進一步提升 S1 的學習與應變能力。

從實驗室到產線,機器人正重新定義產業的樣貌。如果你也想站在第一線追蹤這場變革、寫出有觀點與洞察力的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

*本文開放合作夥伴轉載,資料來源:Skild AI《Tech Times》,圖片來源:Skild AI。