從低成本機械手臂,到移動機器人、人形機器人,再到視覺-語言-動作(VLA)模型,Hugging Face 的 LeRobot 近年持續擴大支援範圍,並以統一資料格式串起資料蒐集、模型訓練與部署。這套開源生態也開始被台灣開發者拿來實驗,從單一手臂往移動、視覺與語音等能力延伸。
這些實作也是 9/16「333 Robots Community Meetup」的焦點,該活動由鴻海科技集團、科技報橘與三創育成共同舉辦,每月透過技術分享、實機展示與交流,聚集機器人開發者、研究者與愛好者。9 月場聚焦 LeRobot,分享開發者實際動手後遇到的資料、模型與系統整合問題。
從萬元手臂玩到移動抓取,LeRobot 為何讓更多人開始下場?
這次分享者之一、AI Agent 工程師與社群專家 Ivan Lee,本身並非機器人專業出身,過去主要接觸機器控制與合成資料。他開始投入 LeRobot,一個重要原因就是近年硬體成本已經明顯下降。
他提到,幾年前想玩機械手臂,設備成本很容易就是數百萬元等級;現在則已有萬元左右的低成本手臂可以入門,再逐步加上底盤、感測器與模型,把系統往移動抓取延伸。再加上 Hugging Face、NVIDIA 等持續釋出開源模型、軟體與開發資源,個人開發者能嘗試的組合也比幾年前更多。
Ivan Lee 就把語音模型、視覺語言模型(Vision-Language Model,VLM)、AprilTag 定位、移動底盤與 LeRobot 手臂串在一起。使用者可以先問有哪些零食,再指定想吃的口味,由機器人辨識、移動並抓取;另一個示範則是從廁所呼叫機器人送來衛生紙。

真正開始訓練後,人類的直覺卻不一定能直接照搬。Ivan Lee 分享,人拿東西時常常邊走邊伸手,但機器人初期學習反而適合把移動、伸手、夾取、確認抓穩與後退拆成明確步驟,讓每一步的訓練資料更清楚。
撿一隻襪子,也得先決定機器人到底要怎麼學
另一位分享者、科技報橘社長戴季全,則從自己過去約三個月用 LeRobot 動手做機器人的經驗出發。他和孩子討論機器人可以做什麼時,兒子提出「幫忙撿襪子」,因此把專案命名為 Project Dobby,取自《哈利波特》中因襪子獲得自由的家庭小精靈多比,希望做出一台能在家中尋找並撿起襪子的機器人。
然而真正做起來,單是撿襪子就得拆成辨識、定位、移動與抓取。光視覺資料,就要涵蓋不同顏色、材質、形態與背景。戴季全估計可能需要約 300~1,000 張影像,而且最好直接使用未來裝在機器人上的攝影機蒐集,避免訓練影像與實際視角不同。

接著還有另一個工程選擇:移動與抓取要一起學,還是分開處理?戴季全表示,他在第一版設計時最後決定把移動與抓取拆開;同時也思考,雙臂與移動平台是否可能分別需要不同模型。相較之下,端到端則是另一條把相關資料交由單一模型共同學習的路線。
經過這段實作,他形容機器人任務就像一條鎖鏈,只要其中一個環節沒做好,整個任務就無法完成。更長期的問題則是資料能不能延續:臂長、馬達或機構不同,原本累積的資料未必能直接沿用,因此還得找出哪些核心能力與資料,可以在不同世代硬體之間共用。
LeRobot 不只是一台手臂,重點還在背後的學習流程
NVIDIA DLI AI 白金級大使、臺灣科技大學資訊工程學系兼任助理教授曾吉弘,則從整體架構說明 LeRobot。他指出,LeRobot 並不是單指某一台機器人,而是一套資料管線,依序包含四個環節:透過遙操作(Teleoperation)示範並蒐集資料、建立記錄影像與機器狀態的資料集(Dataset)、訓練策略模型(Training Policy),最後再部署(Deployment)到真實機器人上執行動作。

下一場 333 Robots Community Meetup 將於 10/14 登場,以「AI 機器人 × 真實場域 × 人機協作」為題,邀請女媧創造 NUWA Robotics 營運長張智傑(Daniel Chang),從長期投入服務型與工業型機器人的經驗出發,分享教育陪伴、迎賓導覽、配送巡檢、工業物流與自動化等不同場域的實際觀察,並討論企業如何找到適合機器人執行的工作,重新設計人與機器的分工,逐步建立可運作、可規模化的人機協作體系。

【推薦閱讀】
◆ 人形機器人民主化:Hugging Face 的 LeRobot 要讓任何人都能做真機 AI 實驗
◆ RobCo 估值 9 個月翻倍破 10 億美元:德國實體 AI 機器人新創晉升獨角獸
◆ 【333 Robots Community Meetup】從 Gesture HW1 到人形格鬥機器人,開發者怎麼把機器人做出來?
*圖片來源:《TechOrange》拍攝。



