參數不到 Cosmos 一半卻登頂 RoboLab:BFL 開放權重模型 FLUX 3 Action 登場

以影像生成模型 FLUX 打響名號的德國 AI 新創 Black Forest Labs(BFL),近日宣布推出機器人模型 FLUX 3 Action,正式跨足機器人領域。《VentureBeat》報導,這款模型擁有 70 億參數,採開放權重形式發布。

從影片生成跨足物理表徵:FLUX 3 Action 如何預測機器人動作

FLUX 3 Action 是一款世界動作模型(World Action Model,WAM),能接收攝影機畫面、機器人當前狀態與自然語言指令,進一步預測機器人接下來應執行的動作。相較於只辨識眼前環境,BFL 希望模型能進一步掌握物體如何移動、環境如何變化,以及機器人的行動可能帶來什麼結果,讓模型具備從「理解世界」到「採取行動」的能力。

《VentureBeat》指出,這款模型的表現也可從 BFL 公布的基準成績觀察。FLUX 3 Action 在 NVIDIA 開發的 RoboLab-120 機器人策略模擬基準中,涵蓋視覺理解、關係推理與程序技能等 120 項任務,整體成功率達 42.92%。BFL 表示,這項成績比先前公開排行榜的最高紀錄高出 6.1 個百分點;在 FLUX 3 Action 發表前,OASIS WAM 曾以 39.0% 的成功率排名第一。

不過,這些數據主要反映 FLUX 3 Action 在 RoboLab-120 測試環境中的表現,不宜直接與其他機器人模型的基準成績比較。不同模型可能採用不同的任務、硬體與評估方法,例如 Ai2 的 MolmoAct 2 約有 50 億參數,NVIDIA 的 GR00T N1.7 則約有 30 億參數,但兩者與 FLUX 3 Action 並非在相同測試條件下評估。

FLUX 3 Action 的技術基礎,則延續 BFL 對影片生成模型的研究。BFL 認為,模型如果能從大量影片中學習物體運動、接觸與因果關係,就能建立對物理世界的內部表徵,進一步將這些能力用於機器人控制。

因此,在訓練過程中,FLUX 3 Action 不只學習預測下一個畫面,也同時學習預測機器人應採取的動作。實際執行任務時,模型會根據攝影機畫面、機器人當前狀態與任務指令,一次產生接下來 32 個動作;機器人執行後,再根據環境的新狀態重新判斷下一步,形成持續更新的控制流程。

BFL 也將 FLUX 3 Action 應用於不同實驗場景,包括控制無人機飛行,以及操作經典第一人稱射擊遊戲《Doom》。公司表示,模型在《Doom》測試中成功完成遊戲,過程中沒有角色死亡。BFL 也強調,這些成果目前仍屬早期實驗,不能因此視為模型已具備正式生產環境所需的能力。

BFL 釋出 FLUX 3 Action 權重與程式碼,助開發者免從零訓練機器人模型

在實體機器人測試上,BFL 表示,團隊使用約 200 個遠端操作(teleoperation)示範片段進行微調,內容涵蓋少數幾種取放任務,而且測試時使用的物品並未出現在訓練資料中。其中一項展示中,機器人第一次執行任務時出現錯誤,之後再次嘗試表現較佳。

BFL 認為,這類表現顯示預訓練世界模型有機會降低機器人對大量特定任務示範資料的依賴。但目前僅有少數展示案例,還不足以證明模型能在不同機器人與環境中穩定處理未知情況,相關能力仍有待進一步測試。

此次發布的另一項重點,是 BFL 將開放 FLUX 3 Action 的模型權重、程式碼與微調方法,並提供以 SO-101 機器人搭配 Hugging Face LeRobot 框架的實作範例。機器人開發團隊因此可以直接從預訓練模型出發,再利用自家機器人蒐集的示範資料進行微調,不必從零開始訓練機器人基礎模型,也能依照實際需求自行部署模型。

FLUX 3 Action 的推出,也讓 BFL 加入 NVIDIA、Ai2 等公司推動的開放機器人模型生態系。NVIDIA 的 GR00T N1.7 約有 30 億參數,主要面向通用人形機器人;Ai2 的 MolmoAct 2 則約有 50 億參數,同樣提供模型權重與微調工具。

《VentureBeat》補充,目前機器人領域仍缺乏一套能涵蓋不同硬體、模擬環境、真實世界任務與不同機器人形態的統一評估標準。因此,FLUX 3 Action 在 RoboLab-120 的成績,主要反映其在該基準中的表現;至於能否將相關成果複製到其他機器人與實際生產環境,仍有待更多外部團隊進行測試。

*本文開放合作夥伴轉載,資料來源:《VentureBeat》Hugging Face,圖片來源:Black Forest Labs/Hugging Face。