Meta 推 Muse Spark 1.3,AI Agent 要長時間替人工作得先解決哪些問題?

AI Agent 開始能連續處理數十、甚至數百個步驟後,模型好不好用,也不再只取決於最後能不能答對。它在過程中會不會反覆繞路、忘記前面的要求,能否正確使用工具、發現計畫有問題後自行修正,以及什麼時候應該把決定交回使用者,都會影響一項工作最後能不能順利完成。

Meta 在 9/2 推出 Muse Spark 1.3,就把這些「怎麼工作」的問題列為升級重點。Meta 這次除了公布 Muse Spark 1.3 在 coding 與 Agent 測試上的成績,也把「Agentic Workflows(代理工作流)」列為升級重點,說明模型如何處理長時間、多步驟任務。從模型訓練、工具使用到第三方 benchmark 的變化可以看出,前沿模型競爭正在進一步延伸到 Agent 完成工作的整個過程。

這些改進背後,也連著 Meta 更大的產品計畫。Meta AI 負責人 Alexandr Wang 向《Axios》表示,Muse Spark 1.3 在實際使用體驗上的進步,將有助於 Meta 發展未來的個人 AI Agent,包括其執行長 Zuckerberg 多次描繪、能全天候代表使用者工作並協助完成目標的 Agent。

少繞路、別忘記要求,Meta 開始最佳化 Agent 工作過程

當使用者交給 Muse Spark 1.3 一個開放式任務,Meta 表示,模型會利用工具從分散、甚至彼此衝突的資料中建立所需脈絡,發現原本計畫有缺口後主動修正,並持續保留已取得的資訊直到完成最終成果。Meta 也針對不同 Agent 執行環境訓練模型,希望它能適應不同工作方式。

另一個改進方向是降低長任務中的行為偏移。Muse Spark 1.3 被訓練在提示不清楚時向使用者追問、遇到無法解決的問題時尋求協助,執行可能產生重大影響的操作前先確認;處理多步驟工作時,也更能持續保留原先設定的限制與要求,降低做到一半遺漏條件或偏離工作流程的情況。Meta 還表示,新模型能更清楚判斷自己的能力與限制,遇到障礙時降低直接虛構結果的可能。

這些改動也開始反映在工具與 token 使用上。Muse Spark 1.3 接受更多長時間 coding 任務訓練後,Meta 工程師比較 1.2 與 1.3 發現,新模型在不需要額外互動時會減少來回次數,整體約少使用 20% 工具呼叫、25% token。

這組數據仍是 Meta 內部測試結果,還無法直接推論所有 Agent 工作都能降低相同比例的成本,但至少透露模型最佳化的對象,已包含完成任務時走了多少步、呼叫多少次工具。

Meta 說新模型更會工作,第三方測試怎麼說?

第三方模型評測機構 Artificial Analysis 的結果,提供了另一層驗證。Muse Spark 1.3 xhigh 在 Artificial Analysis Intelligence Index 得分從前代 57 升至 61,提升幅度主要集中在 Agent 與科學推理相關測試。

其中,測試 Agent 多輪互動與工具操作能力的 Tau3-Bench Banking,Muse Spark 1.3 xhigh 從 35% 提高至 47%;要求 Agent 在終端機環境實際完成工作的 Terminal-Bench 2.1,從 80% 升至 85%;GDPval-AA v2 則由 1615 Elo 提高到 1709。這項測試涵蓋 44 種職業的知識工作,要求模型在 Agent 環境中使用工具,最後交付文件、試算表、簡報等實際成果。

Artificial Analysis 無法證明 Meta 所稱「工具呼叫少 20%」能在不同環境普遍重現,但至少顯示,Muse Spark 1.3 相較前代的主要進步之一,確實出現在需要多步驟執行、使用工具與完成實際工作的 Agent 任務。

模型考試,也開始從答題延伸到完整工作流程

這種變化並不限於 Muse Spark。Artificial Analysis 今年 6 月更新 Intelligence Index v4.1 時,直接將改版定義為往「Agentic Workloads」移動,增加 Agent 類測試的權重。其中 GDPval-AA v2 允許模型執行的回合數從 100 提高至 250,目的就是容納更長的 Agent 任務軌跡。

評估方式也不再只有一個能力分數。Artificial Analysis 同時加入每項任務成本(cost per task)、完成時間(time per task)與 token 使用量(tokens per task),試圖回答模型完成同一類工作時,除了結果好不好,究竟用了多少資源與時間。

OpenAI 近期談 GPT-5.6 的 Agent 設計時,也透露類似方向。OpenAI 表示,自 GPT-5 以來,每一代模型都試圖用更少 token 處理時間跨度更長的任務,GPT-5.6 則進一步利用推理連貫性、程式化工具呼叫與多 Agent 編排等機制,提高長時間 Agent 工作效率。

這些變化顯示,前沿模型的評估單位正在逐漸從單次回答,延伸到一整段工作流程。模型最終能不能完成任務依然重要,但完成過程需要多少步驟、花多少時間與 token,以及能否在長時間任務中維持原始要求,也開始成為能力的一部分。

不過,「工作更有效率」目前還沒有一個單一指標可以說清楚。Meta 在 coding 測試中觀察到 Muse Spark 1.3 比前代少使用約 25% token,但 Artificial Analysis 的 Intelligence Index 測試中,1.3 xhigh 每項任務成本反而從前代 0.40 美元增加至 0.55 美元。Artificial Analysis 指出,其中一個原因是新版在 Agent 評測中平均使用約多 57% 的 input token,output token 則增加約 8%。

換句話說,Agent 可能減少不必要的工具呼叫,同時投入更多 token 讀取脈絡或推理,也可能用更多計算換取更高的任務完成率。單看 token、工具呼叫次數或成本其中任何一項,都還不足以完整衡量 Agent 究竟有沒有「更會工作」。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

AI 基建走向系統級整合,下一波效率從哪來?專訪微軟 Azure 全球基礎架構總經理

量子電腦如何才算「有用」?SEMICON 上,各家正在給出不同答案

SEMICON 矽光子論壇:CPO 下半年進入量產,下一關卡在哪裡?

*本文開放合作夥伴轉載,資料來源:Meta《implicator.ai》《AXIOS》《Artificial Analysis》,首圖來源:Unsplash