在過去一年,電腦操作 AI Agent(Computer Use Agent)已經正式跨越單純展示的階段,開始在特定的、可重複的企業工作流程中進行正式部署。這些日常任務包括更新系統紀錄、跨入口網站搬移資料、處理工單,以及操作那些原本缺乏乾淨 API 的舊軟體介面。
轉變的背後,是因為模型操作電腦的能力正在快速飆升。根據 OSWorld-Verified,也就是一項在實體電腦桌面上測試 Agent 跨 Windows、macOS 和 Ubuntu 執行任務的標準檢測的數據顯示,最頂尖的 AI 模型在一年之內,其任務完成率從原本的 42% 上升至 85%,甚至超越人類測試者平均約 72% 的完成率。
然而,創投機構 a16z 提醒,即使在基準測試中達到 85% 的成績,仍代表每 100 個任務中有 15 個以失敗告終。對於要求高度準確、且每個步驟都必須完整銜接的企業流程來說,「會操作電腦」與「能可靠地完成工作」,仍是完全不同的兩回事。
每月 2,000 萬次操作,AI Agent 已開始規模化接手企業流程
儘管如此,部分企業已經開始體會到規模化自動化的威力。在 a16z 的訪談中,一家消費品(CPG)數據平台每月透過自動化系統完成約 1,500 萬至 2,000 萬次入口網站操作(portal interactions)。在這些流程中,這家企業將 AI Agent 作為傳統手寫網頁爬蟲的「自動故障修護備援」,每當零售商網站更動介面、導致原有爬蟲程式碼出錯時,Agent 就會自主診斷問題並搶修自動化流程,在工程師甚至還沒發現錯誤前,就讓重要數據恢復流動。導入此方案後,該公司將專門負責維護網頁爬蟲的工程團隊縮減一半,並成功將這些工程人力重新調配到其他工作流程上。
同時,另一家全球系統整合商也在生產環境中部署 27 個使用電腦操作 Agent 的正式工作流程,每天穩定處理約 1,500 至 2,100 張 IT 工單,最終目標是將低利潤託管服務合約中約 20% 到 25% 的人力重新配置,實現營運優化。
a16z 觀察,目前最適合部署這類 Agent 的場景,依然是那些高頻率、重複、業務規則穩定,且過去需要人工在舊系統上點擊或缺乏 API 的「窄型工作流程」,例如 CRM 資料更新、軟體測試與 QA、政府與保險入口網站操作、零售訂單與合約處理,以及 ServiceNow 上的 IT 工單處理等。
AI 新創 Prentis 押注電腦操作 Agent,任務成本僅前沿模型十分之一
電腦操作 Agent 的商業潛力,也開始吸引創業者與資本投入。由連續創業家 Ritankar Das、LinkedIn 共同創辦人 Reid Hoffman 與 Zynga 創辦人 Mark Pincus 共同成立的 AI 研究實驗室 Prentis,正訓練模型學習辦公室員工如何跨文件與企業系統完成日常工作,目標是打造能直接控制電腦、完成端到端流程自動化的 AI Agent。
Prentis 瞄準的白領工作場景包括保險理賠處理,以及自動處理關稅退款中的例外狀況,進而減少員工為了完成任務而在大量文件中搜尋資訊的時間。截至目前,Prentis 已與醫療管理服務機構、製造商,以及商品與服飾製造商等客戶簽下總價值近 5,000 萬美元的合約。
此外,Prentis 稱其自行研發的 Hive-32B 模型在 WindowsAgentArena 和 ScreenSpot-v2 兩大電腦操作基準測試中,表現皆超越 OpenAI 的 GPT-5.4 與 Anthropic 的 Claude Opus 4.6 等前沿大模型。Prentis 強調,其競爭優勢在於運行更小、更便宜的模型,每項任務成本約只有直接調用前沿模型 API 的十分之一,讓電腦操作 Agent 在大規模日常辦公室應用中更具經濟效益。
隱性錯誤、非同步斷點,AI Agent 為何一遇複雜流程就失靈?
在技術能力突飛猛進的同時,實際部署時的挑戰也隨之浮現。a16z 深度訪談多個企業團隊後發現,現行 AI 最擅長處理的,依然是那些步驟明確、有標準協議可循,且結果容易透過機器自動驗證的標準化任務;一旦工作流程變得複雜,或無法立即驗證結果是否正確,系統就更容易出現問題。
這類落地痛點主要可以歸納為兩大類。第一種是「難以自動勾稽的隱性錯誤」。舉例來說,當 Agent 奉命將合約中的付款條件提取並輸入 ERP 系統時,如果不小心將「付款期限 60 天(net 60)」誤讀為「30 天(net 30)」,這筆不正確的輸入不論在視覺上還是格式上都完全符合規範,也代表它可能順利通過常規的自動化防呆檢驗。最終,這個錯誤可能一路被放行,直到公司發出錯誤發票給客戶時,才會被發現。
第二種則是「與真實世界脫節的非同步斷點」。這種狀況通常發生在無法於操作當下立即確認成功訊號的任務中。例如,當 Agent 在保險網站上送出理賠申請後,網頁畫面跳出「已收到」的提示,對 AI 來說便代表任務已經結束。然而,保險承辦人員可能在兩天後才打電話到辦公室要求確認保單編號。這類線下突發狀況,人類只要花 30 秒接聽電話就能解決,Agent 卻無法感知這項線下事件,導致整筆申請流程可能因此中斷。
對此,a16z 點出一個關鍵的認知盲區:當一項業務的「最終事實(ground truth)」必須在幾天甚至一週後,透過線下渠道才會有結果時,單靠提升模型能力,並無法解決這類問題。企業如果想在生產環境中真正防範這些非同步例外,就必須從 Agent 周邊的系統架構、驗證與例外處理機制著手,從一開始就為這些邊緣狀況設計好應對方案。
AI Agent 採購關鍵轉向可靠性、資安與 ROI
這也帶動企業買家的採購思維出現明顯轉變。在 a16z 的訪談中,企業買家坦言,底層究竟使用哪一家模型,很少是採購電腦操作解決方案時的決定性因素,因為當前的模型能力其實已經足以應付部分工作。相較之下,企業更在乎系統能否在大規模運行下保持穩定、通過嚴格的資安審查,並證明投資報酬率(ROI)。
因此,企業真正需要評估的重點,逐漸轉向環繞模型外圍的基礎設施。這包括工作流程脈絡(context)、權限管理(permissions)、企業專屬知識、結果驗證、人工升級處理機制(escalation),以及異常與錯誤處理能力,而不是單純追逐電腦操作基準測試的排名。
a16z 更訪談到一位管理每月數百萬次自動化任務的企業營運者,他甚至不知道,也不在意系統底層目前使用的是哪個模型。對他而言,技術供應商會像雲端服務商更換伺服器硬體一樣,在後台替換模型;他真正關心的,只有「Agent 是否能穩定可靠地把工作完成」。
面對當前趨勢,a16z 指出,企業目前已經能從高頻率、重複、規則穩定且缺乏 API 的窄型工作流程中,透過部署電腦操作 Agent 獲得效率與成本收益。然而,在現階段,這些部署最好滿足幾個先決條件:具有能立即由機器觀察的成功訊號、失敗後果在可承受範圍內,並且具備清晰的人工接手機制。
隨著「點擊正確按鈕」與「在欄位輸入文字」等基本電腦操作逐漸成為模型的標準能力,電腦操作 Agent 的競爭焦點也正在改變:從一年前的「AI 能不能操作電腦」,轉向更實際的商業問題:AI 能不能可靠地把這份工作完成?
【推薦閱讀】
◆ 【工程師薪資新變數】AI 推論成本進入薪資結構,token 消耗開始成為工程師談判籌碼
*本文開放合作夥伴轉載,資料來源:a16z、《TechCrunch》,首圖來源:Unsplash



