Jev 爆紅後 Strands Decider、Clef 接連登場,決策模型正走出哪些不同路線?

TypeSafe 9 月中推出 Jev 後,「決策模型(Decision Model)」快速成為 AI 領域的新熱點。不到三週,OpenAI 推出 Decisions API,AWS、Cloudflare 接連發布 Strands Decider 2B 與 Clef,開發者社群與研究團隊也快速跟進。這波熱潮背後,是 AI 代理內部不同工作的分工開始被重新檢視。

《VentureBeat》指出,如果系統只需要回答「這個工具該不該執行?」或「這筆請求該走哪一條路徑?」這類答案範圍明確的問題,讓大型語言模型先生成一段解釋,反而會增加時間與成本。決策模型則直接替預先允許的答案評分,因此更適合放在 AI 代理周邊,頻繁處理工具選擇、路由或操作檢查等窄範圍判斷;寫作、程式設計與複雜推理,仍交給能力更完整的生成式模型。

而隨著更多業者加入,決策模型也不再只有一種做法,AWS、Cloudflare 與其他開發者團隊,開始從模型大小、部署方式、多模態能力與架構設計上做出不同取捨。

延伸閱讀:Jev 為何爆紅?AI Agent 正重新分配「誰來做決策」

Jev 帶起熱潮,OpenAI 也把決策能力獨立做成 API

TypeSafe 9/15 推出 Jev,讓模型讀取目前狀態與預先定義的問題後,直接回傳選項、分數或是非判斷,以及各答案的機率,不需要像一般大型語言模型逐字產生回答。

OpenAI 9/29 也在 DevDay 發表 Decisions API。它不是另一款獨立決策模型,而是使用 OpenAI 的 Luna 模型,讓開發者先定義問題與有限選項,再由模型根據文字或圖片進行分類、請求路由,或選擇 AI 代理下一步行動。OpenAI 的加入顯示,這種設計思路已不只停留在新創或開放模型社群,也開始被大型 AI 業者做成正式產品能力。

AWS 推 Strands Decider,押注小型化與自行部署

AWS 10/1 推出的 Strands Decider 2B 僅約有 20 億參數,以阿里巴巴 Qwen 團隊的 Qwen3.5-2B 基礎模型為底層,移除原本負責逐字產生文字的元件,改成直接替候選答案評分。

AWS 的重點不是單純追求更高測試分數,而是把模型做得夠小,讓企業能直接放在自己的環境執行。Strands Decider 可在一般 CPU、GPU 或個人電腦上運行,AWS 也公開模型權重、程式碼、訓練資料與方法,方便企業自行部署、修改,甚至避免每次判斷都必須呼叫外部雲端模型。《VentureBeat》因此指出,Strands Decider 目前最明顯的差異不在於已證明比 Jev 更準,而是開放、自行部署與可重現。

AWS 還示範把它放在 AI 代理真正呼叫工具之前。當代理準備查詢天氣,卻在使用者沒有提供所在地時自行猜測城市,Strands Decider 會先判斷這項參數有沒有依據、現在是否適合執行,再讓系統決定放行、阻擋或要求進一步確認。

AWS 傑出工程師 Marc Brooker 向《TechCrunch》表示,AWS 是在與客戶討論 AI 代理流程時發現這類需求,也就是許多工作步驟其實不需要完整大型語言模型的能力與成本,因此促成 Strands Decider 這類專門處理有限判斷的模型。

Cloudflare Clef 不追求最小,改押多模態與企業微調

Cloudflare 同日推出 Clef 與 Clef-flash,走的路線和 AWS 不太一樣。兩款模型分別採用較大的 Qwen 系列模型為基礎,除了文字,也能處理圖片與影片,並支援更長的輸入內容。

Cloudflare 還把模型部署在 Workers AI,並同步推出強化學習微調服務,讓企業依自己的資料與判斷規則調整模型。另一個值得注意的地方,是 Clef 直接相容 Jev 的 API,原本使用 Jev 的應用不需要重新改寫整套呼叫介面就能切換模型。這代表 Jev 帶來的影響可能不只是一款熱門模型,它採用的輸入、問題與機率輸出形式,也開始被其他業者沿用。

不過,Clef 的硬體門檻也更高。《The Register》指出,Clef-flash 與完整 Clef 自行部署分別約需 41 GB 與 85 GB 顯示記憶體,明顯高於 AWS 的 2B 模型。報導也提醒,Cloudflare 雖稱 Clef 為開源模型,但沒有公開完整訓練資料,因此更精確的說法應是開放權重。

不只三款,決策模型也開始分尺寸、分架構

而且決策模型已不只 Jev、Strands Decider 與 Clef。《VentureBeat》整理,Jev 推出後數週內,市場陸續出現 Laya、Kev、Bespoke Nimble 9B、Mapika decider、FLock this-that-model 等模型,而且設計方向已開始分化。例如 Laya 僅 4.21 億參數,Kev 則提供不同模型尺寸。

史丹佛大學與 NVIDIA 的 CLM-8B 更從架構下手,把目前狀態與候選行動分開處理,讓重複使用的行動可以預先計算,試圖降低 AI 代理反覆從同一批工具或行動中做選擇時的成本。

不過,模型快速增加也讓差異化成為新的問題。《TechCrunch》指出,Jev 問世後已有數十個類似模型出現,既反映市場對這類技術的興趣,也讓它們究竟能產生多少獨立價值受到檢視。

Brooker 認為,決策模型真正的技術挑戰,是在速度、準確率、機率校準與通用理解能力之間取得平衡。另一方面,這類較小模型的開發成本可能只有數百到數千美元,因此他也不認為市場一定會由大型前沿 AI 公司主導。

目前不同團隊已開始從模型大小、架構、部署方式與多模態能力尋找決策模型的不同解法,這也讓下一個值得觀察的問題在於,哪些 AI 代理工作適合真正從大型語言模型拆出來,以及這些專門模型能否在降低延遲與成本的同時,維持足夠的判斷品質。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

◆ Gemini 4 終於登場:一次可輸出 100 萬 token,Google 為何要把 AI 單次工作量做這麼大?

◆ OpenAI 推出 Dots 到底新在哪?AI Agent 正從「接任務」走向「接責任」

*本文開放合作夥伴轉載,資料來源:Strands Agents、《VentureBeat》1、《VentureBeat》2、《TechCrunch》1、《TechCrunch》2、《The Register》,首圖來源:AWS