快取價格低至 0.003 美元:DeepSeek V4.1-Flash 省 API 推理,私有化部署卻面臨硬體新考驗

DeepSeek 昨晚推出 DeepSeek-V4.1-Flash,採用 5,520 億參數的混合專家(MoE)主幹架構,具備原生視覺能力與 100 萬 token 上下文視窗,架構重點在於降低反覆讀取大量上下文的成本。

V4.1-Flash 的效率提升:降低 API 開發者的推理成本

V4.1-Flash 離峰時段快取命中每百萬輸入 token 收費 0.003 美元,未命中 0.15 美元,每百萬輸出 token 0.60 美元,尖峰時段價格加倍。AI 代理常反覆處理同一套程式碼庫、工具定義或對話紀錄,重讀的快取上下文可能遠多於新的上下文。DeepSeek 也表示,快取命中費用可能占代理成本的相當大比例。相較之下,GPT-5.6 Sol、Claude Opus 5 與 Kimi K3 的快取輸入價格分別為每百萬 token 0.40、0.50 與 0.30 美元。

《VentureBeat》指出,假設 AI 代理保留 50 萬 token 的可重複使用前綴,並在 100 次請求中都命中快取,若不計快取寫入、新增上下文與輸出,V4.1-Flash 離峰時段約只需 0.15 美元,Kimi K3、GPT-5.6 Sol 與 Claude Opus 5 則分別為 15、20 與 25 美元。但最低價格僅限離峰時段,實際工作負載也難以完美重複利用快取。總成本還取決於輸出長度、推理 token、重試與任務成功率等因素。

V4.1-Flash 採用因果編碼器-解碼器(CED)架構。每個 token 在讀取輸入的預填階段啟用 80 億參數,生成輸出時則啟用 160 億參數。DeepSeek 表示,搭配壓縮稀疏注意力 2(CSA2)與 FP4 KV 快取等技術,全域 KV 快取降至每 token 890 位元組,約為 V4-Flash 的四分之一。

但模型整體規模反而變大。《VentureBeat》提及,前一代 V4-Flash 主幹為 2,840 億參數、活躍參數 130 億。V4.1-Flash 主幹擴大至 5,520 億,另有 1,960 億參數的 Engram 條件記憶模組。換句話說,V4.1-Flash 的效率提升在於讀入 token 時耗用更少運算,並大幅減少保留長上下文所需的記憶體。對使用 API 的開發者來說,這代表推理成本可能更低;但如果企業打算自行部署這款採 MIT 授權的模型,模型規模大幅增加後,所需的硬體資源也會高出許多。

DeepSeek 也明確表示,新架構存在尚未完全釐清的穩健性邊界。在超長上下文的稀疏檢索、快取恢復交界處等未經測試的邊緣案例中,模型可能出現能力退化。不過,DeepSeek 自家測試並未觀察到系統性退化。

V4.1-Flash 提高推理強度評測:成績提升、輸出 token 增至約 2.5 倍

根據 DeepSeek 自行執行的評測,V4.1-Flash 在 DeepSWE v1.1 拿下 74.2 分,略高於 Claude Opus 5 的 74.0 分與 GPT-5.6 Sol 的 73.0 分。但在 Terminal-Bench 3.0 與 4.0,V4.1-Flash 分別以 30.0 比 43.3、31.2 比 51.8 落後 Opus 5。GPQA Diamond 與 SEC-Bench Pro 則由 GPT-5.6 Sol 領先。

《VentureBeat》提及,這些成績都是以最高推理強度 100 測得。DeepSeek 測試顯示,推理強度從 25 提高到 100,DeepSWE v1.1 成績從 66.0% 升至 74.2%,但輸出 token 消耗量約為原本的 2.5 倍。推理強度介於 60 至 80 時,只需不到一半的 token 預算,就能取得最高強度下大部分的準確度。

此外,DeepSeek 已停用 V4-Flash 與 V4-Flash-Vision-Exp,並暫時將既有識別碼導向 V4.1-Flash。自 9 月 14 日起,deepseek-v4-pro 的請求也將轉由 V4.1-Flash 處理,直到 V4.1-Pro 推出為止。《VentureBeat》補充,對開發者而言,關鍵在於兩點。一是工作負載是否輸入量大、重複性高且足以善用快取。二是省下的成本能否抵銷模型規模近乎翻倍、解碼階段啟用參數增至 160 億的代價。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

AI 網攻自動化到哪一步?Anthropic 報告揭漏洞研究、偵察與資料竊取如何 Agent 化

台灣開始思考 AI Agent 怎麼管,數發部點出能力、身分、問責等六個治理層次

9% 作弊、24% 吹哨:DeepMind 揭 AI 代理的「自我治理」為何仍不夠?

*本文開放合作夥伴轉載,資料來源:《VentureBeat》DeepSeek,圖片來源:Unsplash