人工智慧研究實驗室 DeepReinforce,近日公開一款全新的開源程式碼撰寫模型 Ornith-1.0,並且根據參數量提供 4 種版本,包括 9B、31B、35B 的混合專家模型,以及高達 397B 旗艦模型,日前已全面上架 Hugging Face 並採用 MIT 授權,而且沒有地區使用限制。
DeepReinforce 表示,Ornith-1.0 最特別的地方,在於它是一套專為「AI 代理程式碼撰寫」任務所設計,並且能夠進行「自我最佳化」的開源模型。
懂得開創「專屬作業模式」的 AI
綜觀當前 AI 市場,有能力撰寫程式碼的 AI 模型多不勝數,而在軟體設計領域,AI 代理則能夠主動讀取檔案、執行測試,並且找出失敗原因、修正程式碼,反覆循環直到任務完成。
大多數 AI 程式碼撰寫代理,皆會搭配一套由人類所設計的框架,描述 AI 應該如何推進工作流程的固定規則,舉凡何時應該呼叫工具、如何處理錯誤、如何將多步驟問題進行拆解等。
然而,當今多數的大型語言模型仍是基於「人類回饋」進行設計,並依賴人類預先寫好的框架來運作,可是 Ornith-1.0 卻不同,它是完全為了 AI 代理所設計,並將工作框架本身視為可學習的對象,主動修改策略以共同演化。
簡而言之,當 AI 代理搭配 Ornith-1.0 一同工作時,該模型並不會沿用他人的策略框架,而是會發展出屬於自己的作業模式。
不只解開題目,更同步改善解題方式
DeepReinforce 解釋,Ornith-1.0 採用了強化學習技術,同時該模型的執行步驟,也被分成了兩個階段。首先,Ornith-1.0 會分析該如何完成任務,接著同步提出更精細的策略框架;然後,Ornith-1.0 會再運用更精細的策略框架,產生出更好的解決方案。
這種一邊「解題」又一邊「改善解題方式」的運作流程,讓 Ornith-1.0 得以不斷提升自己的工作效能。
Ornith-1.0 的目標不只是要撰寫出更好的程式碼,更是要找出更好的執行策略,而當該過程被重複數千、數百萬次,那麼專門針對特定任務的最佳處理方法,最終就會自動浮現,不需要任何人工介入。
然而 DeepReinforce 也明白,AI 可能會透過「破解」獎勵機制,導致找出錯誤的最佳化結果。畢竟,當 Ornith-1.0 有能力改寫自己的策略框架,那就同樣有能力欺騙自動化驗證器,例如透過修改檔案狀態,讓從未實際執行過的任務,看起來已經像處理完畢。
為此 DeepReinforce 規劃出三層防禦機制,阻擋 AI 的作弊行為。
首先,Ornith-1.0 的環境與測試套件,皆無法變更且超出模型的控制範圍;其次,模型內建的確定性監控器,將主動標記任何 AI 嘗試存取受限路徑,以及修改驗證腳本的行為;最後,一個處於唯讀狀態的審查模型,會被疊加於原有的自動化驗證器之上,作為最終的否決機制。
測試勝過 Opus,小模型效率更高
根據 DeepReinforce 提供的資料,397B 版本的 Ornith-1.0 旗艦模型,在考驗解決程式碼問題的 SWE-bench Verified 測試中獲得 82.4 分,這個成績勝過了 Claude Opus 4.7 的 80.8 分,以及 DeepSeek-V4-Pro 的 80.6 分。
而在主打程式除錯與解決安全漏洞的 Terminal Bench 2.1 測試中,Ornith-1.0 旗艦模型拿下了 77.5 分,Claude Opus 4.7 則為 70.3 分。
有鑑於 SWE-bench 測試可能存在污染問題,會讓 AI 模型於訓練過程中,記住最佳解決方案並提高分數,DeepReinforce 也採用了題目更加多樣化、難度更高的 SWE-bench Pro 對 Ornith-1.0 進行測試,即便結果令分數大幅下降至 62.2 分,但表現依然勝過 DeepSeek V4 Pro。
強大的 397B 旗艦模型,並非是 Ornith-1.0 最令人驚豔的地方,其僅僅 9B 參數量的基礎模型,其實也在 SWE-bench Verified 評測中獲得 69.4 分。
Ornith-1.0 9B 的表現,不但壓過參數量高出 3 到 4 倍,但僅取得 52 分的 Google Gemma 4-31B,更與 Qwen 3.5-35B 的 70 分不相上下。
並非通用 AI 模型,邊緣硬體更適用
在官方文件中,DeepReinforce 明確指出 Ornith-1.0 不是一款通用 AI 模型,如果將它放在 AI 代理程式碼撰寫以外的任務,其表現可能會不如預期。
Ornith-1.0 最適合的對象與使用情境,將是那些已經部署 AI 代理基礎架構的開發者;他們早已習慣向 AI 代理處理描述任務,並讓程式開發作業於儲存庫或終端機環境中運作,因此希望在無需人工干預的情況下完成多步驟作業。
至於對那些還在猶豫,接下來是否該採用 AI 技術的人,Ornith-1.0 模型顯然並不適合,畢竟該模型主要針對已經成熟的 AI 代理型程式開發流程而來。
特別值得注意之處,在於 397B 參數量的 Ornith-1.0 模型,雖然帳面上確實勝過了 Claude Opus 4.7,但 Anthropic 的旗艦模型 Claude Opus 4.8,於基準測試中的得分依舊更高。
Ornith-1.0 所具備的真正優勢,主要落在了開源領域,尤其是對於正在尋找私有 AI 程式碼撰寫代理、發展 AI 程式開發流程基礎架構,或者從事類似工作的開發者而言,Ornith-1.0 這款有能力運行於邊緣硬體上的中小型模型,在某種程度確實相當實用,但一般使用者或許還是得另外找尋其他更合適的方案。
【推薦閱讀】
◆ 【AI 推理成本革命】不再靠人類直覺設計策略,AutoTTS 讓 AI 自己找最省 Token 推理方式
◆ Anthropic 發現 Claude 藏想法的「J 空間」:只看 AI 寫出來的推理,治理恐怕不夠
◆ 【重新定義 AI 幻覺】Google 提出「忠實不確定性」框架,讓 LLM 學會說「我不確定」而非亂答
*本文開放合作夥伴轉載,參考資料:Decrypt、DeepReinforce,首圖來源:Nano Banana 2
(責任編輯:鄒家彥)



