GPT-6 Astra 正式登場,為何 OpenAI 總裁認為 AGI 時代已到?

OpenAI 在美國時間 9/3 推出 GPT-6 Astra 新模型,正式跨入第六代模型世代,並將它形容為「新一代智慧(a new generation of intelligence)」。值得關注的是,OpenAI 共同創辦人暨總裁 Greg Brockman 在媒體簡報上表示,如果幾年後回頭問「AGI 是什麼時候出現的」,答案可能就是現在,甚至可能就是 Astra;他個人認為,AI 已經進入「AGI 時代」

距離 OpenAI 去年推出 GPT-5 已歷經約 13 個月,期間雖陸續更新至 GPT-5.6,但這次是正式換上新的主版本號。究竟 Astra 跨過了哪些能力門檻,讓 OpenAI 不只將它定位為新一代模型,也開始做出如此積極的 AGI 判斷?

電腦操作更快更準,Astra 把多步驟工作串起來

OpenAI 這次最強調的能力之一,是電腦使用computer use)。AI 操作電腦並不是到 Astra 問世才出現,2025 年 OpenAI 的 Operator 就已能辨識螢幕、點擊和輸入文字;真正長期卡住的,是模型能不能快速、準確地連續執行大量步驟,讓使用者把一整段工作交出去。

OpenAI 表示,新模型能填寫表單、更新 CRM、整理行事曆,也能完成網路研究後把摘要寫進文件,甚至分析資料、建立網站,再自行進行前端 QA,把不同軟體中的操作串成完整流程。

除了新模型本身,OpenAI 也同步更新 Codex 的執行框架(harness)。兩者結合後,在 Mind2Web benchmark 上,完成任務的速度比目前 GPT-5.6 Sol 的使用體驗快 1.9 倍。OpenAI 公布的 OSWorld 2.0 測試也顯示,Astra 得分由 GPT-5.6 Sol 的 65.7% 提高至 72.6%,每項任務模擬時間則從約 75 分鐘縮短至 40 分鐘;更貼近工作流程自動化的 AutomationBench,分數也由 18.1% 提高至 41.4%。

實際任務的時間差距更直觀。OpenAI 測試指出,找工作的研究任務,人類原本約需 5 小時,Astra 則在 2 分 51 秒內完成。

這項能力也延伸到一般專業工作。OpenAI 表示,Astra 經過針對專業環境的訓練,更能判斷任務中哪些缺失資訊可以自行補足、哪些情況需要回頭詢問使用者;即使工作途中收到新的要求,也較能維持原本目標,最後直接產出符合既有格式的文件、試算表、簡報與分析結果。

軟體工程能力方面,Astra 在 Terminal-Bench 4.0 得分由 GPT-5.6 Sol 的 37.3% 升至 57.9%,並強化長時間 coding 任務的持續性。在 Codex 中,即使原有 context 用完,模型仍能保存工作筆記、搜尋先前需求、測試結果與工具輸出,降低大型重構或長時間除錯時遺失前文資訊的問題。

推理與科學能力也往前推進。Astra 在測試陌生問題解決能力的 ARC-AGI-3 得分達 99.9%,高難度數學測試 FrontierMath Tier 4 則達 98%。OpenAI 也表示,Astra 已協助處理部分長期未解的數學問題。

OpenAI 將 Astra 形容為在電腦操作的速度、準確性與安全性上「跨入新的階段」。Brockman 則向外媒表示,Astra 代表「人們可以把什麼樣的工作交給 AI,以及 AI 能如何賦能使用者,出現了真正的轉變」。這對企業的意義在於,能交給 Agent 的工作單位,正從零散任務逐步擴大成一整段工作流程。

不過,Astra 短期內仍不會一次全面開放。OpenAI 目前先向資安計畫 Daybreak 的特定企業客戶提供 Astra,並表示未來幾天內將陸續開放 Plus、Pro 與 Enterprise 使用者,也會透過 OpenAI API 與 AWS 提供;一般版本則會拒絕執行部分進階資安任務。

為什麼 OpenAI 現在開始談 AGI?

《Fortune》指出,AGI 至今沒有公認定義。OpenAI 過去曾把 AGI 描述為,能把所有具經濟價值的工作做到與人類相當或更好的自動化系統。

Brockman 過去原本想像,AGI 可能會像跨過一道清楚門檻般出現;這次他的說法則有所改變,認為 AGI 更可能是一點一點累積形成。隨著電腦使用、專業工作與長時間 Agent 任務逐漸成熟,在他看來,現在已可以合理視為進入 AGI 時代。

這項判斷還有另一層背景,AI 正更深入參與前沿模型本身的開發。OpenAI 研究訓練副總裁 Aidan Clark 表示,Astra 是首款由前代模型「大量參與」監督訓練的 OpenAI 前沿模型。到了 Astra 訓練後期,模型已能協助處理部分訓練故障,讓工作快速恢復。

Astra 本身也用了 OpenAI 至今規模最大的訓練作業。Clark 表示,這是 OpenAI 第一次在德州 Stargate 資料中心使用超過 10 萬顆 GPU 進行預訓練。這項數字無法直接證明 Astra 已達 AGI,但顯示 OpenAI 在第六代模型上,無論訓練規模或 AI 參與研發的程度都進一步提高。

跨過 Critical 資安門檻,監控也出現新難題

能力提升也讓 Astra 進入更敏感的資安風險區域。它是第一款達到 OpenAI「Critical(關鍵)」資安能力門檻的模型。根據 OpenAI 資料,在沒有產品防護措施的測試中,Astra 在 ExploitBench 得到 100%,並在近期漏洞測試中發現並利用兩個此前未知的 zero-day(零日)漏洞。OpenAI 因此限制部分進階資安能力的開放範圍。

另一個更棘手的問題,是如何監控模型行為。OpenAI 承認,在刻意要求模型規避監控的測試中,Astra 寫出的推理比 GPT-5.6 Sol 更難監控,原因包括它對簡單任務的書面推理有更高控制力,也能用更少步驟解題。

《Reuters》引述 OpenAI 首席科學家 Jakub Pachocki 表示,模型能力越強,要完整理解它究竟能做什麼也會變得更困難,智慧能力進步也不代表對齊(alignment)會同步提升。

Astra 是否足以被稱為 AGI,仍取決於採用哪一套定義。不過,OpenAI 現在談 AGI 的依據已逐漸從抽象的模型有多聰明,落到更具體的問題,即人類究竟能把多少完整工作交給 AI。當 Agent 能承接的工作越來越長、需要人介入的環節越來越少,如何維持監督與控制,也會跟著成為下一階段的重要考驗。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

Gemini 3.8 Flash 軟體工程測試勝 Fable 5?Google 新模型上線:定價不變但 token 用量增

調查發現 76% 工程師更愛 Claude Code 勝過 Codex,關鍵差異是什麼?

Google 看 AI 硬體下一步:運算便宜、搬資料昂貴,專用化還會加深

*本文開放合作夥伴轉載,資料來源:《Reuters》《WIRED》《The Verge》OpenAI《Bloomberg》《Fortune》,首圖來源:截圖自OpenAI