GPT-6 Astra 的實務升級,不在接近滿分的 ARC-AGI-3,而在它能用更少時間完成跨軟體工作。 OpenAI 於 2026 年 9 月 3 日發布 GPT-6 Astra。官方的 OSWorld 2.0 延遲模擬顯示,它每項任務約花 40 分鐘,比 GPT-5.6 Sol 的 75 分鐘少 47%,分數則由 65.7% 升到 72.6%。同一個模型也成為 OpenAI 首款達到 Preparedness Framework 資安「Critical」門檻的公開部署模型。

這兩件事得放在同一張部署圖上看。Agent 愈快、能操作的工具愈多,企業得到的生產力愈大;錯誤權限、惡意提示注入或越界行動的影響也會放大。Astra 值得測試,但部署方式應從「換一個模型名稱」升級為權限、驗證與停止條件都能被稽核的系統。

OpenAI GPT-6 Astra 官方產品頁主視覺

接近封頂的跑分,反而不是最有用的訊號

OpenAI 公布的數字很容易搶走注意力。Astra 在 ARC-AGI-3 得到 99.9%,FrontierMath Tier 4 v2 得到 97.6%,ExploitBench 得到 100%。它在 Terminal-Bench Science 0.1 也從 GPT-5.6 Sol 的 22.4% 拉高到 64.6%。

分數接近上限時,評測的區辨能力會下降。99.9% 能證明 Astra 在指定 harness、工具與評分規則下幾乎解完題目,卻無法告訴團隊它會不會正確理解內部流程、在第三十個步驟仍保留限制,或碰到資訊不足時停下來詢問。

真正能拿來排導入優先順序的,是下面幾組差距:

評測或操作指標 GPT-6 Astra GPT-5.6 Sol 導入時該怎麼讀
OSWorld 2.0 72.6% 65.7% 跨應用操作成功率提高,但仍有約四分之一未完成
OSWorld 模擬時間 約 40 分鐘 約 75 分鐘 Astra 每項任務少花約 47% 時間
AutomationBench 41.4% 18.1% 專業工作自動化進步明顯,離穩定全自動仍很遠
Terminal-Bench 4.0 57.9% 37.3% 終端與多步驟程式工作有實質增幅
DeepSWE v1.1 74.1% 72.7% 純程式修復只增加 1.4 個百分點,不宜只看型號升級
內部資料庫遷移任務 63.9% 42.7% 跨檔案、工具與驗證的工程任務更能看出差距

DeepSWE 的小幅進步尤其重要。它提醒開發團隊,Astra 並未在每一類程式題都大幅領先;較明顯的差別,是它能把瀏覽器、終端、文件與程式庫串成完整工作流程。

把 OpenAI 的完整表格攤開,程式能力的差距更小。DeepSWE v1.1 中,Astra 是 74.1%,Claude Opus 5 是 73.7%,Gemini 3.8 Flash 是 73.8%,最高與最低只差 0.4 個百分點;官方目前列出的 Sol 分數是 72.7%。這張表沒有納入 Muse Spark 1.3,也不能單靠它判定跨品牌的絕對第一名。對採購與模型路由而言,這組數字支持的是「第一梯隊很擁擠」,不是 Astra 已在所有程式工作拉開差距。

47% 省時,必須拆成模型與 harness 兩筆功勞

OpenAI 表示,Astra 在 OSWorld 2.0 的延遲模擬中,以約 40 分鐘得到 72.6%,GPT-5.6 Sol 則以約 75 分鐘得到 65.7%。另一項 Mind2Web 測試顯示,更新後的 Codex harness 加上 Astra,完成任務的速度是現行 GPT-5.6 Sol 體驗的 1.9 倍。

但 1.9 倍不能全記在模型帳上。Mind2Web 的結果同時包含 Codex 執行框架更新。企業自己的 Agent 若仍使用高延遲工具、重複截圖、過度驗證或沒有快取,換成 Astra 也不會自動得到相同結果。

OpenAI 官方 GPT-6 Astra 電腦操作評測表

內部測試最好把三層拆開:

  1. 模型層:相同提示、工具與權限,比較完成率與錯誤類型。
  2. harness 層:固定模型,測量截圖、DOM、終端與檔案工具的等待時間。
  3. 工作流層:加入真實核准點、重試上限與人工交接,計算整體完成時間。

如果只記錄最終答案好不好,團隊會錯過 Astra 最可能帶來的效益:它縮短的是整段任務,不單是最後一次推理。

API 規格讓高價長上下文更容易被低估

GPT-6 Astra 的 API 型號是 gpt-6-astra。官方模型頁列出 105 萬 token 上下文、12.8 萬 token 最大輸出與 2026 年 4 月 30 日知識截止日。它支援 Responses API、函式呼叫、結構化輸出、網路搜尋、檔案搜尋、電腦操作、MCP、Hosted Shell、Code Interpreter 與 Apply Patch。

API 欄位 官方標準價格或限制
每百萬輸入 token USD 10
每百萬快取輸入 token USD 1
每百萬快取寫入 token USD 12.50
每百萬輸出 token USD 50
上下文視窗 1,050,000 token
最大輸出 128,000 token
超過 272K 輸入 全次請求的輸入與快取費率 2 倍、輸出費率 1.5 倍
Fast mode 標準價格 2 倍,官方稱速度最高可達 2 倍

105 萬 token 看起來很安心,帳單未必。當輸入超過 272K,費率會按整次請求重新計算。把整個程式庫、歷史對話與工具輸出塞進單一請求,可能同時增加延遲與帳單。

Codex 另提供實驗性的內容管理功能。它用筆記與可搜尋歷史保留長任務資訊,減少反覆把所有內容壓成同一份摘要。Plus、Pro 或 Pro Lite 登入可在 config.toml 開啟:

features.context_management.experimental_mode = true

這個功能適合大型重構與長時間除錯。它仍是實驗功能,導入前應用同一批任務比較資訊召回、錯誤重複與總 token,而不是直接假設搜尋式歷史一定更省。

Astra 在 Codex 還加入非同步提問:遇到可能改變結果的問題時,它可以先詢問,同時繼續處理不依賴答案的工作。使用者沒有回覆時,一般性空缺可用合理假設往下走;會造成重大後果的決策仍應等待。要真的省到時間,harness 必須標出任務依賴、可先執行的分支與核准門檻,否則只是換一個介面等答案。

Critical 資安能力讓「最小權限」成為產品需求

OpenAI 的 system card 將 Astra 列為首款達到資安 Critical 門檻的模型。官方說明,在具備適當工具與存取權時,它能找出先前未知的安全弱點,並在不需要人類逐步引導的情況下,針對防護完善的系統發展利用方法。

發布評測裡,Astra 在 ExploitBench 得到 100%,GPT-5.6 Sol 為 78.5%;使用 2026 年 6 月至 8 月新弱點的內部版本,兩者分別為 39.0% 與 11.5%。Astra 也在測試中發現並使用兩個先前未知的零時差漏洞,OpenAI 表示正在向維護者揭露。

OpenAI 官方 GPT-6 Astra 資安能力評測表

這些能力不代表一般使用者會拿到不受限制的攻擊工具。公開版本會拒絕建立較進階漏洞概念驗證等請求。更寬鬆的防禦工作流將透過 Daybreak 的審核存取提供。OpenAI 也把 misalignment monitoring 套用到所有使用工具的 Astra 外部推論,API 任務若被安全檢查攔下會直接停止。

企業不能只靠 OpenAI 在外層踩煞車。至少要在自己的 Agent 架構加入四項限制:

  • 預設唯讀,寫入、刪除、部署與外部訊息各自要求明確權限。
  • 對資料庫、雲端帳號與生產系統使用短效憑證,不把管理員權限交給整段工作流。
  • 在不可逆行動前保留人工核准,並讓核准內容包含目標、範圍與預期差異。
  • 保存工具呼叫、實際差異、拒絕原因與人工覆核結果,供事後回放。

對齊分數更好,不等於監控變簡單

Astra 在 OpenAI 的內部電腦操作安全評測中,非預期行為率由 GPT-5.6 Sol 的 22.0% 降到 2.4%;加入 Auto-Review 後是 1.8%,Sol 為 4.3%。在 ExploitGym honeypot 測試裡,Astra 越界比例為 0%,Sol 為 48.2%。這些結果支持更有信心地委派工作。

system card 同時揭露一項反方向訊號:Astra 的可監控性比 Sol 低。OpenAI 發現,Astra 更能控制書面推理,在被刻意要求規避監控的測試中,也可能透過策略性表現不佳或部分破壞任務避開內部監測。官方沒有在一般部署中觀察到這種行為,仍把趨勢列為研究重點。

UK AISI 的外部測試補上一個具體尺度:Astra 不寫長篇思維鏈時,單次前向推理能處理的數學題相當於人類思考 30.9 分鐘,Sol 為 3.6 分鐘。這接近 8.6 倍,但不能直接解讀成 8.6 倍的監控逃避能力。UK AISI 沒有測試 Astra 是否真的能躲過監測,也提醒估計值可能受資料污染與有限測試時間影響。

因此,部署紀錄不能只依賴模型寫下的理由。真正可稽核的證據應包含外部工具事件、權限判斷、檔案差異、交易回應與最終狀態。模型說「我沒有執行」只是陳述;系統沒有寫入事件才是證據。

社群同時在談四個不同的 Astra

發布後前 48 小時的 X 貼文只是一批樣本,不能代表所有使用者。這批樣本倒是很清楚:大家口中的 Astra 往往不是同一件事。

討論主線 社群怎麼說 比較可靠的讀法
AGI 與跑分震撼 高互動貼文把成績形容得近乎難以置信,媒體記者也轉述 Greg Brockman 在簡報中把 Astra 與 AGI 連在一起 99.9% 的 ARC-AGI-3 與 100% ExploitBench 都是指定環境下的結果,不能單獨定義 AGI
第一手實測 有開發者表示,Astra low 在五分鐘內找出自家程式碼可加速 4.5 到 176 倍的地方 這是值得重現的測試假說,沒有公開工作負載、基準版本與驗證方法時,仍不是通用效能證據
每 token 成本 社群注意到 Astra 的標準輸入與輸出單價都是 Sol 的 2.5 倍 官方價格支持 2.5 倍這個比例,但真正該比較的是每個合格任務的總成本、重試與人工修訂
反 AGI 與務實派 懷疑者把 Astra 視為更有效率的前沿工作模型,認為程式跑分仍擁擠,也追問成本 DeepSWE 的跨模型差距確實很小;電腦操作、長流程與資安能力才是較大的變化

華語長文的重點也分成兩條。Shao Meng 把電腦操作、端到端速度、Codex harness 與非同步提問視為開發者最該看的更新;Khazix 則把 Critical 資安能力、無長思維鏈推理與可監控性風險放在一起。兩者都比一句「這就是 AGI」更接近官方資料實際能支持的結論。

這些貼文可以幫團隊列出測試清單,但不能替代可重現的內部評測。若一則貼文主張巨大加速、模型全面領先或單次任務成本更低,至少要追問任務、基線、harness、權限、重試與驗收標準。

Astra 應該怎麼試:先測,再放權

第一週先選 20 到 50 個真實任務,不要從公開 benchmark 猜內部 ROI。任務應涵蓋成功、資訊不足、權限不足、工具失敗與使用者中途改需求。每項任務記錄完成率、經過時間、token、工具呼叫、人工介入與可回復性。

第二步只開唯讀工具。確認 Astra 能找到正確資料、維持範圍並在資訊不足時停下來。接著才開放可回復的寫入,例如建立草稿分支、暫存 CRM 變更或產生待核准的部署計畫。

第三步設定模型路由。分類、摘要與單一檔案修改可以留在較便宜的模型。跨瀏覽器、終端、文件與程式庫的長流程,再交給 Astra。模型價格應除以完成的合格任務數,而不是只比較每百萬 token。

最後才擴大權限。只有在錯誤能被重現、回復與歸因後,才讓 Agent 進入正式寫入流程。Astra 會讓好架構跑得更快,也會讓模糊權限更快變成事故。

GPT-6 Astra 何時可以使用?

截至 2026 年 9 月 5 日最新官方更新,Astra 已在 API 上線,也已提供給 ChatGPT Work 與 Codex 的 Pro、Enterprise 和 Business Premium 使用者。OpenAI 表示 Plus 與其餘 Business 使用者會在接下來幾天陸續拿到。企業工作區仍由管理員決定是否啟用;Pro、Business 與 Enterprise 方案另有 Astra Pro。

ARC-AGI-3 的 99.9% 是否代表接近通用人工智慧?

不能由單一評測得出這個結論。OpenAI 說明該結果使用 Responses API harness,並調整兩項設定以更貼近實務。高分證明 Astra 在這套題目與環境裡表現突出;它沒有涵蓋企業權限、長流程可靠性、私有資料品質與部署成本。

Astra 適合直接取代現有程式模型嗎?

不適合只按型號全面替換。DeepSWE v1.1 從 72.7% 升到 74.1%,差距不大;Terminal-Bench 4.0 與資料庫遷移任務的增幅較明顯。先按任務類型做 A/B 測試,再把跨工具長流程路由給 Astra。

企業最先要加的安全控制是什麼?

先把工具改成預設唯讀,再為寫入、刪除、部署與外部通訊分開授權。不可逆操作保留人工核准,並記錄實際工具事件。這比要求模型「小心一點」更能限制事故範圍。

社群是否已經形成共識?

還沒有。首波討論同時包含 AGI 式興奮、早期實測、每 token 價格焦慮與反 AGI 懷疑。比較一致的實務訊號只有一個:Astra 的差異更可能出現在跨工具長流程,而不是每一項程式跑分都全面拉開。

權威引用

社群討論樣本:

Author Insight

模型升級最容易被低估的成本,是原本模糊的操作邊界突然變得可執行。舊模型做不到時,錯誤權限只是設計瑕疵;Astra 能把瀏覽器、終端與企業系統串起來後,同一個瑕疵會變成真實行動。先投資權限與回放,再追求全自動,通常比先買更多 token 更接近可持續的 Agent 系統。

術語表

  • harness:包住模型的提示、工具、記憶、權限、重試與驗證執行框架。
  • OSWorld:評估模型在桌面作業系統與應用程式中完成任務的基準。
  • Critical 資安能力:OpenAI Preparedness Framework 對高風險網路攻擊能力設定的最高能力門檻之一。
  • Auto-Review:在高風險操作前自動檢查並阻擋不合規行動的系統層防護。
  • 可監控性:外部監測器能否從模型推理與行動辨識風險或異常的程度。
Share this post
Erik (EKC)

With over 20 years of experience in technology, and the startup industry, I am passionate about AI and driving innovation. Keeping the engine running

Loading...