GPT-6 Astra 的評審代理能協助反覆修正作品,但代理分數不能單獨證明成品合格。截至 2026 年 9 月 11 日,一組水球動畫示範紀錄的三輪評分為 4.7、6、6.5,始終未達原設的 8 分門檻。這組紀錄說明了評審的用途與限制:它找得到問題,卻可能用完修正輪次,仍然無法過關。

水球破裂時的輪廓、水滴的運動、光線折射,確實適合拿來挑戰程式代理。不過,看起來像水,和通過流體物理驗證,中間還有很長一段距離。採用 Astra 時,可以保留這套缺陷與修正紀錄。最後能否交付,再依事先訂好的條件驗收。

GPT-6 Astra 官方識別圖

GPT-6 Astra 提供長任務容量,工具環境仍要備齊

OpenAI 的模型文件列出 1,050,000 token 上下文視窗、922,000 token 輸入上限,以及 128,000 token 輸出上限。這些規格適合評估大型專案能帶入多少資料,卻不能保證模型會正確使用每一段內容。文件也將 Astra 定義為文字與圖片輸入、文字輸出的模型;產生圖片或操作軟體,依賴另外提供的工具。官方模型規格

長任務還需要工作環境。瀏覽器必須能開啟本機成果,檔案要能持續修改;使用 Blender 與 Unreal Engine 時,軟體、專案路徑和連線工具都得事先確認。把工具名稱寫進提示詞,不代表整條工具鏈已經接通。

ChatGPT 桌面應用程式的官方說明包含專案、資料夾與成果檢視;在 ChatGPT 介面,可透過 Chat 與 Work 切換工作方式。開始開發前,先確認代理能操作哪些檔案與工具。桌面應用程式說明

Chat 與 Work 切換

官方產品頁的 Work 入口示意;帳號可用功能仍以實際介面為準。

另一個容易混淆的設定是 Ultra。官方文件將它描述為使用子代理的工作模式。API 的 reasoning.effort 則支援 low、medium、high、xhigh、max,沒有 ultra 這個值。若要比較兩次執行,模型、推理等級與代理數都要留下紀錄。模型與 Ultra 說明

水球提示詞:把評審與停止條件一起交代

建立者代理負責改程式,評審代理負責打開成果、取得畫面並列出缺陷。兩個角色分開後,評審必須查看成品,再回報它找到的問題。以下保留水球示範的需求與三輪上限,可直接複製使用。

製作一個光線追蹤模擬:子彈穿過裝水的氣球,讓氣球破裂,水從原本的形狀向外噴散、變形,最後落到地面。盡可能呈現真實外觀與準確的物理行為。

動畫必須符合以下要求:
允許我在任意時間暫停動畫,並從任何角度檢視場景。
提供滑桿,調整子彈速度、氣球大小、照明、重力及其他參數。
不得使用 Three.js 或任何外部網頁函式庫;所有內容都必須從零撰寫。

每次修正時,使用另一個獨立的評審代理,從不同角度擷取場景畫面,評估真實感與物理準確度。
評分範圍為 0 到 10 分;8 分以上代表畫面相當逼真,如同實拍。
持續修正,直到評審給出 8 分以上。未達門檻時,將依優先順序排列的問題清單交回建立者,再次嘗試;最多進行三輪。

示範紀錄描述的執行時間約為 32 分鐘,並呈現以下評分。這些是示範中的代理評語,並非 Tenten 重跑程式所得的測試結果。

評審輪次 分數,滿分 10 分 是否達到 8 分門檻
第 1 輪 4.7 否
第 2 輪 6 否
第 3 輪 6.5 否;到達輪次上限

這組分數最多支持一個有限的結論:同一套評審流程對後續版本給了更高評價。缺少固定評分準則、原始程式與獨立重測,無法把 1.8 分的增加換算成物理準確度,也不能確認評審每輪使用的標準完全一致。

提示詞中的 8 分是主觀門檻。若目的是視覺展示,可以分開檢查反光、穿透和水滴輪廓;若目的是物理教學,就得再驗證時間步長、運動規則及數值誤差。光線追蹤負責光如何形成影像,水的運動則需要另一套模擬假設。兩者必須分別驗收。

Unreal Engine 提示詞:角色動畫讓依賴關係浮現

第二組需求是第三人稱遊戲。角色要在屋頂間衝刺與跳躍,動畫必須配合骨架,場景資產還要匯入 Unreal Engine。這比一張漂亮截圖多了角色控制、碰撞與資產匯入等驗收條件。

下面保留原有工具順序與四輪上限。角色連結、參考圖片及 Blender MCP 端點未隨素材提供,使用前須填入自己的有效資料。MCP 是讓代理連接外部工具的通訊協定;此處的端點必須對應已安裝、可連線的 Blender 工具。

你是一位頂尖遊戲開發者。請使用 Unreal Engine 製作依規則生成 3D 遊戲,讓使用者以第三人稱視角控制以下角色:
<CHARACTER_SKETCHFAB_URL>

角色能夠衝刺、高高躍起,像忍者一樣在屋頂之間跳躍。
為角色設定可動骨架並加入合適的動畫。到 Mixamo 尋找相關動畫,並將動畫重新對應到角色骨架。
若下載素材需要登入,可使用 Playwright Chrome 擴充功能,開啟我已登入的目前 Chrome 工作階段。

環境應呈現中國古代宮廷風格,使用依規則生成方式建立;以下附圖供視覺參考:
<ENVIRONMENT_REFERENCE_IMAGE>

透過 MCP 在 Blender 中產生所有資產,再於 Unreal Engine 中以依規則生成方式呈現。
Blender MCP 已安裝並啟動,連線端點為:
<BLENDER_MCP_ENDPOINT>

盡可能呈現細緻、真實、宏偉的 AAA 遊戲視覺與特效。遊戲必須能在 Unreal Engine 內實際遊玩。

每完成一次嘗試,另一個獨立評審代理必須自行從不同視角與縮放比例擷取畫面,針對遊戲設計及美術表現評分,範圍為 0 到 10 分。
高於 8.5 分代表本次要求的 AAA 品質;通過條件為高於 8.5 分,而且零錯誤。
未達條件時,將依優先順序排列的問題清單交回建立者,再次嘗試;最多進行四輪。

這裡的 AAA 是提示詞設定的品質目標,沒有業界共同承認的 8.5 分認證。零錯誤也必須限定測試範圍,例如專案能開啟、指定路線可跑完、角色接觸地面時不穿模;不能用一輪操作保證任何情況都沒有錯誤。

登入要求同樣有前提:工具只能使用已獲授權的工作階段。遇到帳號驗證或缺少素材權限,就需要使用者完成該步驟。角色與動畫的使用權也要確認,不能把下載成功當成取得所有用途的授權。

這個遊戲示範只留下約 1 小時 26 分鐘的執行描述,提供的內容沒有完整成果段落。因此,無法確認它最後是否可玩、通過四輪評審,或達到所宣稱的美術目標。

Work 成果檢視介面

官方 Work 介面展示可開啟檢視的簡報成果;這不是上述水球或遊戲的測試畫面。

評審要能指出錯誤,驗收要能重現錯誤

多一個評審能增加觀察角度,但兩個角色若使用同一模型,仍可能忽略相同問題。OpenAI 的子代理文件也提醒,每個代理都會進行自己的模型與工具工作,因此通常比可相比的單代理執行消耗更多 token。子代理工作流程

我會把評審的回覆要求寫得更具體:指出問題發生的時間、視角或操作,再附上修正優先順序。對水球動畫,可以保留固定時間點與攝影機位置;對遊戲,可以保留同一路線的輸入紀錄。這是建議的驗收設計,並非上述示範已完成的測試。

實際採用時,先給評審只讀權限,讓建立者修改專案。評審需要獨立取得畫面,最好也能讀取測試輸出,卻不應靠改掉驗收條件來讓作品過關。每輪都保存版本與結果,才查得到哪項修正有效、哪項問題只是換了角度便看不見。

公開評測也受工作流程影響。OpenAI 公布 Astra 的 ARC-AGI-3 成績為 99.9%,並註明使用保留推理狀態與壓縮上下文的 Responses API harness。ARC Prize Foundation 的排行榜分別說明 Standard 與 Provider Adapter 兩種執行方式。因此,分享分數時,模型之外還要交代評測版本、工具與上下文處理。Astra 官方評測、ARC Prize 排行榜說明

GPT-6 Astra 的成本要按完成任務計算

API Standard 每百萬輸入 token 收費 10 美元,輸出 token 收費 50 美元。超過 272,000 輸入 token 的請求,整筆請求適用輸入與快取費率 2 倍、輸出費率 1.5 倍的規則。長上下文能裝得下更多內容,也需要另一份成本估算。官方模型價格

以下只是算式示例:若在標準費率範圍內累計使用 100,000 個未快取輸入 token 與 20,000 個計費輸出 token,文字 token 費用為 2 美元,另計工具費用。這不是水球示範的帳單,也不代表每輪都只消耗這些 token。

訂閱方案則不能直接用時間推算。官方說明指出,模型、上下文、推理、工具使用與快取都會影響額度。即使兩項任務都跑一小時,消耗也可能不同;示範者估計的每週額度百分比不適合拿來編預算。用量與額度說明

團隊真正要比較的是每件通過驗收的成果成本:建立者與評審的 token、工具費用、人力檢查時間,連同失敗重跑一起計入。Astra 若能減少人工修正,多花的推理費用就可能值得。若評審反覆要求裝飾性改動,費用可能增加,驗收率卻沒有改善。這要靠自己的任務紀錄判斷。

常見問題

GPT-6 Astra 的 Ultra 等於 API 的 max 嗎?

不等於。官方文件將 Ultra 描述為包含子代理的工作模式;API 的 reasoning.effort 另有 low 到 max 等值。比較執行結果時,應同時記錄模型、推理設定、代理數與工具環境。

評審代理給 8 分,就代表水球物理準確嗎?

不能。8 分是提示詞中的主觀評分門檻。物理準確度需要明確的模擬假設、數值檢查與可重現測試;畫面逼真只涵蓋視覺表現的一部分。

為什麼修了三輪,仍然可以在未通過時停止?

提示詞同時設有品質門檻和輪次上限。水球示範最後得到 6.5 分,未達 8 分,但已用完三輪。正確回報應保留未通過狀態與剩餘缺陷,不能因為工作結束便改稱驗收成功。

GPT-6 Astra 跑一小時會用掉多少每週額度?

沒有適用所有任務的固定比例。官方文件列出的影響因素包括模型、任務大小、上下文、推理、工具及快取。請以帳號的用量頁面與實際任務紀錄估算,勿套用單一示範的時間比例。

權威來源

Author Insight

我最在意的是那個沒有過關的 6.5 分。它讓評審流程留下了有用的失敗證據:評審分數提高了,原先的目標卻還沒達到。團隊願意保留未通過的紀錄,才有辦法回頭檢查代理究竟改善了什麼。若只允許漂亮的完成宣告,再多一個評審,也可能只是多花一筆費用。

術語表

  • 建立者代理:負責實作與修正成果的代理。
  • 評審代理:獨立查看成果、記錄缺陷並提出修正優先順序的代理。
  • harness:管理模型、工具、狀態與評測流程的執行環境。
  • 上下文視窗:一次模型處理可容納的 token 範圍,不等於可用輸入上限。
  • MCP:Model Context Protocol,讓代理連接外部工具的通訊協定。
Share this post
Ewan Mak

I'm a Full Stack Developer with expertise in building modern web applications that fast, secure, and scalable. Crafting seamless user experiences with a passion for headless CMS, Vercel and Cloudflare

Loading...