Gemini 3.8 Flash 已於 2026 年 9 月 2 日正式上線;Google 公布的 DeepSWE v1.1 成績為 73.7%,百萬 Token 的推廣期輸入與輸出價格分別是 0.75、3.75 美元。 這組數字讓它看起來像便宜的旗艦替代品,但 Google 也提醒:模型在複雜任務上會增加推理步驟與工具呼叫,使用的 Token 可能比前代更多。採用前該算的是每個成功任務的總成本,而非只比價目表。
這次更新,賣點是長時間工作的 Agent
Google 在六週內連續推出三個 Flash 版本,Gemini 3.8 Flash 是 2026 年 9 月 2 日的最新一版。Google DeepMind 產品管理資深總監 Tulsee Doshi 將它定位為長時間軟體工程、自主 Agent 與複雜企業工作流程的工作馬模型;同一天發布的 Gemini 3.8 Flash Cyber,則由 Gemini Security Lead Raluca Ada Popa 共同介紹,僅透過 Fairwind Program 提供給通過審核的防禦團隊。
一般版的模型 ID 是 gemini-3.8-flash,目前為正式版(GA)。它可接收文字、圖片、影片、音訊與 PDF,輸入上限為 1,048,576 個 Token,單次輸出上限為 65,536 個 Token。模型支援函式呼叫、程式碼執行、檔案搜尋、搜尋與地圖 Grounding、結構化輸出;Computer Use 仍標示為 Preview。它只輸出文字,不支援 Live API、圖片生成或音訊生成。
這些規格沒有把 Flash 變成縮小版的全能模型。Google 把開發重心放在 Agent:任務能不能持續跑、遇到阻礙會不會改路徑、工具呼叫後是否繼續驗證。這也是 3.8 與前代最值得測的差異。

跑分進步是真的,榜單仍要連同測法一起讀
Google 公布的主表顯示,Gemini 3.8 Flash 在 DeepSWE v1.1 從 3.7 Flash 的 65.3% 提高到 73.7%;Terminal-Bench 2.1 從 85.8% 升到 89.4%;HLE-Verified 則從 53.6% 升到 54.9%。在 Vals Finance Agent v2 與 Harvey's Legal Agent Benchmark,成績分別是 61.4% 與 10.0%。
| 評測 | Gemini 3.8 Flash | Gemini 3.7 Flash | 讀法 |
|---|---|---|---|
| DeepSWE v1.1 | 73.7% | 65.3% | 3.8 由 Google 自算,使用 mini-swe Agent harness 與 high thinking |
| Terminal-Bench 2.1 | 89.4% | 85.8% | Gemini 成績由 Google 自算,採 Terminus 2 預設 harness |
| HLE-Verified | 54.9% | 53.6% | Google 在 1,811 題 verified set 上自行評測 |
| Vals Finance Agent v2 | 61.4% | 59.0% | 成績來自 Vals AI 的共用 Agent harness |
| Harvey's Legal Agent Benchmark | 10.0% | 8.8% | 10.0% 指完整任務解決率,不是逐項準則通過率 |

這張表能證明 3.8 對 3.7 的進步,無法單獨證明它在你的程式庫也會提高相同幅度。Google 的方法文件明載,表內各欄混合了 Google 自行執行、第三方公開榜單與其他供應商自報成績;LVBench 對 Gemini 與 GPT 模型取 1,024 幀,Claude 模型受 API 限制只取 300 幀。DeepSWE 的 Gemini 3.8 Flash 使用 high thinking,其他模型則取榜單上最高分的思考層級。
甚至連表上的小數點都需要追蹤版本。Google 的方法文件特別註明,原先因四捨五入而把 Claude Opus 5 的 DeepSWE 成績寫成 74%。這不表示整份評測失效,卻足以提醒讀者:供應商圖表適合當候選模型的篩選器,不能代替自己的回歸測試。
0.75 美元很便宜,卻不是一個任務的價格
Gemini 3.8 Flash 在 2026 年 12 月 31 日前採推廣價:每百萬輸入 Token 0.75 美元,輸出 Token 3.75 美元;2027 年 1 月 1 日起分別調整為 1.50 與 7.50 美元。Batch 在推廣期的輸入與輸出價格再減半,分別是 0.375 與 1.875 美元。這些費率包含 thinking tokens 的輸出計價。
只看單價,3.8 很有吸引力。問題是 Google 明說它在困難任務上會用較小的推理步驟,反覆呼叫工具並檢查結果,因此可能消耗更多 Token。高思考帶來的成功率若足以減少重試,總成本可能下降;若工作只是分類、改寫或單次資料擷取,額外推理反而會把省下的單價吃掉。
開發團隊可以把成本拆成一個更實用的式子:
每個成功任務成本 = 全部輸入與輸出費用 ÷ 通過驗收的任務數

這個分母很重要。模型一次跑完的成功率、平均工具呼叫數、延遲與人工返工時間,都會影響生產成本。Google 官方的 DeepSWE 圖也把成功率與平均每題成本放在同一張圖上,方向是對的;真正部署時,資料應換成自家任務。
Thinking Level 怎麼選
Gemini 3.8 Flash 預設使用 medium,可設定 low、medium 或 high;minimal 不受支援,送出後會回傳錯誤。Google 對三個層級的建議用途很清楚:低延遲的聊天、初稿或快速分析可先測 low;複雜程式碼與 Agent 工作流從 medium 開始;數學、深度推理與困難的多步驟任務才升到 high。
我的建議更保守:不要一上線就把所有請求設成 high。先建立 30 至 100 個接近正式流量的任務,固定工具、提示與驗收條件,分別量測三個層級的通過率、P50/P95 延遲、輸出 Token 與重試次數。只要 medium 已達到品質門檻,high 多出的思考就沒有採購價值。
升級現有應用程式時也有相容性工作。Google 的遷移清單要求把模型 ID 改成 gemini-3.8-flash,移除 temperature、top_p、top_k 與 candidate_count,並以 thinking_level 取代 thinking_budget。函式呼叫、預填模型訊息與最後一個使用者訊息也要重新檢查。這些變更比改一行模型名稱更容易在正式環境出問題。
Gemini 3.8 Flash 適合誰
最適合先測的,是每次任務包含多個工具、要跨檔案或長文件工作,而且目前受模型單價限制的團隊。軟體維護 Agent、財務文件整理、企業搜尋與研究型工作流,都符合 Google 這次鎖定的場景。
大量簡單請求未必需要換。3.7 Flash 仍受支援;若低思考層級已能穩定通過,或工作負載主要受延遲而非推理品質限制,留在前代可能更容易預測。資安版也不是一般開發者的升級路徑:Gemini 3.8 Flash Cyber 採受控存取,Fairwind Program 要求組織背景審查、抗網路釣魚的多因素驗證與人員權限控管。
常見問題
Gemini 3.8 Flash 已經是正式版嗎?
是。Google 在 2026 年 9 月 2 日將 gemini-3.8-flash 列為 GA,可透過 Gemini API 與 Google AI Studio 使用。Gemini App、Gemini Enterprise、AI Mode 與 Google Antigravity 也列在官方可用管道中。
Gemini 3.8 Flash 的 Token 上限是多少?
輸入上限是 1,048,576 個 Token,輸出上限是 65,536 個 Token。它接受文字、圖片、影片、音訊與 PDF,但輸出只有文字。
Gemini 3.8 Flash 的價格何時調整?
推廣價到 2026 年 12 月 31 日為止,每百萬輸入 Token 0.75 美元、輸出 Token 3.75 美元。2027 年 1 月 1 日起調整為 1.50 與 7.50 美元;輸出費率包含 thinking tokens。
可以關閉 Gemini 3.8 Flash 的思考功能嗎?
不能用 minimal 關閉思考,該設定會回傳錯誤。可用的層級是 low、medium、high,預設值為 medium。
權威引用
- Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- Google DeepMind — Gemini 3.8 Flash
- Google DeepMind — Gemini 3.8 Flash model card
- Google DeepMind — Gemini 3.8 Flash evaluation methodology
- Google AI for Developers — What's new in Gemini 3.8 Flash
- Google AI for Developers — Gemini API pricing
Author Insight
這次真正值得注意的並非某一格跑分贏了誰,而是 Google 把 per-task cost 放到主視覺裡。Agent 會多走幾步、會重試,也會在工具之間搬運上下文;百萬 Token 單價因此只是成本模型的一個輸入。若評測報告沒有同時交代成功率、Token、延遲與人工返工,漂亮的價格比較仍離採購決策很遠。
術語表
- Agent:能規劃步驟、呼叫工具並依結果繼續執行的 AI 系統。
- Thinking Level:控制模型推理投入程度的設定;3.8 Flash 支援
low、medium、high。 - Harness:負責提供工具、執行任務與判定結果的評測框架。
- GA:General Availability,正式可用版本。
