Gemini 3.7 Flash 在 2026 年 8 月 13 日正式上線,把 100 萬 token 輸入價壓到 USD 0.75。它有 100 萬 token 脈絡視窗,也能輸出 65,536 token。Google 把它定位成程式開發與 AI Agent 的工作馬。官方評測確實顯示明顯進步。不過,早期使用者最常談的仍是驗證成本。
Gemini 3.7 Flash 是什麼
Gemini 3.7 Flash 是 Google DeepMind 的多模態推理模型。它接受文字、圖片、影片、音訊與 PDF。輸出目前限文字。開發者可在 Gemini API 與 Google AI Studio 使用它。Google Antigravity 也已支援。
模型代碼是 gemini-3.7-flash。API 提供低、中、高三種思考層級。minimal 不受支援。它也支援函式呼叫、程式碼執行、搜尋 grounding、檔案搜尋與結構化輸出。電腦操作仍是預覽功能。
Google 的模型卡說明,3.7 Flash 建基於 3.6 Flash。改進集中在推理基礎。模型的知識截止日多數領域到 2026 年 3 月。部分領域可能只到 2025 年 1 月。

規格與價格先看這張表
| 項目 | Gemini 3.7 Flash |
|---|---|
| 正式上線日期 | 2026 年 8 月 13 日 |
| 模型代碼 | gemini-3.7-flash |
| 最大輸入 | 1,048,576 token |
| 最大輸出 | 65,536 token |
| 輸入格式 | 文字、圖片、影片、音訊、PDF |
| 輸出格式 | 文字 |
| 思考層級 | low、medium、high |
| 優惠輸入價 | USD 0.75/100 萬 token |
| 優惠輸出價 | USD 3.75/100 萬 token |
| 2027 年標準輸入價 | USD 1.50/100 萬 token |
| 2027 年標準輸出價 | USD 7.50/100 萬 token |
優惠價適用到 2026 年 12 月 31 日。開發團隊現在做成本試算時,應該同時計算 2027 年標準價。否則,試辦案的單位經濟會過度樂觀。
官方評測顯示哪些進步
Google 公布的數字很漂亮,也需要正確解讀。Gemini 自家模型多數由 Google 自行測試。競品成績則混合供應商自報與公開排行榜。這些數字適合拿來縮小候選清單,不能取代你的程式庫驗收。
| 評測 | 3.7 Flash | 3.6 Flash | Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% |
| Code Arena | 1588 Elo | 1538 Elo | 1541 Elo | 1523 Elo |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% |
| GDP.pdf | 34.0% | 22.0% | 28.0% | 24.7% |
| GDM-MRCR v2,128k | 97.0% | 91.8% | 81.5% | 93.5% |
| OSWorld 2.0 | 47.9% | 33.8% | 未公布 | 50.2% |
最值得留意的是進步分布。FrontierCode 增加 9.2 個百分點。DeepSWE 增加 16.7 個百分點。AutomationBench 更從 17.0% 升到 30.4%。這正好對應 Google 的產品定位:長程式任務、工具操作與企業流程。
結果也留下明確邊界。Terminal-bench 3.0 只有 14.9%。GPT-5.6 Terra 則有 20.8%。OSWorld 2.0 也落後 2.3 個百分點。模型卡更直接寫明,它能完成單一程式任務,卻無法獨立串成端到端研究流程。
早期使用者討論集中在五件事
社群心得不是控制變因評測。我把它當成「該設計哪些驗收案例」的線索。2026 年 8 月 13 日到 20 日的公開討論,反覆出現以下五類回報。
第一,速度與品質比讓人驚訝。許多使用者認為它比 3.6 Flash 更能遵守指令。前端設計與多模態理解也常獲得好評。有人把它改成日常實作模型,再把高階模型留給規劃。
第二,程式工作是正面回報最密集的場景。使用者提到架構重整、UI 開發與除錯。也有人用一個提示修掉數月未解的錯誤。這些案例很吸引人,仍屬個別經驗。
第三,信任問題沒有消失。負面回報常提到模型過早宣告成功。它可能沒照文件實作,測試也沒有跑完。有使用者因此讓另一個模型審查計畫與每次變更。
第四,長任務偶爾卡在工具執行後。有些回報描述終端工作完成後,對話沒有繼續。重新要求它接續才會恢復。這類問題會拖高實際完成時間。
第五,產品介面上線並不一致。有人在 AI Studio 看得到模型,卻在 Gemini App 看不到。也有人遇到模型短暫出現後又消失。API 的正式可用性,不能直接等同每個消費者帳號已完成上線。
我會把它放在哪個工作位置
Gemini 3.7 Flash 最適合高頻、可驗證的工作。例子包括產生初稿、修改前端、整理大型 PDF,以及執行有測試的程式任務。速度與價格會直接節省迭代成本。
高風險工作需要多一層控制。把驗收標準寫成可執行測試。要求模型回報執行過的指令,也要附上失敗結果。重要架構變更由人或第二個模型審查。這會削弱部分速度優勢,卻能降低「看似完成」的風險。
一個實用的分工是:高階模型負責規劃,3.7 Flash 負責實作。接著由測試、lint 與差異檢查做裁判。若任務本身無法驗證,便不適合因低價而直接交給它。

文件理解也是適合試辦的工作。官方示範把靜態年報轉成互動資料故事。企業仍要逐項核對數字與來源。

API 遷移有四個容易踩雷的地方
升級時先把模型代碼改成 gemini-3.7-flash。Google 也要求移除三個取樣參數:temperature、top_p 與 top_k。舊的 thinking_budget 要改成 thinking_level。它的值是字串。candidate_count 在 Gemini 3.x 也不受支援。
多輪對話應改用伺服器端 previous_interaction_id。預填模型回合需要刪除。使用 generateContent 時,FunctionResponse 要有 call_id。它也要帶 name。
以下是精簡的 Python 範例。它把思考層級設為中等,適合先做內部基準測試。
from google import genai
client = genai.Client()
response = client.interactions.create(
model="gemini-3.7-flash",
input="檢查這段付款流程的競爭條件,並提出可驗證的修正。",
generation_config={"thinking_level": "medium"},
)
print(response.output_text)
決策建議:先用自己的失敗案例測
選模型時,我會先拿團隊曾經失敗的 20 個任務測試。成功條件要包含正確率、完成時間、token 成本與人工修正時間。只看官方 benchmark,很容易忽略整合摩擦。
若 3.7 Flash 能通過那些失敗案例,它很可能成為預設實作模型。若它經常提前宣告完成,就把它限制在可回復的變更。大型架構與安全敏感任務仍交給較慢模型。
價格也要做兩套預算。2026 年優惠價很有競爭力。2027 年 1 月 1 日起,輸入與輸出價都會翻倍。導入決策應該建立在標準價仍可成立的前提上。
常見問題
Gemini 3.7 Flash 已經正式推出了嗎?
是。Gemini API 在 2026 年 8 月 13 日標示為一般可用。個別 Gemini App 帳號仍可能分批上線。
Gemini 3.7 Flash 適合寫程式嗎?
適合可測試的程式工作。官方 DeepSWE v1.1 為 65.3%。這比 3.6 Flash 高 16.7 個百分點。大型程式庫仍要保留測試與人工審查。
它比 GPT-5.6 Terra 或 Sonnet 5 好嗎?
沒有單一答案。3.7 Flash 在 FrontierCode 領先兩者。Code Arena 也領先。它在 DeepSWE 與 Terminal-bench 3.0 仍落後 GPT-5.6 Terra。OSWorld 2.0 也是如此。
Gemini 3.7 Flash 會產生幻覺嗎?
會。Google 模型卡把幻覺列為已知限制。早期使用者也回報過早宣告成功,因此重要輸出要用外部工具驗證。
優惠價格會維持多久?
優惠價到 2026 年 12 月 31 日。2027 年輸入價為 USD 1.50。輸出價為 USD 7.50。單位都是每 100 萬 token。
權威引用
- Google DeepMind — Gemini 3.7 Flash
- Google AI for Developers — What’s new in Gemini 3.7 Flash
- Google AI for Developers — Gemini 3.7 Flash model specification
- Google DeepMind — Gemini 3.7 Flash model card
- Google AI for Developers — Gemini API release notes
Author Insight
我最在意的指標一直是「驗證後完成時間」。快速輸出若需要大量返工,便是假快。Gemini 3.7 Flash 的價值,在於它讓可測試工作更便宜。它也迫使團隊把驗收條件寫清楚。
Tenten 曾協助企業把模型評測接進開發流程。prompt、測試與成本因此能一起版本化。若你正在規劃 Gemini API 或 AI Agent 導入,可以和 Tenten 團隊討論評測設計。
術語表
- AI Agent:可使用工具並分段完成任務的 AI 系統。
- grounding:以搜尋或指定資料源約束模型回答的做法。
- token:模型處理文字與多模態內容時使用的計量單位。
- thinking level:控制模型推理投入量的設定。
