Gemini 3.7 Flash 在 2026 年 8 月 13 日正式上線,把 100 萬 token 輸入價壓到 USD 0.75。它有 100 萬 token 脈絡視窗,也能輸出 65,536 token。Google 把它定位成程式開發與 AI Agent 的工作馬。官方評測確實顯示明顯進步。不過,早期使用者最常談的仍是驗證成本。

Gemini 3.7 Flash 是什麼

Gemini 3.7 Flash 是 Google DeepMind 的多模態推理模型。它接受文字、圖片、影片、音訊與 PDF。輸出目前限文字。開發者可在 Gemini API 與 Google AI Studio 使用它。Google Antigravity 也已支援。

模型代碼是 gemini-3.7-flash。API 提供低、中、高三種思考層級。minimal 不受支援。它也支援函式呼叫、程式碼執行、搜尋 grounding、檔案搜尋與結構化輸出。電腦操作仍是預覽功能。

Google 的模型卡說明,3.7 Flash 建基於 3.6 Flash。改進集中在推理基礎。模型的知識截止日多數領域到 2026 年 3 月。部分領域可能只到 2025 年 1 月。

Gemini 3.7 Flash 官方藍白漸層主視覺

規格與價格先看這張表

項目 Gemini 3.7 Flash
正式上線日期 2026 年 8 月 13 日
模型代碼 gemini-3.7-flash
最大輸入 1,048,576 token
最大輸出 65,536 token
輸入格式 文字、圖片、影片、音訊、PDF
輸出格式 文字
思考層級 low、medium、high
優惠輸入價 USD 0.75/100 萬 token
優惠輸出價 USD 3.75/100 萬 token
2027 年標準輸入價 USD 1.50/100 萬 token
2027 年標準輸出價 USD 7.50/100 萬 token

優惠價適用到 2026 年 12 月 31 日。開發團隊現在做成本試算時,應該同時計算 2027 年標準價。否則,試辦案的單位經濟會過度樂觀。

官方評測顯示哪些進步

Google 公布的數字很漂亮,也需要正確解讀。Gemini 自家模型多數由 Google 自行測試。競品成績則混合供應商自報與公開排行榜。這些數字適合拿來縮小候選清單,不能取代你的程式庫驗收。

評測 3.7 Flash 3.6 Flash Sonnet 5 GPT-5.6 Terra
FrontierCode 1.1 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6%
Code Arena 1588 Elo 1538 Elo 1541 Elo 1523 Elo
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4%
AutomationBench 30.4% 17.0% 10.7% 23.6%
GDP.pdf 34.0% 22.0% 28.0% 24.7%
GDM-MRCR v2,128k 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 未公布 50.2%

最值得留意的是進步分布。FrontierCode 增加 9.2 個百分點。DeepSWE 增加 16.7 個百分點。AutomationBench 更從 17.0% 升到 30.4%。這正好對應 Google 的產品定位:長程式任務、工具操作與企業流程。

結果也留下明確邊界。Terminal-bench 3.0 只有 14.9%。GPT-5.6 Terra 則有 20.8%。OSWorld 2.0 也落後 2.3 個百分點。模型卡更直接寫明,它能完成單一程式任務,卻無法獨立串成端到端研究流程。

早期使用者討論集中在五件事

社群心得不是控制變因評測。我把它當成「該設計哪些驗收案例」的線索。2026 年 8 月 13 日到 20 日的公開討論,反覆出現以下五類回報。

第一,速度與品質比讓人驚訝。許多使用者認為它比 3.6 Flash 更能遵守指令。前端設計與多模態理解也常獲得好評。有人把它改成日常實作模型,再把高階模型留給規劃。

第二,程式工作是正面回報最密集的場景。使用者提到架構重整、UI 開發與除錯。也有人用一個提示修掉數月未解的錯誤。這些案例很吸引人,仍屬個別經驗。

第三,信任問題沒有消失。負面回報常提到模型過早宣告成功。它可能沒照文件實作,測試也沒有跑完。有使用者因此讓另一個模型審查計畫與每次變更。

第四,長任務偶爾卡在工具執行後。有些回報描述終端工作完成後,對話沒有繼續。重新要求它接續才會恢復。這類問題會拖高實際完成時間。

第五,產品介面上線並不一致。有人在 AI Studio 看得到模型,卻在 Gemini App 看不到。也有人遇到模型短暫出現後又消失。API 的正式可用性,不能直接等同每個消費者帳號已完成上線。

我會把它放在哪個工作位置

Gemini 3.7 Flash 最適合高頻、可驗證的工作。例子包括產生初稿、修改前端、整理大型 PDF,以及執行有測試的程式任務。速度與價格會直接節省迭代成本。

高風險工作需要多一層控制。把驗收標準寫成可執行測試。要求模型回報執行過的指令,也要附上失敗結果。重要架構變更由人或第二個模型審查。這會削弱部分速度優勢,卻能降低「看似完成」的風險。

一個實用的分工是:高階模型負責規劃,3.7 Flash 負責實作。接著由測試、lint 與差異檢查做裁判。若任務本身無法驗證,便不適合因低價而直接交給它。

Gemini 3.7 Flash 在 Google Antigravity 生成的 3D 遊戲畫面

文件理解也是適合試辦的工作。官方示範把靜態年報轉成互動資料故事。企業仍要逐項核對數字與來源。

Gemini 3.7 Flash 把年度報告轉為互動資料故事的官方示範

API 遷移有四個容易踩雷的地方

升級時先把模型代碼改成 gemini-3.7-flash。Google 也要求移除三個取樣參數:temperaturetop_ptop_k。舊的 thinking_budget 要改成 thinking_level。它的值是字串。candidate_count 在 Gemini 3.x 也不受支援。

多輪對話應改用伺服器端 previous_interaction_id。預填模型回合需要刪除。使用 generateContent 時,FunctionResponse 要有 call_id。它也要帶 name

以下是精簡的 Python 範例。它把思考層級設為中等,適合先做內部基準測試。

from google import genai

client = genai.Client()
response = client.interactions.create(
    model="gemini-3.7-flash",
    input="檢查這段付款流程的競爭條件,並提出可驗證的修正。",
    generation_config={"thinking_level": "medium"},
)
print(response.output_text)

決策建議:先用自己的失敗案例測

選模型時,我會先拿團隊曾經失敗的 20 個任務測試。成功條件要包含正確率、完成時間、token 成本與人工修正時間。只看官方 benchmark,很容易忽略整合摩擦。

若 3.7 Flash 能通過那些失敗案例,它很可能成為預設實作模型。若它經常提前宣告完成,就把它限制在可回復的變更。大型架構與安全敏感任務仍交給較慢模型。

價格也要做兩套預算。2026 年優惠價很有競爭力。2027 年 1 月 1 日起,輸入與輸出價都會翻倍。導入決策應該建立在標準價仍可成立的前提上。

常見問題

Gemini 3.7 Flash 已經正式推出了嗎?

是。Gemini API 在 2026 年 8 月 13 日標示為一般可用。個別 Gemini App 帳號仍可能分批上線。

Gemini 3.7 Flash 適合寫程式嗎?

適合可測試的程式工作。官方 DeepSWE v1.1 為 65.3%。這比 3.6 Flash 高 16.7 個百分點。大型程式庫仍要保留測試與人工審查。

它比 GPT-5.6 Terra 或 Sonnet 5 好嗎?

沒有單一答案。3.7 Flash 在 FrontierCode 領先兩者。Code Arena 也領先。它在 DeepSWE 與 Terminal-bench 3.0 仍落後 GPT-5.6 Terra。OSWorld 2.0 也是如此。

Gemini 3.7 Flash 會產生幻覺嗎?

會。Google 模型卡把幻覺列為已知限制。早期使用者也回報過早宣告成功,因此重要輸出要用外部工具驗證。

優惠價格會維持多久?

優惠價到 2026 年 12 月 31 日。2027 年輸入價為 USD 1.50。輸出價為 USD 7.50。單位都是每 100 萬 token。

權威引用

Author Insight

我最在意的指標一直是「驗證後完成時間」。快速輸出若需要大量返工,便是假快。Gemini 3.7 Flash 的價值,在於它讓可測試工作更便宜。它也迫使團隊把驗收條件寫清楚。

Tenten 曾協助企業把模型評測接進開發流程。prompt、測試與成本因此能一起版本化。若你正在規劃 Gemini API 或 AI Agent 導入,可以和 Tenten 團隊討論評測設計

術語表

  • AI Agent:可使用工具並分段完成任務的 AI 系統。
  • grounding:以搜尋或指定資料源約束模型回答的做法。
  • token:模型處理文字與多模態內容時使用的計量單位。
  • thinking level:控制模型推理投入量的設定。
Share this post
Ewan Mak

I'm a Full Stack Developer with expertise in building modern web applications that fast, secure, and scalable. Crafting seamless user experiences with a passion for headless CMS, Vercel and Cloudflare

Loading...