Qwen3.8-Flash-Next 已開放模型權重,核心意義是讓開發者在 Qwen4 家族登場前,先驗證一套以稀疏注意力、分支殘差與 N-gram Embedding 換取效率的新架構。 這個多模態 MoE 模型包含 125B 主模型與 51B N-gram Embedding,每個 token 約啟用 6B 參數。原生上下文長度為 262,144 tokens,透過 YaRN 可延伸至 100 萬。

權重與部署範例已上線,但 QwenCloud 的託管 API 在 2026 年 8 月 26 日查核時仍標示「Coming soon」。官方公布的 API 價格為每百萬輸入 tokens 0.16 美元、輸出 tokens 0.47 美元,這是預告價格,不能當成已可採購的服務。

Qwen3.8-Flash-Next 官方模型頁與發布識別

先看結論

判斷面向 已確認的事實 對開發團隊的意義
架構 GDN 與 QSA 混合注意力、四分支 Gated Residual、N-gram Embedding、Muon 最佳化器 值得測試長上下文吞吐量與訓練穩定度,但各元件的收益要分開量測
模型規模 125B 主模型、51B N-gram Embedding、每個 token 約啟用 6B 參數 6B 是運算啟用量,不等於下載容量或最低 GPU 記憶體需求
權重狀態 Hugging Face 與 ModelScope 權重已發布 可自行部署與評估,但須先審查 Qwen Community License 1.0
託管服務 價格已公布,API 尚未上線 預算表可先保留價格,正式採用必須等端點、配額與服務條款可驗證
基準測試 官方回報多項程式開發與工作代理成績提升 適合做候選模型篩選,不足以取代自家任務、延遲與成本測試

Qwen4 的提前預覽,真正改了哪四件事

Qwen 團隊把這次更新拆成注意力、殘差、Embedding 與最佳化四條路徑。這個分法很重要,因為每一條路徑對部署成本的影響不同。

QSA 把完整注意力改成區塊級選擇

Gated DeltaNet(GDN)負責壓縮歷史內容,Qwen Sparse Attention(QSA)再用輕量索引器,從微型區塊中挑出較重要的上下文。官方技術報告回報,在 100 萬 token 長度下,QSA 核心的 prefill 加速可達 7.6 倍,decode 加速可達 4.9 倍。

這些數字屬於特定核心與測試設定,不應直接套用到完整應用。團隊需要把 KV cache、前綴快取命中率、批次大小與硬體拓樸一起納入測量。

Gated Residual 把殘差流擴成四條分支

Gated Residual 將殘差流擴為四個分支,再由動態 gate 控制各層讀寫。設計目標是增加跨層容量,同時避免較寬殘差流破壞訓練穩定度。這是架構層的容量分配機制,不能只用最終榜單判斷效果。

N-gram Embedding 把一部分容量移到主機記憶體

51B 的 N-gram Embedding 依局部 token 組合查表。官方方案允許把這張表卸載到主機記憶體,再以非同步預取與模型運算重疊。好處是增加模型容量時,不必讓每個 token 都承擔等比例的額外計算。

代價也很具體。主機記憶體容量、PCIe 或互連頻寬、預取命中率與尾端延遲,都會成為部署變數。若只比較「每 token 啟用 6B」,會漏掉真正的系統成本。

Qwen3.8-Flash-Next 官方架構圖,包含 GDN、QSA、Gated Residual 與 N-gram Embedding

Muon 改的是最佳化流程與尺度律

Qwen3.8-Flash-Next 採用 Muon,並重新處理正交化精度、Muon 與 AdamW 的分工,以及融合參數的拆分方式。技術報告也指出,移除 batch-size warmup 後,在相同 token 預算內可多完成 18.8% 的最佳化步數。這是訓練效率主張,無法等同於推論端的 18.8% 提升。

6B 啟用參數,不代表這是一個 6B 模型

Hugging Face 的權重索引顯示,原始 checkpoint 約為 359,999,963,128 bytes,約 335.3 GiB,共 131 個 safetensors 分片。這個數字比「6B active parameters」更接近下載與儲存規劃的起點。

MoE 每次只呼叫部分 expert,因此運算量可以低於完整 125B dense 模型。模型仍須處理 expert 權重、51B N-gram 表、KV cache 與上下文延伸帶來的記憶體壓力。量化能降低部分負擔,實際需求仍取決於格式、平行策略與推論框架。

官方部署入口

官方儲存庫提供 Transformers、SGLang、vLLM 與 TokenSpeed 的啟動方式。以下是 SGLang 範例,保留原生 262,144 token 上下文設定:

sglang serve --model-path Qwen/Qwen3.8-Flash-Next \
  --port 8000 \
  --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

這段指令證明框架已有支援入口,不代表四張 GPU 就一定能容納原始精度權重。正式測試前仍要確認量化版本、GPU 型號、每卡記憶體、主機記憶體與互連配置。

官方儲存庫也留下 2026 年 8 月 26 日發布紀錄,並列出 Hugging Face 與 ModelScope 兩個權重入口。

Qwen3.8-Flash-Next 官方發布紀錄與 Hugging Face、ModelScope 權重入口

官方基準測試顯示的優勢,與還沒回答的問題

Qwen 回報 Qwen3.8-Flash-Next 在多個程式開發、代理與視覺推理測試取得下列成績:

測試 官方回報成績 主要能力
DeepSWE 58.7 軟體工程代理
SWE-bench Pro 62.5 真實程式修復
CoWorkBench 73.9 辦公工作代理
AndroidWorld 84.5 Android 操作代理
MathVision + CI 95.7 視覺數學推理

官方也稱基礎模型在 14 個測試中的 8 個領先 Qwen3.7-Plus,同時只使用約三分之一啟用參數、三分之一訓練 tokens 與約九分之一訓練 FLOPs。這些結果支持「成本效率值得進一步驗證」,還不能證明每個正式環境都會得到相同比例的節省。

技術報告包含不同評測框架、自建測試與評審模型設定。部分結果會取多次執行的較高值。採購或切換模型前,至少要補上固定硬體的吞吐量、首 token 延遲、尾端延遲、工具呼叫成功率與長任務完成率。

API、權重與授權要分三張表看

Qwen Community License 1.0 允許使用、修改、散布、託管與微調,但附帶商業條件。若商業產品或服務超過每月 1 億活躍使用者,或月營收超過 2,000 萬美元,介面須清楚標示模型名稱。Model as a Service 與 AI Work Assistant 的商業用途,條款要求另行取得授權。

這代表「權重可下載」與「任何商業模式都可直接上線」是兩個不同判斷。法務與產品團隊應直接閱讀完整授權文件,再依服務型態確認義務。

託管 API 則是另一條產品線。官方已公布 qwen3.8-flash 價格,但查核時 API 仍未開放。開發者可先測試權重,不該把尚未存在的託管端點寫進正式上線承諾。

開發團隊現在可以做的三段式評估

第一段:確認模型能否在既有框架啟動

先用官方支援的 SGLang 或 vLLM recipe 建立可重現環境。記錄 checkpoint、量化格式、框架版本、GPU 拓樸與主機記憶體。只要其中一項未固定,成本比較就會失真。

第二段:用自家工作流驗證 QSA 與代理能力

準備短上下文、長上下文與高前綴快取命中率三組負載。程式開發任務要同時看 patch 正確率、工具呼叫、回復能力與總完成時間。辦公代理則要加入檔案格式、權限與跨工具操作。

第三段:把授權與供應方式納入上線門檻

自架權重、第三方託管與未來 QwenCloud API 的成本結構不同。評估表應分開記錄權重授權、基礎設施、營運人力、資料邊界與供應商 SLA,避免只比 token 單價。

常見問題

Qwen3.8-Flash-Next 已經是 Qwen4 嗎?

不是。官方將它定位為 Qwen4 架構的提前預覽,角色類似先前 Qwen3-Next 對 Qwen3.5 的作用。完整 Qwen4 模型家族尚未因此自動成立。

100 萬 token 是原生上下文嗎?

原生長度是 262,144 tokens。100 萬 token 透過 YaRN 延伸,品質與成本要在實際任務上另行測試。

每個 token 啟用 6B,能在一般工作站執行嗎?

不能只靠 6B 判斷。原始 checkpoint 約 335.3 GiB,還有 N-gram 表、KV cache 與執行框架額外需求。量化版可能降低門檻,但硬體規格要以實際格式驗證。

名詞表

  • MoE:Mixture of Experts,每次推論只啟用部分 expert 的架構。
  • QSA:Qwen Sparse Attention,以區塊級索引挑選重要上下文。
  • GDN:Gated DeltaNet,用壓縮狀態承接長序列歷史。
  • Gated Residual:以動態 gate 控制多分支殘差流的讀寫。
  • YaRN:用於延伸上下文長度的方法,延伸結果不等同原生訓練長度。

作者觀點

Qwen3.8-Flash-Next 的意義超越單一榜單名次。Qwen 願意在主模型家族發布前,把架構選擇、權重與部署入口先交給開發者。這給了團隊一個難得的驗證窗口,也把責任推回採用方:運算啟用量、儲存占用、授權與 API 狀態必須分開查核。

Tenten 在 AI 模型評估與企業導入規劃中,會把官方成績拆成可重現測試、系統成本與治理邊界。如果你的團隊正在評估長上下文模型或代理工作流,可從聯絡頁面提供目前的硬體與任務條件。

權威引用

Share this post
Erik (EKC)

With over 20 years of experience in technology, and the startup industry, I am passionate about AI and driving innovation. Keeping the engine running

Loading...