OpenAI 公布首款自研推論晶片 Jalapeño 的工程樣品成績:在三個開放權重模型與固定 8K 輸入、1K 輸出的 InferenceX 測試裡,它相較受測的商用系統,每瓦可完成 1.5 至 1.9 倍 AI 工作量,端到端延遲降低 1.7 至 3.6 倍。 這是有份量的第一步,還不足以宣稱它「打敗所有 NVIDIA、AMD 與 Google 晶片」。
這批結果測的是工程樣品、指定模型與受控負載。OpenAI 尚未公布更貼近長時間 Agent 工作流的 AgentX 成績,量產版本也還在路上。Jalapeño 真正值得關注的地方,在於 OpenAI 正把模型、編譯器、晶片與資料中心容量納入同一套設計循環。
先看結論
| 判斷面向 | 已確認的事實 | 仍需驗證 |
|---|---|---|
| 每瓦效能 | 三個受測模型的峰值 throughput-per-watt 提升 1.5–1.9 倍 | 長上下文、持續多輪與混合租戶負載 |
| 互動延遲 | 端到端延遲降低 1.7–3.6 倍;最低 token 間隔改善 2.7–4.1 倍 | 首 token 延遲、尾端延遲與完整 Agent 任務完成時間 |
| 功耗 | 封裝額定 TDP 700W;受測工作負載持續功耗不超過 550W | 量產頻率、散熱、良率與機櫃層效率 |
| 軟體 | 三個原規格外的模型在兩個月內完成高效能移植 | 更廣模型覆蓋、工具鏈成熟度與維運成本 |
| 時程 | OpenAI 預計 2026 年底在自家基礎設施部署 | 2027 年量產爬坡、100MW 規模與供應鏈執行 |
Jalapeño 是什麼,這次又公布了什麼
OpenAI 在 2026 年 6 月 24 日正式發表 Jalapeño,稱其為第一顆 Intelligence Processor。這款 LLM 推論加速器由 OpenAI 與 Broadcom、Celestica 共同開發,架構從起點就瞄準 OpenAI 現有與未來模型,並未沿用通用 GPU 再做局部調整。
8 月 25 日的更新公布了第一批工程樣品實測;晶片本身早在 6 月發表。OpenAI 使用 SemiAnalysis 的 InferenceX 方法,對 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 做固定 8K tokens 輸入、1K tokens 輸出的單輪比較。測試對象是 SemiAnalysis 選定的「領先商用系統」,並非市場上每一種晶片、每一代產品與每一種軟體設定。
這個界線很重要。社群上的「全面擊敗 NVIDIA、AMD、Google」把有限測試放大成普遍結論;OpenAI 的原始說法則精確得多:Jalapeño 在這三個模型、這套 benchmark 與這批對照系統上,交出更高每瓦工作量與更低延遲。
三組成績,應該怎麼讀
OpenAI 公布的比較可拆成三層:峰值吞吐效率、端到端延遲,以及互動模式下每位使用者的生成速度。
| 模型 | 峰值 AI 工作量/瓦 | 端到端延遲 | 最低 token 間隔 | 約當每位使用者生成速度 |
|---|---|---|---|---|
| GPT-OSS 120B | 1.9 倍 | 1.7 倍更低 | 2.7 倍更快 | 1,459 vs. 535 tok/s |
| DeepSeek R1 670B | 1.7 倍 | 3.6 倍更低 | 4.1 倍更快 | 700 vs. 169 tok/s |
| Kimi K2.5 1T | 1.5 倍 | 3.4 倍更低 | 3.8 倍更快 | 694 vs. 182 tok/s |
這些數字顯示 Jalapeño 同時追求資料中心總吞吐與單一請求的回應節奏。對即時程式代理、語音介面或互動式研究工具來說,平均每秒能吐出多少 tokens 並不夠;等待多久開始回答、連續輸出是否穩定、多人同時使用時尾端延遲會不會惡化,同樣重要。
不過,「最低 token 間隔」是受控測試裡的最佳運行點,不等於正式環境中每個人都會拿到表格上的速度。模型路由、KV cache 命中率、網路、批次策略、推測解碼與請求長度,都會改變結果。
為什麼 8K/1K 測試不足以代表 Agent 工作負載
InferenceX 的固定序列長度讓不同系統有可重現的比較基準,適合回答「在已知輸入與輸出長度下,哪個系統能以多少功耗完成多少工作」。它不打算完整模擬一個長時間運作的 Agent。
真正的 Agent 可能反覆呼叫工具、讀入新文件、累積對話、壓縮記憶,並在數十分鐘內多次 prefill 與 decode。這些行為會把 cache、路由、排程與長上下文管理推到前台。SemiAnalysis 另外設計的 AgentX 就是為了測這種多輪、長上下文情境,但目前沒有 Jalapeño 的 AgentX 成績。
因此,現在最合理的判斷是:Jalapeño 已證明自己值得進入下一輪測試,尚未證明它在所有 Agent 工作負載都領先。採購與容量規劃不該把 8K/1K 的單輪結果直接換算成完整任務成本。
省下資料搬移,才是架構的核心賭注
OpenAI 將 Jalapeño 的設計重點描述為減少資料搬移,並平衡運算、記憶體與網路。大型模型推論的瓶頸經常來自權重、activation 與 KV cache 在不同層級間移動;搬得越遠、越頻繁,延遲與能源成本就越高。
Jalapeño 採用本地 KV cache,讓每個處理單元靠近自己的記憶體切片,並以大規模互連協調整個系統。prefill 與 decode 並未固定切成兩套硬體池,部署方可以依模型與流量調整。對模型持續快速變動的 OpenAI 而言,這種彈性比只針對一個模型榨出峰值更實用。
SemiAnalysis 對工程樣品的拆解還提到 HBM4、15.4 TB/s 記憶體頻寬,以及可擴充至 2,048 個加速單元的 domain。這些規格有助理解系統方向,但它們來自獨立分析,不應混寫成 OpenAI 已承諾的量產產品規格。
AI 參與晶片開發,真正被證明的是哪些環節
Jalapeño 的另一個焦點,是 AI 已經進入晶片與軟體共同設計。OpenAI 表示,Codex 與 GPT-Astra 協助團隊在兩個月內,讓三個原本不在初始規格裡的開放權重模型達到高效能。公開證據支持模型移植、kernel 開發與效能調校得到加速,尚不足以推論「AI 自己設計了整顆晶片」。
官方也報告,AI 生成的部分 GPT-OSS attention 與 Mixture-of-Experts 運算區塊,比既有人工專家版本快 1.5 至 1.8 倍。結果範圍限於選定 block,不能套用成完整 GPT-OSS 推論速度提升 1.5 至 1.8 倍。
若這套方法能穩定擴大,影響會落在兩個地方。第一,晶片規格凍結後,軟體團隊可以更快把後來出現的模型搬上新硬體;第二,模型設計者能更早看見硬體限制,反過來調整 operator、資料格式與記憶體行為。這才是 OpenAI 垂直整合最難複製的部分。
九個月與十六個月,說的是不同起點
OpenAI 表示,Jalapeño 從「初始設計」到製造 tapeout 用了九個月。SemiAnalysis 則從 2024 年中開始招募核心團隊算起,估計到 tapeout 約十六個月。兩個數字並不互相否定,只是起算點不同。
把兩者混成一句「十六個月做完晶片」會漏掉組隊與架構探索;只留下「九個月」也會低估前期準備。對企業決策者更有用的資訊是:OpenAI 已把模型研究、硬體設計與 AI 輔助軟體開發串成一條縮短迭代週期的流程。
NVIDIA 供應鏈短期仍會並存
Jalapeño 對 OpenAI 的直接價值,是多一個可針對自家流量與模型優化的供應來源。它能降低部分推論成本、增加議價空間,也能讓特定工作負載不必完全依賴通用 GPU。
但 OpenAI 在官方文章裡明確表示,仍會廣泛部署 NVIDIA 與其他合作夥伴的加速器。工程樣品的成功不會立刻取代成熟的 CUDA 工具鏈、量產能力、網路設備、整機方案與維運工具。SemiAnalysis 對 Rubin 的推估也指出,在不同假設下,兩者總持有成本可能接近;Rubin 使用的推測解碼與 Jalapeño 受測時的設定也不同,不能把兩張表硬併成同一場比賽。
短期內,更可能出現的是異質化資料中心:NVIDIA GPU 處理需要廣泛相容性與快速變動的任務,自研 ASIC 承擔規模大、模式穩定且能深度共同設計的流量。誰能把編譯器、排程、互連與模型更新做好,往往比單顆晶片的峰值更重要。
量產前,還要跨過四道門檻
1. B0 與量產版本是否保留工程樣品優勢
目前數據來自 A0 工程樣品。SemiAnalysis 指出 B0 已進入晶圓廠,預期每瓦效能再提升約 25%,但這仍是未完成驗證的前瞻資訊。頻率、良率、散熱與封裝供應都可能改變最終結果。
2. AgentX 與真實混合負載
OpenAI 需要補上長上下文、多輪工具呼叫、不同模型並行與尾端延遲。在自家資料中心得到的數據,也要分清哪些來自晶片、哪些來自軟體堆疊與流量特性。
3. 供應鏈與部署節奏
OpenAI 預計 2026 年底先在自家基礎設施部署。2027 年量產爬坡與 100MW 目標則來自 SemiAnalysis 的報導,不能視為 OpenAI 的正式承諾。從樣品到穩定供應,還要通過封裝、機櫃、網路、散熱與現場維運。
4. 經濟性必須用完整系統計算
每瓦 throughput 是重要指標,卻無法代表完整帳單。真正的成本還包含晶片取得、伺服器、電力轉換、冷卻、網路、備援、利用率、軟體工程與模型切換成本。只看 TDP 或 tok/s,容易在資料中心層級做錯決策。
技術團隊現在應該怎麼評估
第一步先把自家推論負載分群,暫時不必糾結 Jalapeño 能否買到。記錄模型、輸入/輸出長度、prefill 與 decode 比例、並行度、KV cache 命中率、服務等級與功耗。沒有這些基準,任何廠商倍數都無法換成自己的容量需求。
第二步,把 benchmark 分成可比與不可比。只有模型、精度、序列長度、批次、推測解碼、功耗邊界與量測方式相近,才適合直接比較。若設定不同,就把結果保留為方向性證據。
第三步,追蹤軟體可移植性。Jalapeño 若要成為平台,需要證明三個模型以外的新模型、custom operator、量化格式與故障排除能在合理時間內完成。Codex 與 GPT-Astra 的兩個月成果,正好提供一個值得追蹤的先行指標。
常見問題
Jalapeño 已經全面勝過 NVIDIA Blackwell 嗎?
沒有。它在指定的 InferenceX 8K/1K 測試與三個模型上領先受測商用系統。這不等於所有模型、所有部署設定或所有 NVIDIA 產品都落後。
700W 是實際功耗嗎?
700W 是封裝額定 TDP。OpenAI 表示,這次三個受測工作負載的持續功耗都不超過 550W。正式部署仍要看整機與資料中心層功耗。
OpenAI 真的用 AI 設計了 Jalapeño 嗎?
AI 明確參與模型移植、kernel 與選定運算區塊的效能最佳化。公開證據不足以支持「整顆晶片由 AI 自主設計」這種說法。
作者觀點
Jalapeño 的首批成績證明 OpenAI 的自研 ASIC 已經跨過「能不能跑」的門檻,開始進入「能否形成系統優勢」的階段。接下來真正決定勝負的因素,是 AgentX、量產良率、供應節奏與模型更新速度。
對台灣的伺服器、封裝、散熱與企業 AI 團隊而言,訊號也很清楚:推論基礎設施正在從單一 GPU 選型,走向模型與硬體共同設計。Tenten 在企業 AI 架構評估中,會把 benchmark、工作負載與完整持有成本分開驗證;若你正規劃推論容量,可從聯絡頁面提供目前的模型與負載條件。
