OpenAI 週二公布 Jalapeño 首批推論成績,隔天黃仁勳就被 CNBC 當面問到:你投資的夥伴做出一顆可能傷害 NVIDIA 的晶片,真的不介意嗎?

黃仁勳沒有否認競爭,也沒有逐項反駁測試。他把問題往外推了一圈:做出晶片只是起點,接下來還有軟體、量產、供應鏈、雲端覆蓋與整套 AI factory。這個回答比一句「NVIDIA 還是最快」更值得讀,因為它說明 NVIDIA 準備把哪一條防線留給自研 ASIC,又要守住哪一塊市場。

先把社群上最容易混在一起的兩件事分開。Jalapeño 的成績很強,對照組仍是 GB200 與 GB300,沒有 Rubin;黃仁勳談的是 NVIDIA 平台與交付能力,沒有提供第三方市占率報告。

OpenAI 實際贏下的是哪一場測試

OpenAI 公布的 InferenceX 結果涵蓋 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T。三組測試都採固定 8K 輸入、1K 輸出與單 token 預測設定。

在這個範圍內,Jalapeño 的峰值每瓦 AI 工作量為受測 NVIDIA 系統的 1.5 至 1.9 倍,端到端延遲低 1.7 至 3.6 倍。GPT-OSS 的對照組是 1,200 W 的 GB200;DeepSeek R1 與 Kimi K2.5 則對上 1,400 W 的 GB300。Jalapeño 的封裝額定功耗是 700 W。

OpenAI 官方公開的 Jalapeño 推論晶片與電路板

這張成績單不能輕輕帶過。OpenAI 已經證明,針對自家最熟悉的 LLM 推論負載共同設計晶片、記憶體、網路與 serving software,確實能換到更好的每瓦效率與回應速度。

不過,原始資料沒有拿 Jalapeño 對上 Rubin,也沒有證明它在所有模型、輸入長度、批次策略與正式環境都領先。把「最高 1.9 倍」改寫成「每瓦效能是 Rubin 的兩倍」,同時換掉了數字、對手與測試邊界。

為什麼同一張圖會出現 1.9 倍與 53.7 倍

OpenAI 的圖表同時呈現兩種比較。第一種看各系統的峰值效率,GPT-OSS 是 85,448 對 44,960 mixed tokens/s/kW,Jalapeño 約為 1.9 倍。

第二種把兩套系統拉到相同的單一使用者解碼速度,再比較每千瓦吞吐量。當速度提高到每位使用者 535 tokens/s 時,圖上的差距變成 53.7 倍。這個數字很容易被截圖放大,卻不能脫離條件閱讀:它描述 GB200 在該操作點上的效率掉得多快,無法代表 Jalapeño 在所有推論工作上都快 53.7 倍。

OpenAI 官方 GPT-OSS 120B 峰值與同速吞吐比較,對照 Jalapeño 與 GB200

DeepSeek R1 的圖更極端。在峰值效率上,Jalapeño 對 GB300 約為 1.7 倍;拉到每位使用者 169 tokens/s 的共同速度後,差距擴大到 104.3 倍。這說明 Jalapeño 在互動式、高速解碼區間有明顯優勢,也提醒讀者不要把不同操作點的倍率混成一個萬用跑分。

OpenAI 官方 DeepSeek R1 峰值與同速吞吐比較,對照 Jalapeño 與 GB300

黃仁勳沒有說「對手都會爛尾」

X 貼文把黃仁勳的回答整理成四句很有火藥味的結論。對照 CNBC 公開逐字稿,原話更克制。

他說,很多 XPU 專案會啟動,也會有很多被取消;NVIDIA 做了 33 年,仍相信自己能提供最有生產力的基礎設施。他也把信心放在供應鏈與技術規模,並主張 NVIDIA 在 AI 市場的占比仍在增加。

「很多專案被取消」和「最後全都會爛尾」程度不同;「相信 NVIDIA 的技術最好」也不是獨立驗證的效能結論。這些話是執行長在財報夜的競爭定位,文章可以引用,不能替他再加碼。

NVIDIA 同日公布的財報至少支持需求仍在快速增長:2027 財年第二季營收 962 億美元,年增 106%;資料中心營收 890 億美元,年增 117%。但營收成長不等於市占率數字,後者仍需要一致的市場定義與外部資料。

兩家公司都在講 full stack,範圍卻完全不同

最有意思的地方,是 OpenAI 與 NVIDIA 都把 Jalapeño 說成 full-stack 能力的結果。

OpenAI 的 full stack 是垂直的。它掌握模型、ChatGPT、Codex、API 流量、serving 軟體與晶片設計,可以把大量可預測的自家推論負載壓進一套專用系統。需求越集中、模型與服務越能共同調整,ASIC 的每瓦與單位成本優勢就越有機會兌現。

NVIDIA 的 full stack 是水平的。它想讓同一平台跨越訓練、後訓練、推論、不同模型、不同雲端與不同國家。產品範圍涵蓋 GPU、CUDA、NVLink、網路、CPU、機櫃、系統軟體與部署速度。這套平台未必在每一種固定工作負載上最省電,卻降低了客戶押錯模型、工具鏈或供應節奏的風險。

兩家公司走在不同的產品曲線上。OpenAI 要把規模最大的自家流量做得更便宜;NVIDIA 要成為所有人都能立即租到、部署與轉換用途的通用基礎設施。

自研 ASIC 會吃掉 NVIDIA 的生意,但不會一次吃完

Jalapeño 已經跨過一個重要門檻:大型 AI 公司不再只把自研晶片當成議價籌碼,第一代產品就可能拿走一部分正式推論流量。對 NVIDIA 而言,這會在高量、穩定、成本敏感的工作上形成價格壓力。

但 OpenAI 也明確表示,仍會大規模部署 NVIDIA 與其他夥伴的加速器,用於訓練與推論。Jalapeño 的量產驗證、軟體成熟度與更多模型測試仍在進行,首批部署目標是 2026 年底。

因此,更可能出現算力分層,而非單一贏家。穩定的推論流量往自研 ASIC 移動;前沿訓練、模型快速變動、跨雲端服務與需要完整軟體體系支援的工作,繼續支付 NVIDIA 的平台溢價。OpenAI 一邊降低對 GPU 的邊際依賴,一邊仍需要 NVIDIA 擴大整體算力池。

這也解釋黃仁勳為何能說「我不介意」。只要 AI 使用量增長得比 ASIC 替代速度更快,NVIDIA 即使失去部分工作負載,絕對出貨與營收仍可能增加。真正危險的轉折會發生在自研平台開始跨模型、跨雲端複製,並在量產與軟體上追平之後。

接下來要看三個訊號

第一,Jalapeño 能否在 2026 年底如期進入正式部署,並把工程樣品的效率帶到長時間、多租戶的生產環境。

第二,OpenAI 每一代模型更新後,要花多少時間重寫 kernel 與完成效能調校。專用晶片的效率來自精準匹配,模型變動也可能讓這種優勢快速折舊。

第三,NVIDIA 能否證明平台價值足以抵銷單點效率差距。Vera Rubin 的量產爬坡、CUDA 軟體改善、供應交付與雲端利用率,會比執行長的信心宣言更有說服力。

常見問題

Jalapeño 已經打敗 Rubin 嗎

沒有這項公開測試。OpenAI 的三組 InferenceX 結果對照 GB200 與 GB300,沒有 Vera Rubin。Jalapeño 在指定模型與操作點領先,無法代表所有推論或訓練工作都領先。

黃仁勳是否說所有自研晶片都會失敗

沒有。他說很多 XPU 專案會啟動,也有很多會被取消;同時表達對 NVIDIA 技術、供應鏈規模與市場位置的信心。把這段話縮成「最後都會爛尾」會失去原本的程度差異。

OpenAI 有了 Jalapeño,還會買 NVIDIA GPU 嗎

會。OpenAI 表示仍會廣泛部署 NVIDIA 與其他夥伴的加速器,用於訓練和推論。Jalapeño 先承接適合深度共同設計的推論流量,並不等於立即替換整個運算平台。

權威來源

作者觀點

Jalapeño 讓 NVIDIA 第一次更難用「客戶的自研晶片還沒量產」帶過。OpenAI 已經拿出可以討論的硬體、模型與數字,接下來要證明的是生產系統。

黃仁勳的回應也點出 NVIDIA 真正想守的東西:每一張 benchmark 都拿第一並非目標。客戶走出自家資料中心後,仍把 NVIDIA 當成最省時間、最容易取得的共同平台,才是這家公司要守的優勢。自研 ASIC 會切走推論,NVIDIA 則要把競爭單位從晶片擴大到整座工廠。

Share this post
Erik (EKC)

With over 20 years of experience in technology, and the startup industry, I am passionate about AI and driving innovation. Keeping the engine running

Loading...