AWS 與 NVIDIA 把雲端 AI 的競爭從「買哪一顆晶片」推進到另一個層次。AWS 將在 2027 至 2028 年額外部署 200 萬顆 Blackwell Ultra、Rubin 與 Rubin Ultra GPU,同時導入 Vera CPU,並讓下一代 Trainium 採用 NVLink Fusion 與 NVHBM。

200 萬顆是最醒目的數字,卻不是這份合作最難複製的部分。AWS 自研晶片沒有停,NVIDIA 的位置也已超出 GPU 訂單本身。雙方正在把運算、記憶體、互連、機櫃與雲端控制層拼成同一套異質系統。

這對半導體市場的意義很直接:超大規模雲端業者仍會設計自己的加速器,但「自研」不再等於每一層都自己做。真正的戰場,正從單顆晶片轉向誰能定義機櫃級架構。

官方確認了什麼

AWS 與 NVIDIA 的聯合公告列出這次合作的主要範圍:

項目 已確認內容 時程或範圍
NVIDIA GPU 額外部署 200 萬顆 2027 至 2028 年
GPU 世代 Blackwell Ultra、Rubin、Rubin Ultra 分布於 AWS 全球基礎設施與 AI factories
Vera CPU AWS 將提供 Vera CPU 基礎設施 面向需要高效能 CPU 的 agentic AI 工作負載
Trainium Annapurna Labs 與 NVIDIA 合作導入 NVHBM 下一代 Trainium 設計
機櫃互連 Trainium 採用 NVLink Fusion 從 Trainium4 開始支援共同機櫃級架構
美國政府 規劃建置含 10 萬顆 GPU 的安全 AI factories 支援 IL6 以上聯邦與國安工作負載

這 200 萬顆是「額外部署」,不是官方揭露的固定金額採購合約。AWS 在 2026 年 GTC 已宣布,自 2026 年起增加超過 100 萬顆 NVIDIA GPU;新計畫把後續部署再增加 200 萬顆。兩批合計超過 300 萬顆,但型號、交付節奏、價格、機櫃配置與實際用電量都沒有完整公開。

因此,外界以單一 GPU 價格估算出 800 億至 1,200 億美元,或直接換算成 2.8 萬個 NVL72 機櫃與 6 至 7 GW 功耗,都只能當情境推演。Blackwell Ultra、Rubin 與 Rubin Ultra 的系統組成並不相同,雲端部署也會混合單機、機櫃與專用 AI factory。官方資料不足以支撐一個精確總價。

AWS 自 2026 年起超過 100 萬顆、2027 至 2028 年再增 200 萬顆 NVIDIA GPU 的部署時間線

200 萬顆說明需求還在,但不能直接等同終端使用率

AWS 在第一批百萬顆計畫公布後不久,又把 2027 至 2028 年的 NVIDIA GPU 容量加上 200 萬顆。這至少說明 AWS 願意提前為未來兩年的 AI 工作負載鎖定基礎設施。

官方列出的需求來自 agentic AI、科學研究、企業自動化與 physical AI。這些場景的工作負載遠超一次模型訓練。代理會反覆推理、查資料、呼叫工具、執行程式,再把結果送回模型;機器人則需要模擬、合成資料、訓練與實體驗證。每一個應用都會把算力需求拉成持續運作的流程。

不過,部署計畫仍不等於已經售出的雲端用量。AWS 要先取得晶片、建好機房並接上電力,才有容量可賣。最後能否轉成高使用率,要看 frontier labs、企業與政府客戶是否真的把專案從試驗推向生產。

對 NVIDIA 而言,這筆合作提高了 2027 至 2028 年出貨的可見度;對 AWS 而言,它同時放大資本效率的考驗。機房若準時上線且使用率夠高,提前鎖產能會成為優勢。若電力、網路或客戶部署延後,資產折舊仍會照時間發生。

Vera 進入 AWS,不代表 Graviton 被替換

AWS 是自研 CPU 最成功的雲端業者之一。Graviton 已經證明 Arm CPU 可以在通用雲端工作負載中建立規模。這次導入 NVIDIA Vera,容易被解讀成 AWS 對自研 CPU 路線鬆動;官方說法沒有支持這個結論。

Vera 被放在一個更窄也更具體的位置:處理 agentic AI 與 reinforcement learning 背後的 CPU 工作,包括程式執行、工具使用、sandbox、資料管線與 orchestration。NVIDIA 的定位是讓 CPU 供應 GPU 所需的資料與控制工作,減少昂貴加速器等待。

Graviton 仍可服務廣泛的雲端運算。Vera 則可以成為 Vera Rubin 系統的 host CPU,或以獨立 CPU 基礎設施支援 AI factory。AWS 這次增加的是針對 AI 系統控制面的配置,並未撤換既有 CPU 產品線。

這也說明代理式 AI 正在改變 CPU 的價值判斷。核心數量和單價仍重要,系統現在還要計算工具呼叫延遲、sandbox 密度、資料搬移,以及 CPU 能否讓 GPU 保持高使用率。單顆處理器的跑分,不足以代表整座 AI factory 的效率。

Trainium 接入 NVIDIA 技術,才是合作最深的一層

Trainium 是 AWS 用來降低 AI 運算成本並減少單一供應商依賴的自研加速器。這次合作沒有停止 Trainium,反而讓它從 Trainium4 開始支援 NVLink Fusion,並由 Annapurna Labs 率先與 NVIDIA 合作開發 NVHBM。

AI factory 的五層異質機櫃架構:運算、CPU、記憶體、互連與雲端控制

NVIDIA 對 NVHBM 的說明指出,傳統 HBM 把記憶體控制器放在 XPU die 上;NVHBM 則把 NVIDIA 的客製記憶體控制器移到 HBM base die。依 NVIDIA 的目標值,相較標準 HBM4E,這套設計可提供最高 30% 更高記憶體頻寬、降低 15% HBM 功耗,並釋出最高 25% XPU 運算 die 面積。

這些數字屬於 NVIDIA 對新技術的宣稱,仍要等記憶體夥伴驗證與實際 Trainium 系統導入。它的架構意義已經很清楚:AWS 可以保留 XPU 運算核心的設計權,把記憶體控制與機櫃內 scale-up 互連交給一套較成熟的共同介面。

標準 HBM4E 與 NVHBM 記憶體控制器位置及 NVIDIA 目標值比較

NVLink Fusion 讓客製 XPU、CPU、NVLink Switch 與 NVIDIA 機櫃系統共存。AWS 不必放棄 Trainium,就能讓自研加速器與 NVIDIA GPU 出現在共同機櫃級架構裡。對客戶而言,這有機會降低不同加速器之間的資料搬移與系統整合成本。

對 NVIDIA 而言,這一步比多賣一批 GPU 更有長期價值。就算超大規模客戶把部分運算移到自研晶片,NVIDIA 仍可能在互連、記憶體介面、交換器、系統與軟體層取得位置。它把競爭範圍從 GPU 市占率,擴大成 AI factory 的架構權。

自研晶片與 NVIDIA,從替代關係走向分層合作

Amazon 執行長 Andy Jassy 在 2025 年股東信中明確強調 Trainium 的價格效能與需求。Trainium2 接近售罄,Trainium3 幾乎被預訂完,Trainium4 在廣泛供應前已有大量容量被保留。AWS 沒有理由停止這條產品線。

同一家公司現在又計畫部署額外 200 萬顆 NVIDIA GPU。兩件事同時成立,代表雲端客戶不再把選擇題寫成「自研 ASIC 或 NVIDIA」。穩定、可預測、價格敏感的負載可以往 Trainium 移動;需要廣泛軟體支援、快速部署與前沿模型彈性的工作,仍會使用 NVIDIA GPU。

當兩者進入同一座 AI factory,互連與記憶體架構變成共同瓶頸。AWS 若能在不同加速器之間安排工作負載,就能降低技術路線押錯的風險。NVIDIA 若能讓競爭者的 XPU 使用 NVLink Fusion 與 NVHBM,就能在 GPU 之外建立另一層平台收入與控制力。

接下來要追的四個訊號

第一,200 萬顆 GPU 的實際交付組合。Blackwell Ultra、Rubin 與 Rubin Ultra 各占多少,會決定機櫃密度、電力需求與 NVIDIA 的收入節奏。

第二,Trainium4 與 NVLink Fusion 的量產時程。支援規格不等於完成部署,還要看交換器、機櫃、軟體與 AWS Nitro、EFA 的整合是否如期完成。

第三,NVHBM 能否在多家記憶體供應商驗證後達到頻寬、功耗與 die 面積目標。這會決定它能否從 NVIDIA 技術變成客製 XPU 的共同介面。

第四,AWS 新增容量的使用率。晶片數量證明供給企圖,客戶租用、服務營收與現金回收才會證明需求品質。

常見問題

AWS 是否已向 NVIDIA 下了 200 萬顆 GPU 的固定金額訂單

官方用語是 AWS 計畫在 2027 至 2028 年額外部署 200 萬顆 NVIDIA GPU,沒有公開固定採購金額、平均單價或付款條件。因此不能把外部估值當成官方訂單價值。

AWS 總共會部署多少顆 NVIDIA GPU

AWS 在 GTC 2026 已宣布自 2026 年起增加超過 100 萬顆,這次再宣布 2027 至 2028 年額外部署 200 萬顆。依兩次公告,計畫規模合計超過 300 萬顆,但實際交付仍受時程、型號與基礎設施建置影響。

Vera CPU 會取代 Graviton 嗎

目前沒有這項證據。AWS 把 Vera 定位為 agentic AI 的額外運算選項,Graviton 仍服務廣泛的通用雲端工作負載。兩者可以在不同系統角色中並存。

剛好相反。AWS 保留 Trainium 的 XPU 核心設計,同時採用 NVIDIA 的 scale-up 互連與 NVHBM 記憶體技術。這是一種半客製、異質機櫃策略,而非放棄 Trainium。

權威來源

作者觀點

AWS 的 200 萬顆部署計畫證明 NVIDIA GPU 需求仍大,Trainium 接上 NVLink Fusion 與 NVHBM 則揭露了更長期的變化。NVIDIA 正試著讓「客戶自研晶片」也成為自己平台的一部分。

下一輪 AI 基礎設施競爭的勝負,不會由單一晶片決定。能讓多種 CPU、GPU 與 XPU 在同一座 AI factory 裡運作,又能掌握記憶體與互連標準的架構供應者,會占據更有利的位置。

Share this post
Erik (EKC)

With over 20 years of experience in technology, and the startup industry, I am passionate about AI and driving innovation. Keeping the engine running

Loading...