GPU 的經濟價值,不能只照新舊世代排序。 Ornn 在 2026 年 9 月 7 日研究中估算,同樣執行 gpt-oss-120b,A100 每百萬輸出 token 的算力成本為 US$0.29,H100 為 US$0.64。這組條件式結果,為舊 GPU 留下繼續出租的理由,但還算不出單張設備的殘值。
AI 基建的帳上,晶片發表日很容易取得,未來客戶願意付多少租金卻難得多。新 GPU 加快運算,原有設備也可能因租金下跌,接到願意等待、對價格敏感的工作。只看跑分,會漏掉這群買方;只看便宜租金,則會漏掉他們對品質與交付時間的要求。
NVIDIA 在 9 月 10 日把 GPU 定位為可投資資產,理由是生產力、可替代性與耐用性。Ornn 的研究替這個主張提供部分支持,也清楚列出證據的限制。關鍵在於舊設備還能完成哪些有用工作,以及有多少客戶願意為它付費。

便宜一半,成立在特定工作與成本口徑
《The Economics of Open-Weight Inference》比較 11 個開放權重模型與 8 個封閉模型。硬體成本部分另取兩個工作負載,把租金除以可產生的輸出量,並納入利用率。這些結果是研究計算,並非各家雲端供應商的統一售價。
| 研究採用的條件與結果 | A100 | H100 |
|---|---|---|
| 9 月 1 日現貨租金,US$/GPU 小時 | 1.00 | 2.83 |
| gpt-oss-120b 基準輸出量,token/秒 | 2,276 | 2,901 |
| gpt-oss-120b 滿載算力成本,US$/百萬輸出 token | 0.12 | 0.27 |
| gpt-oss-120b 基本情境成本,同上單位 | 0.29 | 0.64 |
| Llama-2-70B 基本情境成本,同上單位 | 0.75(估計) | 0.68 |
基本情境先保留 15% 容量,再假設其餘容量有 50% 用於有效產出。滿載情境則不保留容量、利用率為 100%。資料見 Ornn 研究表 6、表 7。
H100 在這組 gpt-oss-120b 基準中仍然較快,但租金是 A100 的 2.83 倍,速度差距卻小得多。較低租金因此抵銷了較低輸出量。換成研究的 Llama-2-70B 基本情境,兩者排名就反過來。
這份比較也沒有固定所有測試條件。gpt-oss-120b 的兩組基準使用不同 vLLM 版本,採高併發、未限制延遲的測試。Llama-2-70B 的 A100 數字還包含估計與不同精度的換算。研究指出,只按世代判斷成本會出錯。公司要決定採用哪一代 GPU,仍得測自己的工作負載。

賣得出去與有效運轉,是兩本不同的帳
對租用者而言,便宜的 GPU 也可能因閒置而昂貴。模型需要保留突發流量的餘裕,維運也需要人力。表格只計算算力,完整預算還得加上租金未包含的主機、網路、儲存與操作成本。
Ornn 的敏感度分析相當直接。在相同假設下,代管輸出價格若是每百萬 token US$0.60,A100 約需 24% 有效利用率才能追平。H100 約需 53%。若替代方案降到 US$0.17,A100 所需利用率升到約 84%。再加入 25% 額外成本,所需利用率就超過 100%,已不可能靠提高使用量達成。
這些是研究日期的輸出價格比較,代管帳單還有輸入費用。它們不能直接當作完整損益平衡點。不過,選哪一家代管服務作為比較對象,足以改變自架是否划算的答案。
設備持有者則看出租率。Ornn 追蹤的 A100 即時租賃容量,在 2026 年 3 月 1 日有 74% 已出租,9 月 1 日升至 90%;同期上架容量增加 13%。按這些數字計算,已出租容量約增加 37%。這不是全球 A100 裝機量,也無法看出承租者把 GPU 用得多滿。
供應商看設備有沒有付費客戶,買方看能不能用它低成本完成工作。兩者會互相影響,卻不能把 90% 出租率直接放進推論成本公式。

五年租價保留八成,沒有保證單卡活十一年
Ornn 的長約資料顯示,A100 五年期每 GPU 小時租價,為一個月期報價的 80.2%。H100 為 59.8%,H200 為 43.7%,B200 為 53.8%。這四組報價標記日期都是 2026 年 8 月 13 日。
分母是各自的一個月租價。A100 保留比例較高,不代表它五年後的絕對租金最高,也不代表設備售價保留八成。長約可能交換更穩定的出租量,付款條件與保證供應也會影響報價。
研究用 2026 年 9 月到 2031 年 9 月的示例合約,算出屆時 A100 家族距發表約 11.3 年。家族年齡與實際設備年齡不能混用。供應商可以在合約期間更換設備,報價承諾的是提供該類算力,不是同一張卡連續運轉十一年。
Microsoft 的退役紀錄也需要相同區分。Azure 文件記載,搭載 K80、P100、P40 的早期 VM 系列於 2023 年 8 月 31 日退役,最早系列在 2016 年推出。這能說明產品線服務跨越數年,無法證明每張卡的使用起點或獲利年限。硬體可以繼續運作,軟體支援與機房資源配置仍可能促使業者汰換。
算力期貨移轉價格風險,需求仍要自己找
2026 年 5 月 19 日,ICE 與 Ornn 宣布規劃以 OCPI 算力價格指數為基準的 GPU 期貨。公告寫明以美元計價、現金結算,推出須經監管核准。它提供的是計畫與合約方向,不能讀成所有產品都已正式掛牌。
ICE 官方公告指出,OCPI 根據實際成交建立,並透過 Bloomberg Terminal 分發。Ornn 另說明,即時指數追蹤按需租賃交易;長約曲線由分析人員依市場交易安排整理。成交指數與長約報價是不同資料。
對營運商來說,若能取得合適的避險工具,租金下跌的部分風險就有機會移轉。但現金結算不會交付 GPU,也不會讓空機房自動出現客戶。設備故障、服務不符需求,以及自身租價與指數不同步的風險,仍留在營運帳上。
GPU 的可替代性也有範圍。相同模型能移到另一家供應商,不代表所有記憶體配置、互連與服務條件都相同。金融合約可以把價格單位標準化,卻不能把每台機器變成完全相同的交付品。
舊卡有生意,還不足以推定投資報酬
開放權重讓營運商有機會選擇部署位置,也能把某些可等待的工作移到便宜設備上。這是合理的需求來源。要推到整批 GPU 的經濟壽命,還需要工作量足夠大,而且客戶持續付出的租金能涵蓋必要支出。
Ornn 同時經營資料授權與 GPU 租賃,研究也揭露這項商業利益。其資料涵蓋追蹤中的供應商,完整原始摘錄與計算程式沒有隨論文一起公開。研究更明言,租賃觀察尚未辨識開放權重需求的因果貢獻,不能單憑兩者同時成長就認定原因。
評估 AI 基建時,收入假設應對應到具體合約與工作種類。客戶續約時能接受什麼價格,設備換用途需要多少成本,都比延長折舊年數更接近現金流。如果某批設備只能在低利用率下等待訂單,較長的帳面年限也補不回租金。
常見問題
A100 執行推論一定比 H100 便宜嗎?
不一定。Ornn 的 gpt-oss-120b 基本情境算出 US$0.29 與 US$0.64,但另一個工作負載的排名不同。租金、有效利用率與服務要求都會改變結果。
五年租價保留 80.2%,等於 GPU 殘值也有八成嗎?
不等於。80.2% 比較五年期與一個月期的每小時租價,標的是算力服務。單張設備殘值還需要設備狀況、二手市場及持有成本等證據。
GPU 算力期貨能保證機房獲利嗎?
不能。合適的價格避險可能降低租價波動,但無法保證出租需求或設備可用性。ICE 與 Ornn 的 2026 年 5 月公告也保留監管核准條件。
企業評估舊 GPU,最先該補哪一項資料?
先量測自己的工作在相同品質與交付時間下,需要多少付費 GPU 小時。再把完整維運成本與可取得的代管報價放在一起,才有可比較的預算。
權威引用
- Ornn:The Economics of Open-Weight Inference,2026 年 9 月 7 日。
- GPUStack:A100 基準設定與完整輸出。
- GPUStack:H100 基準設定與完整輸出。
- Microsoft:早期 Azure GPU 系列遷移與退役說明。
- ICE:GPU 算力期貨規劃公告,2026 年 5 月 19 日。
- Ornn:價格指數方法與長約曲線說明。
- NVIDIA AI Infrastructure:GPU 資產定位聲明,2026 年 9 月 10 日。
Author Insight
我會把舊 GPU 的投資案拆成兩個判斷:設備能完成什麼,以及誰願意持續付費。這份研究讓第一個問題有了更好的成本例子,第二個仍要靠客戶與合約回答。把兩者混在一起,最容易高估的是收入能維持多久。
術語表
- 開放權重:可取得模型權重;實際部署仍受授權與相容條件限制。
- 有效利用率:扣除保留容量後,用於有效產出的比例。
- 出租率:追蹤上架容量中,已有承租者的比例。
- 長約租價:指定合約期間內,每 GPU 小時的租用價格。
- 基差風險:自身實際租價與避險指數的變動不一致。
