AI 時代的硬件降本邏輯重構
「降低詞元成本最有效的方式,絕非降低 GPU 售價或使用低成本網絡,而是每一代都交付大幅提升的算力性能。如果將節點或機架的性能提升 10 倍到 30 倍,這種性能提升會直接作用於計算公式的分子,從而降低整個數據中心每個詞元的成本。」
解析
傳統 IT 採購習慣通過壓低硬件單價來控制成本。然而在 AI 工廠時代,算力性能的提升呈指數級(10 倍至 30 倍),對 TCO 的拉動作用遠超芯片單價的微調。因此,通過提升性能來攤薄單位算力成本,遠比單純採購低價硬件更為高效。
Agentic AI 排除人工干預,引發算力消耗劇增
「智能體讓人類退出了這個交互循環,計算資源的消耗速度完全取決於智能體自我轉折與思考的速度。以前服務設計者可以依賴‘人類閱讀和打字需要時間’這一間隙來調度算力,而現在智能體自我提問和轉折極快,在 AgentX 基準測試中,算力需求在純數值層面直接提升了 100 倍。」
解析
從 Chat 模式跨越到 Agentic AI,算力需求迎來了範式轉變。過去雲服務調度的底層假設建立在人類反應與輸入速度受限的基礎上,而 Agent 移除了 Human-in-the-Loop 的緩衝,使算力進入無縫且高頻的滿載狀態。
評價 AI 芯片的核心指標發生轉移
「對於每一代算力產品,我們考慮的不只是絕對詞元性能,唯一關鍵的指標是每兆瓦(MW)的總詞元吞吐量。提高這一指標,就能提升 AI 工廠產生營收的能力。」
解析
AI 硬件評價體系正在發生重塑。行業評估標準已從追求單芯片 FLOPs 或單卡跑分,轉向評估數據中心的電能轉換效率(Tokens per Megawatt)。算力的核心價值不再侷限於峯值性能,而是體現為將電能轉化為實際營收的效率。
通過軟件挖掘數據中心 40% 的隱性產能
「通過軟件在機架與固件層面動態管控功耗,確保其永不超出閾值,可以在完全相同的預留電力包絡下部署多達 40% 的機架,直接將吞吐量提升至每秒 12 億詞元。」
解析
數據中心按照硬件最大峯值功耗預留電力的靜態部署模式已被打破。在電力供應受限的客觀條件下,利用 MaxLPS 等軟件定義電力技術,無需新建數據中心或增加電力配額,即可在原有電力包絡內提升 40% 的 GPU 部署密度。

Ian Buck:從 Vera Rubin 平台看 Agentic AI 時代的算力演進
目錄
-
引言:二十五載計算演進與數據變換的力量
-
範式轉變:從2023年的Chat基準測試到智能體AI工作負載
-
認識Vera Rubin:面向智能體計算的全棧架構
-
極致延遲與吞吐量:Groq LPU集成與Olympus核心
-
生態系統與擴展:NVLink Fusion、智能存儲與MaxLPS功率管理
-
展望未來:按年度節奏交付AI基礎設施路線圖
引言:二十五載計算演進與數據變換的力量
Ian Buck: 今天我將分享如何面向智能體AI時代推進基礎設施建設,這本質上代表了推理含義的新時代。我會從我的工作視角分享一些看法,並介紹我們正在研發的創新技術,讓這裏的社區了解我們正在構建的產品。同時,我也會詳細介紹Vera Rubin,說明過去幾年甚至僅在過去一年中發生的巨大變化,以及我們在高層面採取的應對措施。
我認為計算的領域極其廣闊。Ian和Patterson博士解釋過計算如何改變了他的視角,從早期的磁芯存儲一直延伸到今天與未來。這切實展示了計算基礎設施與計算能力的重要性:將數據進行變換,獲取信息後施加計算並輸出結果,再反饋回來重新變換。這就是價值創造的本質。存儲信息很重要,傳輸信息也很重要,但價值是在計算以及將實際數據變換為計算的過程中產生的。
從我們的角度來看,這個平台規模巨大。我在NVIDIA工作了近26年,這一切顯然始於將一種全新的計算平台上線,即CUDA。從那時起,它的應用範圍得到了極大擴展。這張圖展示了使用我們GPU的人群多樣性,涵蓋超大規模雲服務商、AI原生企業、初創公司、各大AI實驗室、企業客戶以及邊緣端。這融合了AI模型與傳統模擬計算,或者說是兩者的結合,因為它們如今在相互支持。
現在Hugging Face上已有超過300萬個模型,其中約3000個模型佔據了約90%的下載量。模型的多元化在持續擴展,工作負載正從計算機視覺擴展到物理科學、生命科學、語音、自然語言以及機器人技術。我們擁有用於量子計算和模擬的AI模型,也有正在探索全新架構的多模態與前沿模型。在此之上,還有一整套用於計算的模擬庫和應用,覆蓋計算光刻、決策制定、醫學成像、天氣分析到基因組學等各個領域。
計算已成為科學研究、工業生產、消費者互動和企業計算不可或缺的能力,橫跨AI與模擬計算。我們目前有超過8000個主要的CUDA應用運行在這些平台上,而我們構建這個平台已經有大約25年了。
範式轉變:從2023年的Chat基準測試到智能體AI工作負載
現在的狀況如何?這就是Vera Rubin。它的設計初衷是成為下一代推理與智能體平台。顯然,我們繼續支持大規模訓練,這也是我們能夠提供的能力。但讓這一切落地生根的是AI工廠,而Vera Rubin就是為此而設計的。
它建立在豐厚的生態系統之上。我們在全球可追蹤到有超過1000萬名開發者在NVIDIA GPU上進行開發。它涵蓋雲服務商、網絡服務商、OEM和ODM。有超過300家主要公司構建了供應鏈來協助交付這個平台,看着這一切發生令人驚歎。
它具有極高的通用可替代性。我認為這也是它能夠為全球帶來巨大價值和幫助的原因之一:你提供了一個可以運行所有工作負載和每個模型的計算平台,無論是開源模型、閉源模型還是前沿模型。它可以支持預訓練、後訓練、推理、智能體AI以及加速計算,所有這些都在智能體工作負載中同時調用。
此外,它具有很強的耐用性。David提到GCP中的GPU仍在提供最初的Voltas,那可以追溯到很久以前,幾乎有十年了。你仍然能看到我們十年前發布的GPU在創造價值。事實上,如果你追蹤我們在COVID初期發布的A100的每小時實例租用價格,就會發現它隨時間推移不降反升,且需求依然強勁。

那麼軟件層面發生了什麼變化?變化最顯著的是工作負載。最初的大量基準測試是基於Chat進行的,那是2023年突破性的工作負載,後來成為MLPerf Inference等基準測試的基礎。它當時大約有1K的輸入詞元數量,用於系統提示詞和其他用戶數據的KV Cache大小可能在4K左右,人們以多輪對話的方式與它交互。你提出問題,它給出回覆,然後你可能再追問,平均大約三輪對話。這是一種人機迴環(Human-in-the-Loop)模式,當時還沒有智能體,但這成為了基準測試和理解我們價值的基礎,即運行此類工作負載的效果如何,無論是DeepSeek模型還是類似於ChatGPT的閉源接口。
如今,智能體AI已截然不同,它帶來的挑戰超乎想象。它的需求極其嚴苛,在純數值層面提升了100倍。這是來自AgentX基準測試的數據,雖然不能說代表所有人,但對比我們今天的基準測試與以前的推理,平均輸入規模達到了142000個詞元。而且它是動態的,你需要支持從1K、10K、100K一直到142K、200K甚至更長的短輸入。每一種輸入長度都需要一整套全新的算子內核優化、調優和數學計算調整,這極大增加了軟件優化的複雜度。
KV Cache的規模變得異常龐大。模型開始支持多達100萬個詞元。你開始時規模可能很小,但隨着智能體進行多輪交互(現在不再是人在迴路中,而是智能體在不斷自我提問),上下文會持續累加。現在所有這些KV Cache都需要在整個數據中心範圍內進行管理。
最後,交互輪數呈爆發式增長。以前服務設計者可以依賴這樣一個事實:人類需要花時間閱讀答案然後再給出下一個提示詞,這使得任務調度相對容易。現在智能體讓人類退出了這個循環,計算資源的消耗速度完全取決於智能體自我轉折的速度,這種速度非常快。

在AgentX基準測試中,他們只設定了大約四個子智能體,而我們在商業服務中擁有成千上萬個智能體,但它們都需要進行智能路由。模型現在必須做出決策,並在整個平台中調用所有這些不同的子智能體,且KV Cache需要在所有環節中得以保留。
如果審視工作負載的結構,會發現它複雜得多。過去只是詞元輸入、運行模型、詞元輸出,現在則涉及調度CPU通過Helm Charts管理動態Kubernetes容器。我們有LLM負責處理上下文和觀察數據,另一層負責推理,還有一層負責決定在下一輪中調用哪些子智能體或工具。
最後,我們還要運行所有這些工具:有些基於CPU,有些需要GPU,有些是模擬計算,有些則是加速計算。在此之上,我們有CPU集群在管理和監控安全與治理。我們不希望智能體發生幻覺、產生錯誤想法或浪費時間和詞元營收資金,因為那會導致系統崩潰。所有這些都需要在內存上下文窗口中進行管理,而作為模型工作知識庫的上下文窗口也因此發生了爆炸式增長。
認識Vera Rubin:面向智能體計算的全棧架構
這就是Vera Rubin的設計初衷。當我們發布它時,我們談論的不是推出單芯片,也不是降低單個LLM模型的成本,而是要能夠運行整個工作負載。


在基礎平台方面,Vera Rubin NVL72建立在我們為Grace Blackwell所做的基礎之上,並擴展了其能力。當我們希望從用戶詞元角度實現更快速度時,我們還加入了基於Groq LPU技術的加速包。對於這些高價值工作負載,我們可以進一步提升平台性能。
在此之上,智能體CPU至關重要。我們必須能夠快速、高效、滿載地完成所有工具調用和計算,從而將結果快速返回給用戶。我們絕不希望CPU拖慢整個技術棧的運行速度。
最後,所有KV Cache都需要在智能存儲中進行管理。隨着系統內部流動着各種上下文,所有數據都需要被管理、治理並集成到軟件定義網絡中,同時在後台進行優化時對KV Cache執行索引和向量檢索。這就是為什麼我們針對存儲推出了BlueField,與所有構建這些系統的存儲合作伙伴合作,由我們向他們提供SmartNIC和計算平台。
再來看規模化網絡。這些模型非常龐大,單個GPU根本裝不下。事實上,目前所有人都在做解耦推理。我們去年討論過Dynamo軟件,如今它已經廣泛應用。每個人都在將Prefill階段與Decode階段分離運行,並在其上管理所有KV Cache,從而獲得最佳的詞元速率和吞吐量。要連接所有這些組件,需要網絡基礎設施的支持。當然,所有這些設施也可以用於RL和後訓練階段的訓練過程。
這些是啱啱發布的SemiAnalysis智能體基準測試在Vera Rubin上的運行結果。通過與整個生態系統在開源和閉源模型上的全棧協同設計,它在智能體工作負載上實現了30倍的AI工廠吞吐量提升。事實上,根據你在帕累託曲線上觀察的位置不同,部分場景下的性能提升甚至高達60倍。

左側是每兆瓦(MW)的總詞元吞吐量。所有這些數據中心都受到兆瓦(MW)功耗的限制。對於每一代產品,我們考慮的不只是絕對詞元性能,關鍵指標是每兆瓦(MW)的總詞元吞吐量。提高這一指標就能提升AI工廠產生營收的能力。
如果你在運行像DeepSeek v4這樣的模型,你會希望思考速率達到每秒100個詞元以上,以便計算出答案並快速返回。事實上,你可能希望進一步提升到每秒200至250個詞元,這樣智能體就可以進行更深度的思考,並在65輪交互中更快給出答案,無需讓用戶等待太久。
此外,我們還必須降低每百萬詞元的成本。這張圖展示了對比Grace Blackwell與Vera Rubin生成詞元的成本。可以看到,由於性能提升,成本大幅下降。我們降低成本最有效的方式就是每一代都交付更強的性能。如果我只是降低GPU芯片的售價,或者採用成本更低的網絡,我只是改善了這個龐大數據中心裏的一個細小環節。如果我將那個節點或機架的性能提升10倍或30倍,這種性能提升會直接作用於公式分子,從而降低整個數據中心每個詞元的成本。
極致延遲與吞吐量:Groq LPU集成與Olympus核心
如果我們希望思考得更快、更積極,並能夠執行快速交互,該怎麼做?在許多應用場景中智能體舉足輕重,我們希望將它們置於關鍵路徑上,用於實時業務分析或前沿計算。我們可以進一步提升Vera Rubin的性能。從Blackwell到Vera Rubin,我們提升了整體用戶交互體驗。但如果我們想追求極致,從每秒數百個詞元提升到單用戶每秒數千個詞元,我們可以藉助Groq技術進一步釋放性能。



這些是最新出來的測試數據。對於像Gemma 4或Qwen 3.8這樣擁有100K長上下文的模型,我們在Gemma 4上可以實現每用戶每秒3400個詞元,在Qwen 3.8上可以實現每用戶每秒2529個詞元。在大上下文場景下這個速度非常驚人。上下文越長,模型為了生成每個新詞元就越需要檢索整個對話歷史,這增加了計算量,但這也是智能體應用場景所必需的。
工具調用極為關鍵。全球不僅缺乏數據中心和GPU,也同樣缺乏CPU。雖然此前人們使用連接到Blackwell的Grace CPU來進行工具調用,但我們現在看到了對用於智能體計算的高效快速專用CPU的需求。我們提取了原本連接到Rubin GPU上的CPU,構建了專用的Vera CPU機架。
什麼是Vera?它採用了NVIDIA自主設計的Olympus核心。它的設計目標是實現高速度,在每個核心滿載運行的同時,以最快的速度輸出答案。我們通過定製的Olympus核心實現了這一點。
為了讓所有核心高速運轉且不產生瓶頸,核心與核心之間擁有極高的帶寬。這是一個大型單片計算裸片,每個核心無需跨越Chiplet進行多跳傳輸即可訪問內存,從而獲得了極低的內存訪問延遲。配合LPDDR內存子系統,它不僅功耗低,而且延遲比市面上其他方案低40%。在CPU計算中,內存延遲往往起主導作用。
這與雲時代之前的CPU表現形態有所不同。過去的CPU具有高單線程性能但核心數較少,導致整體吞吐量較低。而在AI出現前的雲計算時代,衡量指標變成了每個核心的成本,這拉高了核心數量,而單線程性能則退居其次。這就是核心數量激增的原因,因為當時雲服務客戶主要詢問的是每個核心的價格,用於運行網頁託管和數據庫。

Vera的設計旨在讓188個核心(開啓SMT時為176個核心)保持高吞吐量,同時維持高單線程性能,確保詞元延遲不受影響。
這些結果經由Signal65使用斯坦福大學的Terminal Bench基準測試進行了驗證。我們在80多項測試中運行了Terminal Bench的CPU端任務,Vera展現出了1.6倍的性能提升。智能體完成工具調用的速度提高了60%,在編譯代碼、運行Git和代碼驗證等核心智能體任務上的處理速度最高提升了2倍。
客戶已經開始尋求部署這款產品。Perplexity Space發現,任務執行往往受限於創建沙盒的速度。通過引入Vera,他們觀察到沙盒啓動、執行快速計算並關閉的整體速度提升了1.5倍。
ClickHouse是一個被各大前沿實驗室用於安全與治理的實時分析型數據庫,他們在Vera上運行了其公開基準測試套件,結果位列榜首。
Vera目前已正式發布,早期採用者涵蓋Oracle Cloud Infrastructure(OCI)以及多家系統廠商。
生態系統與擴展:NVLink Fusion、智能存儲與MaxLPS功率管理
NVLink是實現AI與推理高速運行的關鍵要素。從無NVLink到8路互連,再到完整的NVLink 72,它顯著改善了帕累託性能曲線。NVIDIA是一家網絡技術公司,我們正在通過NVLink Fusion計劃向所有人開放NVLink。芯片設計者只需設計自己的XPU加速芯片,通過與NVIDIA合作,即可對接我們的NVLink Chiplet IP和NVHBM技術,從而直接融入完整的NVLink生態系統。

早期合作伙伴包括初創公司The Matrix,他們正在為其下一代Raptor XPU採用NVLink Fusion,以連接Vera和NVLink Switch機架,構建包含The Matrix芯片的完整NVLink 72架構。亞馬遜AWS及Annapurna Labs也在與我們合作,將定製IP集成到NVHBM的基底裸片中,在其定製芯片上釋放出30%至40%的計算資源,同時利用NVIDIA SerDes實現更高的帶寬和更低的延遲。
在數據中心層面,隨着我們專注於提升每兆瓦(MW)或每吉瓦(GW)的推理效率,一個核心問題是數據中心內部可以容納多少GPU。工作負載的功耗特徵是動態變化的。即便在DeepSeek-R1上,GPU功耗也會根據不同階段在600W(瓦)到1900W(瓦)之間波動,導致預留的電力資源未能充分利用。

為了解決這個問題,我們與生態系統合作開發了名為MaxLPS(Max Land Power Shell)的軟件。MaxLPS能夠在Vera、Rubin和NVSwitch層級動態管理並限制機架和固件層面的功耗。通過與數據中心管理軟件協同,運營商可以在完全相同的電力包絡內部署多達40%的機架(例如在吉瓦級數據中心內從4000個機架擴展到5600個機架),將詞元吞吐量提升至每秒12億個詞元。
Lambda驗證了這一軟件棧,Dave Ward指出,在相同的兆瓦(MW)容量下,可部署的GPU密度得到了顯著提升,B200提升了約25%,Vera Rubin上則可提升高達40%的計算資源。

展望未來:按年度節奏交付AI基礎設施路線圖
NVIDIA始終堅持嚴格按一年為周期推進路線圖。在Vera Rubin之後,我們接下來的演講將介紹Vera Rubin Ultra,隨後是Feynman架構以及Feynman Ultra。您可以確信NVIDIA將保持年度發布節奏,持續推進AI詞元工廠、推理以及數據中心規模的智能體基礎設施建設。
非常感謝大家的時間。
本文來源:Andy730