當市場在為科技巨頭數千億美元的AI資本支出(Capex)能否回本而焦慮時,產業最前沿的硬件工程師們卻在關注另一個更本質的命題:摩爾定律的經濟學已經破產,算力競賽的真正瓶頸,從來不在芯片本身,而是從「設計更快的芯片」變成了「控制從硅片到機架的物理堆棧」。

近日,在知名科技播客Frictionless Podcast by Logan Jastremski的專訪中,「芯片網紅」、資深芯片設計師、知名硬件分析專家「Mr. Bubble」就當前AI算力供應鏈的核心瓶頸、未來架構演進及AI投資的最終價值歸宿進行了深度剖析。這場對話從晶體管密度講到存儲層級,從機架設計講到大模型實驗室的戰略意圖,核心結論只有一個:
AI算力基礎設施真正的瓶頸,已經從"造更快的芯片"轉移到了封裝、互連延遲與存儲層級這三個更底層、更難解的物理問題上。

(圖為Frictionless Podcast主持人Logan Jastremski)
對於當前市場最熱門的幾個方向——英偉達路線圖的可執行性、HBM之後的存儲競爭、推理側的架構分歧,以及大模型實驗室"踩邊界"背後的真實動機——Mr. Bubble均給出了不少與市場主流敘事相悖的判斷。分析認為,與其押注於「互相廝殺」的前沿AI實驗室,不如牢牢握住底層的硬件與供應鏈。
摩爾定律的「經濟學破產」與先進封裝的崛起
長期以來,市場習慣於用摩爾定律(晶體管密度每兩年翻倍)來衡量芯片的進步,但 Mr. Bubble 強調,這一邏輯在經濟學層面已經斷裂。
「推動這些製程節點(Node)發展所需的資金已經膨脹到了驚人的地步,現在可能需要花費數百上千億美元。而你甚至無法讓晶體管數量翻倍,可能只能獲得15%到20%的密度提升。」 Mr. Bubble 表示,正是因為晶圓光刻微縮成本呈非線性指數級增長,「先進封裝成為了新的摩爾定律」。
他指出,行業不再死磕將更多晶體管塞進同一單位面積,而是通過封裝技術「擴大面積」,將多顆芯片連接起來使其像一顆芯片一樣運作。這一趨勢直接改變了產業鏈的價值分佈。
Mr. Bubble表示,正是因為看清了這一趨勢而早於市場看多英特爾——原因是英特爾的封裝技術EMIB遠超台積電當時的水平,而台積電此後也在向該方向轉型。但他直言,"真正應該做多的其實是PCB板廠商",因為當英偉達被迫將Rubin Ultra從四芯片單封裝降規成兩個獨立封裝通過PCB連接時,PCB製造商反而成了整個計算鏈路的新瓶頸。
Mr. Bubble拿英偉達的路線圖舉例,揭示了其受制於供應鏈的現實:「如果你看英偉達的路線圖,你會發現它並不受英偉達控制,而是受制於內存和封裝。」
他透露,英偉達最初計劃在 Rubin Ultra 架構中封裝 4 顆裸片(Die),但受制於物理和封裝極限,最終被迫降級妥協(傳聞改為每組封裝 2 顆裸片,再通過 PCB 連接兩組封裝)。
「現在,PCB 製造商成了英偉達讓這些相隔幾釐米的芯片像一顆芯片一樣運作的瓶頸所在。」
"每次我看英偉達的路線圖,我看到的都是'今天不可能','今天不可能'。"他強調,Feynman代計劃默認搭載四顆芯片,並配備更多HBM,"這些我們直覺上就知道根本不可能實現的東西,我很好奇他們打算怎麼解決。"
"人們只是攤開雙手說,這是英偉達,Jensen什麼都能做。我的回應是:他受制於SK海力士、三星和台積電能做什麼,也許將來還要看英特爾能做什麼。"
算力的真實單位:不再是芯片,而是「整個機架」
隨着大模型參數量級躍升,算力的重心已從「橫向擴展(Scale out)」轉向了「縱向擴展(Scale up)」。數據中心的算力形態正在重構。
「你不能再在真空中設計芯片了。」 Mr. Bubble 強調,「這些系統不再只是一兩顆芯片,甚至不是一台服務器,它們是一個完整的機架(Rack),甚至可能是多個機架。在未來,無論AI訓練還是推理,設計重點必須是整個機架。」
在縱向擴展領域,互連(Interconnect)的吞吐量和延遲決定了集群的生死。他對比了兩種截然不同的架構路線:
英偉達通過NVL72系統和龐大的NVSwitch交換機網絡來解決高帶寬互連問題,佔據了本可用於 GPU 的物理空間;
而谷歌的 TPU 團隊則交出了另一種驚豔的答卷,「他們的Scale-up規模達到了驚人的 9600 顆芯片……他們將部分路由邏輯直接構建在了芯片內部,讓芯片同時充當僞路由器。」
「基於你的擴展域,你可以改變你的芯片設計。」他舉例說,如果擁有極低延遲、高帶寬的擴展域且中間交換較少,就可以減少單芯片的內存配置,用「堆更多芯片」代替「堆更多內存」。這也解釋了為何谷歌的TPU芯片單卡HBM配置少於英偉達,卻依然能撐起超大規模訓練。
Mr. Bubble認為,這種系統級的設計能力,將成為未來AI硬件廠商的核心壁壘。
此外,推理側的"預填充-解碼分離(prefill-decode disaggregation)"正成為主流架構範式。Kimi的參考設計已將兩個階段部署在不同節點上,"這正變得無處不在,因為這兩個操作在根本上就是完全不同的事情。"
HBM之後,存儲戰場的真正競爭者是閃存
在 AI 推理端,隨着大模型上下文窗口(Context Window)從128K暴增至100萬甚至更高,內存容量正面臨前所未有的考驗。市場普遍認為需要無休止地堆砌昂貴的HBM(高帶寬內存),但Mr. Bubble提出了不同的務實解法。
「歸根結底,大模型的‘權重(Weights)’應該放在 HBM 裏。但如果我們不是一次性使用所有的上下文,為什麼要在 HBM 中存放海量的上下文數據呢?」
他指出,推理過程中,佔據大量內存空間的其實是用戶的歷史對話和上下文,而非單純的模型權重。為了解決這一吞吐量和成本矛盾,行業正在走向「閃存卸載(Flash Offload)」的道路。
英偉達已經推出了針對此類場景的網絡附加閃存驅動器機架設計,而更廉價、更高容量的 HBF(高帶寬閃存)甚至常規的閃存,結合優秀的閃存控制器設計,完全可以承載海量上下文的需求。
對於未來內存的終極形態,Mr. Bubble 給出了明確的預測:「如果有人想了解我認為內存的未來是什麼,那就是3D DRAM。」 他提到,將DRAM直接鍵合在邏輯芯片上方,通過物理距離的無限拉近(局部性優勢)來同時降低延遲、提高帶寬並降低功耗,這將是下一次硬件革命的焦點。
「買下建造鐵路的人」
對話最後,Mr. Bubble將矛頭指向了大模型實驗室近期流行的「pacing the frontier(踩邊界/放緩前沿)」敘事。
他的核心質疑是:「踩邊界是為了我們,不是為了他們自己。」大模型實驗室沒有暫停任何數據中心建設計劃,沒有削減任何資本支出,「那些數據中心都是多年期承諾,如果他們是真心的,就應該取消這些開支。但這不會發生。」
在AI安全論上,他坦言自己不是AI終結者敘事的信徒:「讓這些GPU持續運行的成本極高,所以它去統治互網絡、把一切搞垮,這聽起來就是在浪費資源。」他認為更現實的風險在於法律責任,而非科幻式的失控場景。
他真正感興趣的問題是:踩邊界究竟有多少是垂直整合與高價值問題攻堅,有多少只是「監管俘獲」。他舉例,解決千年數學難題(如Navier-Stokes)"花了1500萬美元賺了100萬,好吧,但那個問題可能並沒有那麼高的價值",而Terence Tao的數學研究奠定了LTE通信基礎,那纔是真正價值數十億美元的成果。
在投資邏輯上,他的立場一以貫之:「我是一個堅定的信徒,我只相信擁有硬件層、擁有鐵路,或者擁有那些構成這一切的核心部件。」
Mr. Bubble 給出了一針見血的投資判斷:「你是想投資Anthropic 和OpenAI這種註定會競爭到死、且其超額收益(Alpha)會隨着人員跳槽而消散的公司?還是想擁有那些有 10 年、20 年業績記錄,並在開發不可或缺的硬件方面擁有深厚護城河的公司?」
關於讓華爾街最頭疼的「資本支出回本」問題,Mr. Bubble用最直接的經濟賬給出了回應:「我認為我們將迎來一次快速的起飛。我的意思是,只要藉助AI研發出5到10種新藥,就能收回所有的資本支出。」
全文如下(由AI輔助翻譯):
第一章:簡介 & 為什麼硬件纔是AI真正的核心話題
Mr. Bubble:
我們會給這些服務器增加更多內存。說到底,問題在於用哪種內存?是HBM?是DRAM?還是閃存?我猜更多會是閃存。現在大家都在討論如何減少對HBM的需求量。因為說實話,到頭來,權重(weights)放在HBM裏可能還說得過去。但如果我們不是同時用到所有上下文,為什麼要在那裏放大量的上下文呢?
Mr. Bubble:
我非常相信一件事,就是要擁有硬件層,或者說擁有"鐵路",擁有構成它的那些東西,對吧?所以你是想投資Anthropic和OpenAI這種會互相競爭到死、最終隨着人員流動alpha也會擴散出去的公司呢?還是想擁有那些有着10年、20年研發歷史和護城河、專門開發核心硬件的公司?是的,他們是在為我們推進前沿,而不是為他們自己。但我,我傾向於非常看多。我是說,現在有利率和伊朗的這些情況,但我不知道,我有種感覺,我們用AI找到幾種藥物,把對的研究人員聚在一起,或者我們想出辦法讓5G不需要在一平方英里內建一千座基站。我是說,Starlink,隨便什麼,只要更高效的東西。我是說,我們會迎來快速起飛。我覺得光靠五到十種藥物,就能把所有的資本開支(capex)都合理化掉。
Logan Jastremski:
Mr. Bubble,非常感謝你來參加這個播客。這是我第一次嘗試做一個更聚焦於AI的播客,而不是我傳統的加密貨幣播客。所以我非常感謝你的到來,更重要的是,我非常欣賞你在Twitter和X上的各種觀點。
Logan Jastremski:
就像我們在按下錄音鍵之前說的,最重要的是,我認為你有一種非凡的天賦,能把技術概念解釋得非常簡單,而這是很難做到的。所以我非常期待這次對話,真正把你今天所看到的,乃至未來我們認為事情走向的一切都拆解清楚。謝謝你。
Mr. Bubble:
謝謝你邀請我。我要說,我所謂的"簡化事物的天賦",很多人其實不喜歡,但我首先是一個芯片設計師。所以我必須簡化和抽象,否則我會被各種細節搞得崩潰。另外,如果你是一個交易員,或者像我喜歡說的——賭徒,你真的只需要有一個高層次的概覽。我覺得有時候人們會陷入細節的泥潭,對吧?我同意。說到底,你得知道什麼是重要的,無論是從芯片角度還是從經濟角度。因為我見過有人為某種SerDes的誤碼率(bit error rate)或某種材料在功耗上好了幾瓦而吵架,我只想說,夥計們,算了吧,這個東西到底要做什麼,那纔是它對世界的經濟價值。這裏那裏差一點點根本無所謂。
Logan Jastremski:
我完全同意。我覺得我們在加密貨幣領域也有很多這種書呆子式的爭論。總體來說,就像Elon喜歡說的——簡化,然後刪除。架構和設計越簡單,通常獲得的採用率就越高。我相信在AI領域也有很多類似的情況。
Mr. Bubble:
我一直以來,不是要在播客一開始就跑題,我以前很喜歡哲學,其實我只讀古代的東西,大概到斯多葛派為止,但他們有一整套關於事物本質的觀點,就像柏拉圖的理念論。本質是什麼?核心是什麼?從那個核心出發,你可以推導出其他一切。這就是我在處理這些話題時的方式——主要的東西是什麼? 然後從那裏出發,我們再談細節,看它們是否重要。
Logan Jastremski:
我覺得這是一個很好的出發點。所以我想為所有觀衆和聽衆從零到一地講起,因為我覺得你在解釋這些概念方面確實做得非常出色。也許就從摩爾定律這樣基礎的東西開始,講講為什麼摩爾定律最終走到了盡頭,從那裏開始,然後我們再跳到一些更有趣的內容。
Mr. Bubble:
好的,在談摩爾定律之前,你得先大致了解它在說什麼。它說的大體上是晶體管密度。它基本上說,在大約一年半到兩年的時間裏,具體數字不太重要,你大概能獲得雙倍的晶體管密度。也就是說,在單位面積內,你能放下更多晶體管。那為什麼這很重要?因為晶體管是構建數字邏輯的方式。當我們製造芯片時,我們寫程序,程序被轉換成數字邏輯,數字邏輯再被轉換成一堆晶體管陣列。我們能塞進去的越多,晶體管做得越小,計算機能完成的工作就越多,對吧?就把它想象成你寫了一個程序,但它放不進內存裏,這當然是非常粗糙的簡化,但大概就是這個意思。就是我們有這個操作,這個流程,這個工具,但我們實際上放不下它。所以從一個角度來說,它非常重要——它基本上每兩年左右就讓性能翻倍,隨着晶體管數量越來越多,你能完成的工作也越來越多。但從經濟角度來說,它也非常重要,因為你可以為你的資本開支做合理化。你可以預測,"嘿,如果我花一億美元,我實際上會獲得投資回報,因為這些芯片會好這麼多。芯片好這麼多,我就可以收溢價,可以獲取市場份額。"所以從這個角度來說,它相當重要。我覺得從工程角度來說,當然,它很酷,很重要。但真正來說,我認為從商業角度,它極其重要。
不過我認為人們沒有意識到的是,有一件事像是摩爾定律的一個分支,我甚至不知道它有沒有名字,但我們可以叫它"泡泡定律",或者我只是喜歡借用別人的東西……就是:提升晶體管密度需要花多少錢? 在早期的每一個工藝節點,花費並不多,對吧?你不需要花幾十億美元來讓晶體管密度翻倍。而現在,你可能需要花幾百億甚至上千億美元,才能讓晶體管數量不翻倍,對吧?也許每個節點之間,你只能獲得15%到20%甚至更少的晶體管密度提升。所以我之所以從經濟角度來闡述,是因為這個模式正在崩潰。推進這些節點所需的資金已經膨脹到這樣一個程度——真正只有一兩家公司能負擔得起這樣的投入。如果你不投資,你就會落後,對吧?然後就是一個永恒的惡性循環——"哦,你的節點更差,我不想用。"當你沒有客戶,你實際上就沒有資金或時間去迭代來改進你的節點。所以我認為這是摩爾定律的關鍵所在。我認為人們忽視的一件事就是錢,就是讓這些晶體管翻倍的成本。從大約60年代到90年代,這個成本相對來說幾乎是免費的。到2000年代初,我們纔開始需要在這方面動點腦筋。
第二章:芯片從0到1
Logan Jastremski:
在某個時間點,我相信是在90年代中期,或者也許是2000年代後期,在哪個時間點我們開始從單核性能轉向多核,以及這種轉變,我認為,改變了事物的動態格局。
Mr. Bubble:
我認為是在2000年代中期。我不一定記得很清楚。也許是奔騰處理器,是第一款雙核處理器。我記不住名字了,但大概是在2000年代中期。這背後的部分原因就是:一個核心歸根結底是做什麼的?它處理指令。你能多快地處理指令?這取決於核心能跑多快,而這只是你時鐘頻率的函數,對吧?現在時鐘頻率已經觸頂了。這與摩爾定律無關,更多的是與瑟布爾定律有關,以及晶體管能切換多快的問題。
但時鐘頻率觸頂了,世界意識到,如果有些指令可以並行執行呢?並不是每條指令都依賴於另一條,圖形處理是最明顯的例子,我們稱之為"令人尷尬的可並行化"工作負載,對吧?矩陣運算是令人尷尬地可並行化的。 這就是多核系統開始興起的原因,因為對於某些類型的工作負載來說,這是一種可以提升性能的方式,但對於其他工作負載則不然。所以直到今天,如果你有一個單線程工作負載,或者就是某種逐條指令執行的瓶頸任務,說實話,如果你是一個非常優秀的程序員,你可能可以用一台老電腦就把它搞定,只要它還有相當高的時鐘頻率。你可以想想英特爾酷睿i9-14900KS,我認為這是有史以來面向公衆發布的時鐘頻率最高的處理器,它的頻率大約達到了6GHz的峯值。我們今天實際上還沒有任何單核處理器能跑得比這更快。 這對大多數人來說不那麼重要。但如果你有一個非常重要的單線程工作負載,比如網絡數據包處理,你是一個字節接一個字節地接收數據,那時鐘頻率就非常關鍵了。
Logan Jastremski:
最終,正如你提到的,這讓位於GPU。英偉達在這方面主導了一段時間。正如你指出的,矩陣乘法與AI的映射相當吻合。你能談談AI這邊是如何開始擴大規模的嗎?我想,是關於更大規模的預訓練運行的問題。
Mr. Bubble:
也許我們就從英偉達為什麼存在、他們為什麼擅長這件事說起。我是說,圖形處理說到底,這聽起來像個玩笑,但它就是形狀旋轉,是三角形和正方形,你做一個矩陣乘法來移動和旋轉它們。這與我們在AI中使用的數學大致相同,對吧? 但AI的好處是你不需要那麼高的精度,而圖形處理則需要。如果你考慮物理模擬或速度計算,使用64位浮點數,或者用更多位來表示小數部分,對那些工作負載來說是相當重要的。英偉達,當時並不是唯一的圖形芯片公司,但很明顯圖形處理將需要一個專用處理器,對吧?因為你看,我們已經在CPU領域做到了雙核,但那遠遠不夠運行一個60幀的完整遊戲,對吧?所以你必須把圖形處理卸載到一個新的加速器上。所以英偉達做得非常好,我認為。
有趣的問題是,英偉達為什麼能長期主導這個領域? 因為當時這個領域有很多其他公司。我對這個問題的回答是:英偉達從一開始就將其GPU設計得具有很強的靈活性和可編程性。有一個著名的故事,黃仁勳說英偉達差點破產,因為圖形API發生了變化,也就是渲染圖形的協議改變了,而英偉達不支持它。所以他們不得不立刻流片一塊全新的芯片來支持那個協議,否則他們就會被淘汰,因為微軟在背後支持那個協議,而微軟是那個巨無霸。但英偉達,甚至從最早的時候起,他們就在做一些事情,比如並行化IO,比如GPU的虛擬化IO。他們從一開始就非常強調可編程性,因為那時是蠻荒時代,而這最終得到了回報。 很多選擇走固化路線的公司都消亡了。但英偉達,直到今天,這仍然是一條相當深的護城河。他們有很強的可編程性,新模型出來了,英偉達似乎在一兩天之內就能跑起來,對吧?所以我認為這就是英偉達優勢的核心論點。
那麼,你說的"固化",是指定製加速器嗎?對,是定製加速器。但我的意思是,英偉達在往GPU里加的東西,甚至超出了規範的要求。就像如果規範改變了,如果我們想做這件事,我們能不能讓加速器來分擔這個工作?這就是為什麼他們很快就進入了科學計算領域,因為他們讓那個協議變得非常有用,對吧?沒有其他圖形芯片公司進入了科學計算領域,這是有原因的。 而那正是他們在進入AI之前的起點,對吧?所以,為英偉達點個讚,他們從一開始就努力讓這些大型、複雜、可並行化的處理器變得更具可編程性。我認為那是正確的選擇。事後來看,那確實是正確的選擇,對吧?對於現在的AI來說,這是否仍然是正確的選擇?我們不知道,事情會變化。但就目前而言,顯然這為他們帶來了巨大的成功。
Logan Jastremski:
那麼也許再深入探討一下,你已經開始——我想先退一步說——你因為對英特爾的判斷而出名,真正談到了封裝,認為封裝是新摩爾定律。你能解釋一下為什麼你認為封裝是新摩爾定律,以及為什麼封裝比光刻機更有意思?
Mr. Bubble:
是的,就像我一開始說的,你知道,如果我們能一遍又一遍地縮小晶體管,每兩年翻一番,那封裝可能沒那麼重要。但我們現在需要用一切手段來獲得更多晶體管,對吧?因為光刻縮放近年來已經基本到頂了,或者說沒有以同樣的速度在縮放。也許我們只能獲得10%、12%的提升——而我們花了什麼,200億、400億美元才達到這個水平。也許更聰明的做法就是把更多的芯片加在一起並連接起來,讓它們表現得像一顆芯片。所以這是在增加面積,對吧?與其試圖把晶體管縮小到一個單位面積裏,我們是在擴大面積,對吧?這對我來說非常清楚,因為如果你對光刻有任何了解,你就知道在先進製程節點上流片的成本極其高昂,比7納米節點要貴出好幾個數量級,5納米節點的流片成本大概是它的兩倍,然後2納米節點又是那個的兩倍,對吧?所以成本就這樣急劇膨脹。獲得性能提升的更好方式其實就是增加面積,這是一種新的縮放範式,對吧?現在大家都在談論縮放範式,但這是一種新的範式,對吧?所以,封裝就是人們現在試圖擴展晶體管數量的方式,在一顆完整的芯片內給你提供更多晶體管。
英特爾,當我——你知道,我當時真的非常關注英特爾,現在也是——主要是因為我理解他們試圖推進的光刻節點。我的意思是,他們試圖通過更早採用高NA EUV等技術以及推動封裝技術來超越台積電。這需要大量的投資,對吧?正如我所說,每一個節點的投資都呈非線性指數增長,對吧?所以這就變成了一種壟斷、雙寡頭的局面。所以他們唯一能追上台積電的方式就是燒錢。但我對這個策略確實有很高的信心,如果你真的有把握能出貨的話,這其實是個不錯的策略。另一件我可能比別人更早發現的事情就是,他們的封裝技術——叫做EMIB——比台積電當時提供的技術領先太多了。而現在台積電正在採用EMIB已經有的東西,對吧?他們正試圖將自己的封裝技術向那個方向轉變。這在當時非常重要,因為如果你看英偉達的路線圖,它依賴於什麼?它實際上並不依賴於任何英偉達自己掌控的東西。它依賴於內存,它依賴於封裝。
第三章:封裝作為新摩爾定律
Mr. Bubble:
這兩件事英偉達實際上都不自己做,對吧?我的意思是,他們與合作伙伴合作,試圖去影響它。但歸根結底,這些都是給他們提供這些東西的供應商和合作伙伴,對吧?他們既不自己製造,也不自己設計,對吧?所以如果你看英偉達的路線圖,它是從H100的一顆大芯片,到B200的兩顆芯片,然後Rubin默認是兩顆芯片,Rubin Ultra本來應該是四顆芯片。瞧,發生了什麼。Rubin Ultra無法把四顆芯片放在一個封裝裏。他們不得不多次降低規格。現在的傳言是,一個封裝裏放兩顆芯片,然後兩個封裝,對吧?所以它們通過某種PCB連接方式連接在一起。所以對於任何了解封裝發展方向的人來說,這是顯而易見的。我通過做多英特爾來佈局這個,效果很好。你知道,我很高興英特爾現在表現得更好了,但真正的機會其實可能是做多PCB製造商,因為現在他們已經成為英偉達的瓶頸——英偉達需要讓這兩顆相隔也許幾英寸或幾釐米的芯片表現得像一顆芯片。這並不一定容易,也不是迄今為止一直以來的做法。
Logan Jastremski:
總體來說,我認為主要的瓶頸就是提高芯片之間的數據吞吐量,確保它們能夠相互通信,幾乎像一顆芯片一樣運作。
Mr. Bubble:
是的,吞吐量,還有信號完整性。因為隨着傳輸距離變長,信號會失去它的能量或完整性。我的意思是,我們有輸電線路,對吧?我們以前在電話線上有中繼器來放大信號並重復傳輸。歸根結底是同樣的物理原理,只不過現在你是在PCB上傳輸幾釐米。所以信號現在需要被轉換成某種其他格式、某種其他物理介質,然後需要來回傳輸,這在高速情況下並不容易做到,而且還要保證良好的信號質量。所以,Rubin Ultra還沒有出貨。我的意思是,我認為Rubin現在正在爬坡。我們看看Rubin Ultra明年能不能出貨,但他們遇到了相當多的麻煩。還有一件事,你看,我們現在關注Rubin Ultra是因為它在新聞裏,但Feynman本來應該默認就是四顆芯片,對吧?所以這成了一個巨大的問題。Feynman本來應該有更多的HBM,對吧?所有這些我們直覺上就知道今天不可能實現的東西。每次我看英偉達的路線圖,我就覺得這今天不可能,這今天不可能,對吧?所以我很好奇他們打算如何解決這個問題。人們只想舉手投降說,哎,這是英偉達,老兄,黃仁勳什麼都能做到。而我說,好吧,你知道,我相信他是個出色的運營者,他能做很多事情,但他受制於SK海力士、三星和台積電能做什麼,以及也許未來英特爾能做什麼,對吧?
Logan Jastremski:
是的,我認為這在晶體管方面——無論是時鐘速度的擴展還是多核擴展——都是非常清晰的從0到1的過程。甚至包括芯片die的擴展。不過我很好奇,現在隨着這些發展,我們顯然已經擴展到了更大規模的集群,從幾百個,到現在幾千個,再到幾十萬個互聯的GPU。而關鍵在於規模擴展。這些用於大規模預訓練的數據中心。所以有意思的是,你不僅需要在芯片上有相當高的吞吐量,還需要在機架內部以及機架之間都有高吞吐量。那麼,隨着我們在訓練方面擴展到更大的集群,你能談談這些事情是如何擴展的嗎?
Mr. Bubble:
是的,那麼。 我覺得首先要說明的是,為什麼要擴展規模,對吧?一方面,單純地把封裝推到極限,比如NVL72本來就要有72個封裝,把這些全放進一個封裝裏,實際上是不可行的。 但同時,這些AI算法是非常可並行化的,對吧?所以它的好處在於,你可以讓一塊芯片處理問題的一部分,另一塊芯片處理問題的另一部分,這樣你就能獲得更高的吞吐量,對吧?這就是它的優勢所在。如果我們處理的是像……我不知道,比如更偏向單線程的工作負載,那根本就不需要擴展規模,對吧?那樣做毫無意義,但AI不同。而且你知道,這種矩陣運算越來越具有可並行性。所以規模擴展領域正在成為真正的瓶頸。我認為延遲和吞吐量都極其重要。但延遲方面更為關鍵,這是因為人們並行化的方式——無論是流水線並行還是張量並行——你在芯片之間實際傳輸的數據量並不是特別大。英偉達今天的系統是為巨大的帶寬和NVLink設計的,對吧?我認為大約是每秒900千兆比特,對吧?這對訓練工作負載更為相關,因為在訓練時,你需要在GPU之間來回傳輸大量的激活值和大量的部分乘積結果。所以根據你構建的集群類型,無論是推理集群還是訓練集群,互聯網絡需要針對你要做的事情來設計。如果你試圖把一個訓練風格的互聯網絡用於推理,我的意思是,它能用,但你必須想辦法繞過那個巨大的延遲瓶頸。是的,對於這一點。但是,我要說的是,很多其他公司在規模擴展領域的做法非常不同。我最近參加了Hot Chips大會,GPU團隊——我認為他們真的做得很好,可能是目前世界上最優秀的硬件團隊之一——他們的規模擴展域達到了9600塊芯片。這是一個驚人的芯片數量。 對吧。由此帶來的一個結果是,他們芯片上的HBM比英偉達的要少。而且他們目前也沒有做這種——至少據我所知——他們目前沒有做這種多芯片、多大尺寸die封裝在一起的方案,對吧?所以。這非常。
Logan Jastremski:
只是因為他們在規模擴展上做得好得多
Mr. Bubble:
是的,他們擅長擴展互聯網絡。所以如果你非常擅長做這件事,並在芯片之間進行流量調度,因為在9600塊芯片的規模下,你可以路由到的地址數量是巨大的。這是數量驚人的芯片。所以你如何在芯片之間切換互聯,實際上將決定延遲,對吧?NVL72系統有一個大的——不止一個,我認為裏面有4個NVL交換機,對吧?這些交換機佔用了本可以放GPU的機架空間。但TPU團隊沒有這樣做。他們實際上把一部分路由邏輯直接內置在芯片裏了。所以這些芯片本身也充當了僞路由器的角色。就是這樣的技巧。 不過我要說,規模擴展領域對芯片設計也變得越來越重要,因為正如你所說,這些系統不再只是芯片了。它們不只是一兩塊芯片,不是四塊芯片,不是一台服務器,而是一整個機架,甚至可能是多個機架。我認為這在計算機體系結構領域是比較新的概念,過去我們被教導要關注緩存命中率和內存訪問時間。但當你在多塊芯片之間進行統籌調度時,你必須分析整個系統,對吧?而且根據你的規模擴展域,你可以改變你的芯片設計。對吧。所以如果你擁有一個低延遲、高帶寬的規模擴展域,並且中間沒有太多的交換,你或許可以減少芯片上的內存,因為你可以用更多的芯片來解決問題,而不是用更多的內存來解決問題。芯片設計是一種平衡的藝術。 我認為很多工程都是如此。但芯片設計真的是一種平衡的藝術。一切都像是,我在哪裏可以做出取捨,以便在其他地方獲得收益?一切都關乎平衡。
Logan Jastremski:
這真的非常有趣,因為理論上,正如你所提到的,如果在單台服務器內,你有比如說50太字節的吞吐量,並且你有一個50太字節的線路或互聯,你就可以做一些非常有趣的事情,比如構建定製的機架,裏面可能全是內存,或者全是GPU,但你受到了瓶頸限制,因為你沒有那個50太字節的互聯,而這纔是真正的核心問題,再加上你提到的延遲問題。
Mr. Bubble:
是的,你還觸及到了另一件事,那就是解耦(disaggregation),對吧?這些模型,或者說用於推理和訓練的這些技術,正在意識到,實際上,流水線的某些部分或某些操作,應該在不同的硅片上或不同的內核上運行,對吧?使用不同的利用率或不同的程序來運行。這樣實際上效率更高。Kimi的參考設計就為推理的預填充(prefill)步驟和解碼(decode)步驟設定了獨立的節點。而這正在變得無處不在,這已經成為提供推理服務的標準方式,因為它效果好太多了,因為歸根結底,這兩者是完全不同的操作。所以規模擴展域如今變得更加重要。我認為,是的,我認為AI訓練的未來,甚至推理的未來,就是設計整個系統,整個機架。你不能再只是設計一塊芯片了。你不能在真空中設計一塊芯片。對於本地機器或小規模應用來說這沒問題。但對於我們現在運行的這些規模,我們必須在系統層面進行優化。我認為未來會有更多的解耦。我們說的是預填充和解碼,但我認為還可以有更多。
第四章:機架、托盤與計算單元
Logan Jastremski:
我確實很想聊聊預填充和解碼,但也許我們先聚焦在訓練和預訓練這一塊。 隨着封裝規模不斷擴大,數據中心的機架也在不斷擴展,從1吉瓦到多吉瓦,你覺得在訓練這邊,還有沒有什麼你認為值得關注的瓶頸?還是說主要還是集中在封裝和互聯這塊?
Mr. Bubble:
是的,我覺得在訓練這塊,我要說英偉達的芯片在訓練方面真的很強,對吧?如果你要跑大量高算力的工作負載,它們非常適合,因為它們能提供大量的浮點運算能力,而且有很大的帶寬。 當然,這些問題並非沒有其他解決辦法,但在訓練這一側,我覺得能做的硬件優化越來越少了。比如說把一些東西卸載到閃存,或者把某些計算保存起來留到後面用,這樣就不用重新計算了。但這些都屬於非常偏算法層面的事情,對吧?所以我覺得在訓練這邊,想要繼續堆浮點算力越來越難了。如果你真的想要一個瘋狂堆算力的芯片,你就需要大量的乘加運算單元,說到底就是需要一塊巨大的芯片,巨大的面積,有點像Cerebrum那種風格,可以做大量的計算。
Logan Jastremski:
這不就是馬斯克當時想用他們內部項目Dojo做的事嗎?
Mr. Bubble:
我不太了解,不過——
Logan Jastremski:
他們已經把它關掉了,所以我覺得應該沒成功。
Mr. Bubble:
這我一點都不意外。 我是說,在訓練這塊,關鍵在於你有海量的數據,而在推理這邊,你有的是用戶的查詢、用戶的上下文,再加上模型權重,基本上就這些。但在訓練中,你有各種各樣層次的數據,比如激活值、各種狀態、權重本身,你還要在訓練過程中不斷做檢查點保存,因為如果任務中斷了,你想從上次停的地方繼續跑,對吧?還有你用來訓練的數據本身,這都是海量的數據問題。所以我覺得把一些東西卸載到更便宜的存儲介質上,知道什麼時候去訪問它們,同時為計算節省時間,這在訓練中也許是可以做的,但能做的空間我覺得要少得多。訓練這邊,我們只能寄希望於做算法和機器學習的人能在訓練層面想出什麼辦法,這可能已經超出我在硬件層面能管的範圍了。
Logan Jastremski:
說得有道理。那我們可以轉到推理這塊了。 我做過一個挺有意思的實驗,就是——AI領域一直有個廣泛的說法,認為所有東西最終都會在本地運行,你會在你的MacBook Pro或者iPhone上跑模型。我就去看了一下Open Router,拉了前10名的模型,看了看需要多少算力。就是說,對於一塊H100或者同等級別的高帶寬內存,你需要多少張網絡芯片才能跑起這個模型?即使是前10名裏最差的那個,我覺得大概也要2到4張。而每張H100現在好像還要兩三萬美元。
Mr. Bubble:
對,差不多,大概兩萬四到兩萬八。
Logan Jastremski:
然後我再看了看那些更流行的模型,比如GILM 5.2,那是個萬億參數量級的模型。我就想,好,光是把權重裝進去,你就需要40到50張H100,更重要的是還需要相應的內存容量。所以我想問你一個大問題:現在這些模型越來越大,而且看起來還會繼續變大,這最終會對內存產生什麼影響?是會繼續留在SRAM或者高帶寬內存上,還是會轉移到閃存?因為看起來不只是吞吐量,內存容量的需求也在不斷擴大。
Mr. Bubble:
是的,我的意思是,這個問題涉及很多內容。如果我們來看,你的數字大致是對的,我認為即使是 llama 70b,在實際運行中你也需要大概4塊GPU才能真正跑起來。對吧。我認為你關於內存的問題非常有趣,因為,你在內存裏存的是什麼,這真的很重要,對吧?如果你存的是權重的話,我的意思是。是的,權重在擴展,但有一種觀點認為,這方面在某種程度上已經趨於平穩,或者說人們並沒有像以前那樣在權重擴展上使勁推進。我認為,現在已經是公開的知識,或者說是普遍的傳言,新的 GPT 六使用了一種技術,讓同樣的權重反覆循環使用。你可以叫它 transformers,對吧? 所以,我的意思是,這很有意思,因為,是的,如果單純靠堆更多更多的權重就能奏效,那我們至少在權重這塊就需要越來越多的內存,對吧?
我認為很多研究已經表明,這些權重裏,很多其實是空的,你知道,它們非常稀疏。並不是每一個權重的每一個比特里都包含大量信息,這也是為什麼量化和剪枝這類技術效果非常好。還有像,你知道的,投機解碼也非常有效,因為並不是每個權重對你的問題貢獻都是一樣的。
但當我們看其他方面,比如什麼東西佔用了大量空間?在推理服務的時候,其實是上下文(context)。是你的對話,或者你之前的對話。 就因為這些模型生成下一個 token 的方式,是自迴歸地遍歷你整個上下文,對吧?字面意思就是一次只生成一個 token。我的意思是,人們大量使用投機解碼,一次生成更多,但我們做的大體上就是這個,對吧?而當你去看它,我的意思是,上下文隨着權重數量、注意力頭數量,以及用戶數量一起擴展,對吧?所以上下文實際上,有一個觀點可以提出,就是上下文在推理中實際上比權重更重要。 根據模型的不同,它可能佔據更多,甚至是大部分的空間,對吧?所以
Logan Jastremski:
上下文這個話題超級有意思,因為我的意思是,是的,我總喜歡想,好吧,如果在未來我們能揮一揮魔法棒,我們想要什麼?這有點像電影《她》(Her)裏面的感覺。或者就是,它了解關於你的一切。和你的電腦對話,希望是以好的方式,但就像上下文窗口從128到256到512,現在大概在一百萬左右了。我很好奇,你認為它們會,如果你可以擁有越來越大的上下文窗口,而你也許不再受限於,我的意思是,每樣東西,我猜一切都受硬件限制,但你認為上下文窗口會走向何方?你認為它們會從一百萬增長到一千萬,然後從一千萬增長到一億嗎?
Mr. Bubble:
所以我認為單純靠擴展非常困難,就因為硬件的限制。即使是我們現在所說的一兩百萬,也不是真正意義上的一兩百萬。 因為你需要在一兩百萬的長度上訓練,而實際上要找到一兩百萬長度的數據是相當困難的,對吧?
但不管怎樣,我確實認為更多的上下文是會到來的。你知道,這些模型會擁有更多關於你的信息。問題是,它們如何獲得這些信息?也許不是像,也許是,你知道,一段來自多年前的緩存對話,被存儲起來,然後它們去搜索它、提取它,並把它保存在它們的一兩百萬上下文裏。也許是在你的上下文上進行後訓練,對吧?我認為如果某件事情足夠重要,就像即使是作為人類,如果某件事對一個人來說足夠重要,你可能就會把它燒進你的神經元裏,對吧? 你不需要去搜索你的文件然後想起那個,你知道,也許如果是你說的某件小事,但你知道你住在邁阿密或佛羅里達,這可能就應該直接燒進權重裏,對吧?所以我認為我們通過後訓練,把重要的東西燒進權重裏,從而獲得更有效的上下文,對吧。但同時我們也可能會存儲大量關於人的數據。我的意思是,想想 meta 和 Google 這些公司,他們存儲了大量關於我們的信息,對吧?這些模型最終也會這樣做。而上下文的一大好處是,我們可能沒有深入解釋過,但你通過計算來生成上下文,這叫做預填充(prefill)。但在解碼(decode)的時候,你只需要去取它,對吧?你只需要獲取它然後在那裏得到下一個 token,所以一大好處是,如果你已經有了上下文,你可以避免做預填充,直接開始解碼。
第五章:內存層級結構:HBM、DRAM 以及下一層級
Mr. Bubble:
所以 GPU 或硬件的利用率要低得多。它消耗的功耗也少得多。你可以在很多模型上看到這一點。它們對上下文命中的收費方式是不同的。所以我認為 Kimi 收費大概是 5 美元或 3 美元,如果你沒有設定上下文的話。但如果你設定了上下文,它們收費就少得多。所以這是其中一部分原因。我認為上下文這件事,可能甚至不會存在於實際的硬件層面。它將體現在整個系統設計中,對吧?所以 Nvidia 對此有他們的答案,也就是說,你知道,網絡附加閃存驅動器,對吧?他們有一種純閃存機架,那將是他們的方式,你知道,用來獲取 Logan 的上下文或獲取 bubble 的上下文,對吧?Logan 提到了一些關於汽車的事情。好吧,我們去搜索那次關於汽車的對話,對吧?然後快速獲取它。諸如此類的事情。
我的意思是,對於智能體相關的工作,它現在變得非常重要,因為智能體說到底就是上下文。它們只是一個框架,本質上就是一堆提示詞注入。是的,當我發現這一點的時候我也感到很驚訝。但是,我的意思是,如果每次你都必須重新執行那個提示詞,那隻會消耗 GPU,而且你的首個 token 的生成時間會永遠那麼長,對吧?所以智能體的最大好處是,你知道,像 LLM cash 或 LLM cake 這樣的東西,它們是圍繞着緩存你的智能體框架並一直重複使用它來構建的,對吧?就是這麼簡單的一件事。
Logan Jastremski:
我在智能體這一側得出了同樣的結論,就是你只是想要越來越多的上下文。因為我當時在思考如何實現最長的長程智能體。而且行業似乎——我很好奇你的看法——對於僅僅通過像 Grok 這樣的方式最大化解碼側的吞吐量非常感興趣。由於 SRAM 具有非常高的吞吐量但容量相對有限,將所有內容存儲在 SRAM 中並最大化吞吐量是比較困難的。 但當你降到像高帶寬內存這樣的層級時,我認為現在大約是 8 TB,你跳到了 100 到 300 GB 的容量,但如果你想運行得更快,這通常還是不夠的。所以我認為你一直是高帶寬閃存的支持者。我很好奇你在這方面的最新想法,但大概就是能夠保持相對較高的吞吐量,同時擁有更多的上下文。所以,是的,正如你提到的 Nvidia 和 CMX,我認為對我來說有趣的事情,也許也是我想問你的問題是,你認為這個行業是否對吞吐量過度優化了? 如果智能體正在興起,而且它們對於存儲關於你生活的上下文以及你想讓它們做什麼更加重要的話。
Mr. Bubble:
所以這個行業確實一直專注於吞吐量,這是因為更高的 token 吞吐量可以讓他們賺更多的錢。你說得很到點子上。如果我必須不斷地獲取上下文,而上下文在這些 GPU 的內存佔用中佔了很大一部分。那麼,是的,我的意思是,你可能可以通過更智能地處理上下文來獲得更好的吞吐量。我認為 HBF 對我來說非常有趣。說實話,我一直開玩笑說,你知道,如果你想改變世界,要麼找到治癒癌症的方法,要麼發明一種新型內存。 沒有多少人在嘗試做新型內存。很多人在癌症方面努力着,我希望,你知道,我們能先攻克那個。但發明一種新型內存總是值得稱讚的,對吧?所以內心深處的我一直渴望一種新型內存。當你看它的時候,是的,閃存具有更好的位密度,對吧?所以我們可以在那裏存儲更多的東西。如果我們能從中獲得哪怕是有競爭力的帶寬,那就太棒了。你知道,我們應該在這些加速器上以更低的每比特成本擁有更高的密度,也就是更低的總容量或 GB 成本,對吧?
我認為我在高帶寬閃存方面看到的問題,很多人都說過,哦,這是一個可靠性問題。我認為可靠性問題實際上是可以解決的。你必須是一個非常出色的閃存控制器設計師才能做到這一點。而且你必須針對手頭的問題來設計你的閃存控制器。我們今天設計閃存控制器的方式是,我們把它們設計成用來存儲數據庫、存儲文件或存儲你的電腦遊戲,對吧?上下文是非常不同的。 你知道,上下文是以某種特定方式被獲取的。上下文並不總是需要永久保存的,對吧?所以我是否總是需要以完美的比特分辨率存儲你兩年前關於假期的對話?也許不需要,對吧?所以也許我們可以接受丟失其中的一小部分。而且關於閃存的問題一直是,你知道,寫入,向閃存寫入一直是損害其可靠性的因素。所以它是持久存儲,但在一定程度上,取決於你向它寫入多少次。
我認為 HBF 的問題一直是,它的市場在哪裏?如果你有 HBM,為什麼要用 HBF?我們真的能從加速器上更多 GB 的存儲中獲得更多好處嗎?我不這麼認為。因為如果是這樣的話,為什麼 Google 要用內存更少的 9600 規模的擴展域呢?我認為對於這些解碼來說,關鍵一直就是帶寬,對吧?所以密度實際上並不能給你帶來太多好處。它只是讓你能夠存儲更多的上下文。但說實話,如果你在移動數據方面非常聰明,你可能只需要把那些上下文存儲在普通閃存中,在需要的時候去獲取就可以了。
所以我認為 HBF 一直是這樣一個東西,它非常有趣。有理由認為它是有用的。它對卸載上下文有用嗎?我認為你完全可以使用普通閃存來做到這一點。我認為你不會獲得太多的性能提升,HBF 的延遲和專門為 AI 設計的高端普通閃存的延遲都是 5 微秒,對吧?所以我們得不到太多好處。它的帶寬低於 HBM,每比特成本也更低,但總體上可以說和 HBM 差不多,你知道,對吧?所以 HBF 的客戶是誰?在我看來,是那些無法獲得 HBM 的人,對吧?這就是我最終看到的情況。
也許有理由認為你可以將它用於本地推理,但在數據中心產品中,現在很難說。我就透露一個內部消息,因為,你知道,你邀請我上了這個播客。我聽說,你知道,目前來自大約兩三個人的消息,HBF 的主要客戶是中國人,他們對此非常感興趣。 考慮到我剛纔說的一切,這非常有道理,因為如果你沒有辦法獲得這種高端 HBM,而且你也無法制造它,你實際上就沒有辦法制造那麼多加速器,對吧?所以你可能願意接受一個次等產品,如果它,你知道,如果它能達到 H100 或 B200 的水平的話。對。它不會處於領先邊緣。而如果你能以稍微便宜一點的價格獲得它,那就有一個使用場景。
我認為 HBF 現在還處於非常早期的階段。我們必須弄清楚如何對其進行標準化,但同時使用場景目前也非常不確定。在我看來,我確實相信,整個機架需要從內存控制器到閃存內存控制器,針對項目進行協同設計。所有東西都需要為 AI 應用而設計,對吧?
Logan Jastremski:
所以你更看好 Nvidia 的方案,就是用 CMX 把越來越多的東西卸載到閃存上,擁有幾個TB、幾個TB那樣的閃存空間?
Mr. Bubble:
我不,我不會說我特別看好那個方案。那也許比 HBM 要好一些。對,我同意。Nvidia 也是這麼認為的,行業裏很多人也這麼認為。我只是覺得我們可以做得比那更好,對吧?我認為我們需要做的是跨所有層面非常智能化的調度編排。這甚至包括從算法層面入手,比如用於壓縮和存儲上下文的算法,對吧。
Logan Jastremski:
那麼你覺得隨着時間推移,我們能不能從現在姑且叫它——我知道不是一百萬,但就叫它今天的一百萬——發展到五百萬、一千萬、一億?這主要會是由算法上的進步驅動,還是更多由硬件層面的提升驅動?
Mr. Bubble:
有一種觀點認為,推理(inference)會開始越來越像訓練(training)。我們正在用測試時計算(test time compute)來實時地在你的上下文上進行訓練。那麼在這種情況下,我們還需要那麼多閃存嗎?可以說,不需要了。我們不需要存儲每一張圖片和每一條信息,但這真的還很難說,取決於什麼樣的架構纔是最合適的,我是說。我們現在,你知道,大家最近都想緊跟前沿,但我們本身就在前沿,所以我們也不一定知道最好的技術是什麼。我的看法是,你會把東西卸載到閃存上,但不會是所有東西。不會是你寫的每一份文檔。對於大型企業來說,有這樣一種邏輯:嘿,如果我有這個大型數據庫,我為什麼不直接把它餵給我的 LLM,然後,瞧,我就有了上下文。我直接和我的數據庫對話,對吧?這種情況是有可能存在的,對吧。
Logan Jastremski:
那你覺得這個行業,從宏觀角度來說,是否會繼續優先追求吞吐量(throughput)——因為這是他們在推理側獲取收入的主要方式——而不是去做一些更專門化的方案,讓你擁有更大的上下文窗口,但吞吐量可能稍微低一些?
Mr. Bubble:
這是個好問題。我覺得這個行業目前肯定是在專注於吞吐量,但這些公司怎麼賺錢呢?他們靠服務更多的用戶來賺錢。如果你能用更少的硬件服務更多的用戶,那賺的錢會遠遠多於只是提供長上下文窗口。 對,我是說,想象一下,你就有一個 NVL72 機架,然後通過一些閃存卸載或者一些非常智能的算法改進,你能服務的用戶數量翻倍甚至翻三倍,對吧?這對 AI 實驗室來說更有價值。但那種超快的模型,或者專門解碼速度很快的模型,我覺得也會存在相當長一段時間。我也很驚訝,很多人喜歡那種東西,就連 AI 研究人員也非常喜歡那種東西。但我認為,未來對於 AI 實驗室來說,歸根結底的價值在於,如果他們問:我們是把所有東西都放到 Cerebras 上然後收更高的價格,還是說,我們能不能就用我們現有的硬件,把服務的用戶數量擴大三倍?我認為他們會選擇在同樣的硬件上服務三倍的用戶。 如果你能用同樣數量的硬件服務更多的人,成本就會下降,對吧?每個人的每個 token 的成本都會降低。
第六章:縱向擴展 vs 橫向擴展
Mr. Bubble:
所以我不知道這是否回答了你的問題,但我認為新的能力,我覺得將會是一種有趣的賺錢方式,對吧?我不知道我和你還有普通人能不能得到這個機會,但也許企業會得到,對吧?就像,如果你能直接在我的數據庫上做後訓練,然後把它內置到我的LLM裏,那就太好了。
我的意思是,這基本上就是 Thinking Machines 正在做的事情,對吧?他們在做更長的上下文。嗯,他們在人們的數據上做後訓練,以便在這些數據上獲得更好的結果。從某種意義上說,那就是上下文,對吧?
Logan Jastremski:
我看過一個 Thorio 的播客,不記得是哪一期了,但他談到了——隨着時間的推移,他認為上下文窗口會持續擴展。正如你提到的,你會對上下文本身做某種強化學習或後訓練,然後再把這些內容重新烘焙回模型中,這讓我對上下文更加看好。所以,我想我從你這裏聽到的,也許對所有正在收聽的人來說,最好的表達方式是什麼呢?是在公開市場這邊嗎?是做多 Cerebras 嗎?
對,我猜是 Grok,但他們被收購了,而在公開市場上,好像是做多像 Etched 這樣的公司?
Mr. Bubble:
我認為做多像 Etched 這樣的公司,如果你能做到的話,會是一個非常好的投資,但他們還沒有上市。我認為在公開市場這邊,很難找到一個清晰的投資標的。AI的魅力在於,很多這類公司都是新公司,還沒有上市。所以在這個領域有一些有趣的公司,比如 Weka,他們做的是用於閃存卸載的軟件,或者說就是幫人們在各種集群中存儲數據,對吧?所以我認為,是的,你可以嘗試在商品側,或者說所謂的商品側,或者就叫它硬件側來佈局。我認為未來在實際的軟件層面,或者閃存控制器方面,會有一些有趣的機會,對吧?所以我認為,目前還沒有哪家公開公司的算力能超過 Nvidia,也許當有人帶着有趣的東西上市時,這種情況會改變,對吧?但是,這是你可以佈局的一種方式。你知道,如果你認為上下文會被燒錄進權重裏,那我們就需要做大量的後訓練或測試時計算,對吧?
所以,任何能以低成本提供算力的人,都將變得極其有價值。
Logan Jastremski:
有意思。是的,我覺得對我來說,未來幾年內 Agent 會越來越多地承擔日常工作、電腦操作,這似乎是顯而易見的。對於普通人來說,大多數人無法進入私募市場,而那些實驗室公司的估值已經達到了萬億以上,普通人怎麼能表達這種觀點呢?
Mr. Bubble:
是的,這很有意思。也許將 Agent 進入市場這件事變現的最好方式,是那些使用 Agent 的公司,也就是那些被 Agent 所替代工作的公司。我真的認為這可能行得通,就像保險公司一樣,這是一種非常反直覺的看法。我們現在還沒有哪家保險公司在大力宣傳 AI Agent,但我認為那可能是最好的變現方式,對吧?我認為 Agent 將會變得就像互聯網,或者就像雲計算一樣。如果你沒有一個 Agent 化的使用場景,你根本就不在這個遊戲裏,你知道嗎,每個人都會擁有它,對吧?
所以也許這個論點是,那些正在非常積極地採用 AI 的人,也就是大型科技公司,他們同時也是提供 AI 服務的人。
Logan Jastremski:
是的,這說得通。那麼從長遠來看,你提到了 Weka,這也超級有意思。我深入研究過他們,他們在並行化閃存以提高吞吐量方面做了很多很酷的事情,我覺得這很棒。但是,在內存方面,你主要對提高吞吐量感興趣嗎?你是否也對 CXL 或其他技術感興趣?
Mr. Bubble:
是的。在解碼端,當然,提高吞吐量意味着提高內存帶寬,對吧?所以任何能提高內存帶寬的方式都極其有趣。現在剩下的方法已經很少了,人們甚至在爭論只保留最低限度的內存帶寬。但是,我一直喜歡 CXL 的原因是,它允許內存被添加進來,或者掛載在外面,看起來就像你普通電腦上的內存一樣,對吧? 至少從編程模型來看,它對程序員是透明隱藏的。這有什麼用呢?嗯,正如我們一直在暗示的,你可以把東西卸載到內存裏,比如 VLLM 就把上下文卸載到 RAM 裏,對吧?如果我們能構建一種直連的方式來做到這一點,就能增加集群的價值,對吧?所以我真正想說的,或多或少是:同樣的硬件,加上新類型的內存,再寫出更好的代碼,你就能從你的硬件中獲得更多價值。 至少是同樣的加速器。
Logan Jastremski:
一個有趣的問題,也許是個有點大膽的想法,我很好奇你對此的看法。大多數人談論光子學都是從規模擴展的角度來說的。你是如何從計算層面來思考光子學的?因為當你能夠在給定通道內並行化矩陣乘法時,這會變得非常有趣。
Mr. Bubble:
是的,我覺得我應該寫一篇文章,在白板上給大家推導一下這個數學。但如果你看看我們正在運行的AI模型,它們有多大,甚至隱藏維度有多大,矩陣有多大。光子矩陣乘法的運作方式基本上是在模擬域中進行的,對吧?你是在讓光束跨越距離傳播。你可能需要一個足球場那麼大的空間,才能得到等效的矩陣尺寸,在所謂的"光子學"中進行乘法運算,到那時就變成自由空間光學了。所以,光子計算,我看好它嗎?並不太看好。在數據中心這一側,它也許可以作為某種物聯網或嵌入式設備使用。比如,如果Waymo的激光雷達系統開始對傳入的傳感器信息進行一些計算,我不會感到驚訝,但這會非常困難。我對光子計算並不太看好。我不認為這只是有點異想天開,我不想說得更負面,但確實如此。 我覺得有些人在那裏沽空頭支票,對吧?讓我們看看需要多長時間才能實現吧。
Logan Jastremski:
我覺得我們已經很好地涵蓋了數據中心從0到1的廣泛內容,包括預填充、解碼、訓練等方面。你個人對什麼感到興奮?你在大方向上一直判斷得很準確,但你說有些問題已經解決了。現在是否只是把這些擴展到更多客戶,讓更多人能夠廣泛使用AI?還是說仍然存在一些讓你感到興奮的未解決的工程問題?
Mr. Bubble:
我覺得作為一名工程師,最讓我感興趣的一直是內存。這也是為什麼我一直喜歡 HBM,儘管到目前為止我對它有些挑剔。我是說,它是對已有技術的一種很好的應用,對吧?我認為我們將會看到內存領域更多的創新,我對此非常期待。 我認為人們正在意識到,當你在進行推理時,如果你事先了解將要執行的操作或需要的數據,你就可以組織你的內存來加以利用。所以 Jalapeno 出現在 Hot Chips 大會上,這是 OpenAI 的芯片。他們談到了內存局部性,我們通常把內存看作一個大型存儲庫,一次性全部獲取。但這些實際的內存芯片有不同的通道,它們在物理上距離計算部分有一定距離。看起來距離不遠,我們說的可能只是幾毫米,但這仍然很重要。他們意識到並展示的是,保持某些內存組,讓計算引擎能夠獲取靠近它的或在空間上接近的數據,能帶來更好的性能。 所以我認為,讓內存更靠近計算需要它的地方這個想法,在未來會變得越來越重要。 我認為人們正在談論將內存集成在計算之上的3D技術。在這些情況下,這將極為重要,因為你不再只有一條寬大的總線來回傳輸數據。你會有一堆非常細小的線路,每次只能傳輸幾個字節。所以你必須在空間上組織這些線路。所以字面上來說,知道芯片中各個部分的物理位置是一個巨大的優勢。 我認為這可能會在不依賴更好的 HBM 的情況下,在吞吐量和功耗方面帶來更多的提升。
Logan Jastremski:
我有點好奇,這更多是關於局部性的問題,還是更多關於吞吐量或延遲的問題?
Mr. Bubble:
嗯,兩者都可能有,對吧?我是說,更好的局部性意味着更低的延遲,對吧?但如果你有更多的內存通道,你就能獲得更多的帶寬。 所以也許你只需要在那個特定芯片或那組或那個可尋址內存塊中擁有恰好滿足需求的帶寬,這就夠了。但延遲會低很多,對吧?是的。所以我認為,每個人都在談論,我自己也談論這個,我做過一段時間的芯片設計,每個人都在談論內存帶寬和延遲。我認為有一件事人們沒有談到,就是你什麼時候需要這個訪問時間。 你知道,如果我知道GPU要執行的操作需要10毫秒,而我只在第11毫秒才需要這個數據。那麼它需要那麼多帶寬或那麼低的延遲嗎?不需要。你只需要知道什麼時候需要獲取它,對吧? 所以控制好這一點會很有趣。這與局部性有關。我認為這裏有很多有趣的東西。我會說,如果有人想了解我認為內存的未來是什麼,那就是 3D DRAM,對吧?
第七章:AI對齊
Mr. Bubble:
有點像,那家公司叫什麼來着?他們最近在 Hot Chips 上展示了一種將 DRAM 封裝在邏輯芯片上方的技術。我們等會兒再查一下。
Logan Jastremski:
Hot Chips 怎麼樣?D matrix。
Mr. Bubble:
D matrix。就是 D matrix。就是那家公司。Hot Chips 辦得很好。我是說,我搬到帕洛阿爾託的一個重要原因就是,去年我來參加 Hot Chips,我當時心想,我是個紐約人,那邊沒人懂芯片,也沒人在乎,這當然沒什麼問題,人們關心別的事情。但我來到這裏,感覺到處都是傳奇人物,大家說着同一種語言,互相交流想法。感覺就像置身於啓蒙時代倫敦的咖啡館裏,每個人都在探討:我們怎麼才能讓這些芯片變得更好? 但今年人滿為患,裏面擠滿了各種各樣的金融圈人士,不全是,但有很多來自對沖基金之類機構的人,我覺得這非常有意思。去年更多的是高頻交易公司的人,他們其實也需要了解這些芯片的工作原理,對吧?他們當時就在那兒,心想,哦,我也得跟這些芯片打交道。我覺得看到金融圈的人向演講者提問,挺有意思的,也挺好笑的。但不管怎樣,我認為 3D DRAM 會非常厲害。我希望能看到更多人在這方面探索新的方案,因為這是我們獲得更高帶寬、更低延遲的一種途徑。不過芯片的設計難度會稍微大一些。
Logan Jastremski:
有意思。你還提到了功耗。我覺得 Jensen 一直在反覆強調這樣一個觀點:如果你只有一個 1 吉瓦的數據中心,那你的上限就是 1 吉瓦。所以更好的辦法是提升不同層面的能效。你有沒有深入研究過功耗或者能耗這個方向?
Mr. Bubble:
在一定程度上有。我覺得可以大致估算出每瓦的 token 產出,也就是每千瓦或每兆瓦能處理多少 token,隨便你怎麼算。我覺得,Jensen 說得對,我們在功耗方面確實有一些可以做的事情,可以降低功耗,但這可能會犧牲 token 吞吐量,或者你能服務的用戶數量。所以你真的需要從經濟角度去理解這件事,站在那些真正在賣 token 的人的角度,也就是那些大型實驗室。他們非常在意能服務更多用戶,在意更高的批處理量,這是關鍵詞。他們希望批處理量儘可能高,這樣就能用同一套硬件服務更多用戶。是這樣的,批處理量越高,產出的 token 就越多,每瓦產出的 token 也越多。那麼,花大力氣去做各種複雜的操作來降低這些芯片的功耗,到底值不值?我覺得,也許值,也許不值。這是一個很大的平衡問題。在功耗方面,我認為降低這些數據中心的功耗難度其實很大,是一個巨大的挑戰。你可能更應該去找便宜、更清潔的電力來源。 有道理嗎?總體來說是這樣,我還想補充一點:數據中心最大的成本根本不是電費,而是硬件成本。 所以如果你想創辦一家新的雲服務公司,電費算什麼?無關緊要。土地成本是多少?GPU 要花多少錢?哦天哪,你最好有充足的孖展纔行,對吧?
Logan Jastremski:
所以你認為最值得關注的事情仍然是內存,尤其是考慮到,模型權重的總體大小可能不再持續增長,但上下文長度普遍在增加。而且即便這些今天保持不變,你也需要更多內存來支持更多併發用戶。
Mr. Bubble:
是的,沒錯。我們最終會給這些服務器增加更多內存。歸根結底,問題在於用什麼類型的內存?是 HBM?是 DRAM?還是閃存?我猜更多會是閃存。大家都在討論如何降低對 HBM 用量的需求。因為說實話,歸根結底,權重應該放在 HBM 裏。如果我們並不是同時用到所有的上下文,為什麼要在那裏存放大量的上下文呢?對吧?
Logan Jastremski:
有道理。有意思。好的。我覺得從大方向來說,我的問題基本上都問完了,除非你還有什麼有趣的事情,或者什麼讓你感到興奮的事情想聊聊。
Mr. Bubble:
我想聊聊"追趕前沿"這個話題。說真的,我很想知道這到底是怎麼回事。我的意思是……
Logan Jastremski:
說得好。
Mr. Bubble:
我非常好奇這到底是什麼意思,因為這個概念根本就沒有被明確定義過。我一直在越來越多地思考這件事。我是說,我們聽說他們解決了那些千禧年難題,花了1500萬美元才賺了100萬,好吧,但那個問題可能本身也沒那麼有價值,對吧?我是說,就像Stokes方程,我們,世界會因此一夜之間改變嗎?如果我們解決了它,我覺得可能只是在CFD(計算流體動力學)模擬裏節省了一些計算資源。但數學和理論領域裏確實有很多真正有價值的問題,對吧。我想到像 Terrence Tao,他的很多研究都在與EE(電氣工程)領域相鄰的方向,比如信號處理、估算,還有稀疏信號的重建。他的數學研究奠定了現在手機運作方式的基礎,比如LTE和蜂窩通信,對吧?因為他的數學研究,我們使用了更少的帶寬。那麼這樣的數學問題到底有多大價值?它可能價值數十億。
所以我很好奇,"追趕前沿"到底有多少是垂直整合、去攻克有價值的問題,又有多少是真正出於安全考慮? 說實話,我不太相信所謂的安全問題。我們談過電力的問題,我是說,我們可以直接斷電。我覺得安全方面更大的問題在於,這些實驗室可能要承擔法律責任,對吧?如果他們的AI對某人的電腦做了什麼非常糟糕的事情,那就是起訴的理由。說到底,我覺得我們國家有法律框架,可以用正確的方式來規範這件事。我們可以籤一份合同,說好了,你要承擔責任,你簽了這份合同,如果這個AI agent失控了,那是你的責任。我不知道。我不太相信那種"終結者"式的場景,說這些agent會直接接管互聯網、把一切都搞垮,光是因為維持這些GPU運行的成本就已經很高了。所以這看起來就是一種對資源的糟糕利用,對吧?我同意。
我一直在想這件事。我在看空和看多之間來回搖擺,但是。我覺得,我從來沒有……好,這裏有個非常大膽的觀點。我一直在用AI,但我從來都不是那種會說"哦,AI太厲害了,太瘋狂了,我們都得跟上"的人。在我看來,AI適合幫我做那些髒活累活、那些繁瑣的事務性工作。但真正的思考,很遺憾,還是得靠我自己。 我從來沒有感覺到它已經能替代這一點了。如果你去問那些初中生或者高中生,他們其實也沒用那麼多AI,因為他們能用來幹什麼呢?他們能做什麼?無非是寫個關於George Washington之類的小作文。
第八章:AI實驗室的未來
Mr. Bubble:
這沒什麼太大用處。所以我一直在想的一件事就是,你知道,AI應該,真正強大的AI和高算力資源,應該用於重要的問題,以及那些真正能夠解決這些重要問題的人。這一直是看多的理由,對吧?我們想想,如果一台GPU或者配備GPU的服務器,有可能發現一種藥物,哪怕只是提高了10%的概率,那這台服務器的價值應該是多少?而那種藥物價值數十億美元,或者一種新材料,你知道,可能幫我們節省大量能源。
從AI的角度來看,這對我來說一直是最重要的事情。這也是為什麼,到目前為止,我其實並不太在意那些。我是說,寫代碼很酷,做網站很酷,那些垃圾內容就是垃圾,但是,讓我們做真正有價值的工作吧。所以我不知道,"放緩前沿"這件事,到底有多少是在做決策——認為所有這些算力資源和這些瘋狂的模型,應該更好地用於解決真正重要的問題——又有多少只是,你知道,監管俘獲的問題。
Logan Jastremski:
我同意。我覺得大部分都是SCOP的問題。我是說,我不在灣區,所以我不像那邊的人那樣被各種群體思維所影響,但對我來說,我同意。我不認為這些模型……我從一個朋友那裏聽到這個說法,我不同意他的觀點,他說這些模型現在幾乎相當於iPhone,只是在邊際上有所改進,不會有太大進步。但是……
Mr. Bubble:
iPhone是最好的例子,因為我們所有人都對iPhone上癮了。我們出門都離不開它。對,它現在正在成為我們工作中不可或缺的東西。所以——
Logan Jastremski:
我確實認為它最終會達到那個水平。但就像你說的,你可以問它問題,它顯然會給你還不錯的答案,但它還沒有到可以替代你,或者說你今天就能完全依賴它的程度,就是那種,你知道,它給出的答案明顯更好的感覺。你還是得去核實它,你得檢查它的上下文裏有什麼,它在預填充時引入了什麼,它引用了哪些不同的來源。對我來說,就像你說的,它更多地是在做那些基礎性的重複勞動,比如,好,你能幫我回復郵件嗎?對我來說,就是你加入越來越多的上下文,它確實變得越來越有趣、越來越有用。但現在,這些模型總體上還是有"失憶症"的。它們足夠聰明,但還沒有聰明到能一步到位解決所有問題的程度。所以我不認為我們已經到了擁有超級智能的階段。因此,在很大程度上,我確實認為這主要是SCOP的問題,他們想要放緩,也許他們只是想在內部使用這些模型來繼續推進研究。
Mr. Bubble:
這聽起來是個很好的做法,因為如果我有一定量的算力資源,運行這些東西要花很多錢。那它可以用來服務更多用戶,我向他們收費,不知道,每月20美元之類的。或者它可以用來,你知道,發現一種新材料,或者解決信號處理領域中一個非常重要的問題,諸如此類。所以我並不反對這件事本身,我反對的是它的呈現方式。
我真的非常希望,人們能把AI用於這些有價值的、你知道的,重大發現上,因為我們在人力方面受到了太多的瓶頸制約,對吧?人類有大量的好直覺,我們能想出各種各樣解決問題的思路。但歸根結底,你還是得付出實際的工作才能真正解決它,你知道,去驗證它。所以那裏有太多可以做的事情,但我認為如果我們不談"放緩前沿"這個話題,那就是我們的失職,對吧?
Logan Jastremski:
我同意。你對開源與閉源的看法是什麼?因為大家普遍認為開源模型相對落後。但看起來,如果說有什麼的話,它們其實非常接近了。當然,很難判斷閉源實驗室是否在把他們最新的模型藏得越來越久,但從硬件角度,或者說投資角度來看,這些模型似乎都無法在普通硬件上運行,除非你跑的是那些非常老舊、不那麼智能的模型,除非他們在特定任務上做了大量強化學習。
Mr. Bubble:
你說得對。我的意思是,運行這些模型確實需要一定的技術積累,這是個挑戰。這也是為什麼專門幫人運行開源模型已經成為一門大生意,對吧?開源對我來說一直都是在商品化編程。現在 GPT-6 在視頻遊戲、圖形處理這類事情上已經相當不錯了。所以我相信那些也會被商品化。但前沿領域一直是關於突破極限的,對吧?而我們在電腦上能做的事情,到目前為止已經差不多做完了。你知道,我們能寫代碼、能發郵件、能用 Excel 工作,但我們需要跳出電腦的範疇。我們需要改變現實的底層結構,也就是發現新事物,去解決比網頁應用、iPhone 應用更重要的問題。我是說,如果你能從那些東西里獲得價值,那當然也挺好的。但我認為現在有一種可能,我們會迎來遞歸式自我改進。AI 是在遞歸地讓自己變得更好嗎?更可能的是 AI 在讓我們變得更好——AI 發現新事物,自動化我們大量的工作,讓我們更快、更高效,對吧?所以我認為這纔是前沿應該堅守的方向。我之所以提這個,是因為如果追趕前沿意味着服務更少的用戶,去攻克這些高價值的問題,這真的會從根本上改變商業模式,並且影響到下游的一切。這可能是好事,也可能是壞事,但我們現在還不知道。我認為,Navier-Stokes 問題的潛在突破並不一定說明 AI 在所有其他問題領域都會同樣有效,對吧?這說得通。而且據說那個突破也是來自某個人的人類直覺,對吧?所以,是的……
Logan Jastremski:
所以我聽到的是,前沿應該繼續推進。可以問一個更直接的問題嗎——如果你有機會以當前的估值投資這些實驗室,姑且說是一萬億美元,你認為這比投資一個 neo cloud——也就是那種可能只是專門服務開源模型的公司——更有意思嗎?
Mr. Bubble:
我非常相信直接擁有硬件層,或者說擁有鐵路,擁有那些構成基礎的東西,對吧?所以你是想投資 Anthropic 和 OpenAI——這兩家會競爭到兩敗俱傷,最終隨着人員跳槽流動,他們的超額收益會逐漸擴散消失——還是你想擁有那些有着十年、二十年積累和護城河、專注於開發這一切所需的核心硬件的公司?甚至包括,你非常擅長運營數據中心。我是說,有一個論點是,如果你擁有大量 GPU,並且非常擅長保持高可用性,那你就是一家非常有價值的公司。
第九章:結語與價值下一步將流向何處
Mr. Bubble:
我確信大多數投資者不會這樣思考,他們只會,你知道的,無腦追捧這些東西,這也可能是他們應該做的。但歸根結底,我用過一個非常好的經驗法則來判斷一家公司是否具有強大的價值主張——如果這家公司消失六個月,所有人會有多慘? 比如我想到 TSMC,那會很糟糕,對吧?Nvidia,也會很糟糕,甚至像 Sandisk,嗯,我們可能可以從京瓷那邊搞到替代品,對吧?有些地方你可以爭辯說人們願意在產品之間切換,對吧?最好的公司就是那種讓你永遠沒有理由離開的公司,對吧?那些纔是真正的好公司。所以如果一家 AI 實驗室開始做到這一點,那將會非常有意思,對吧?但我覺得他們還沒聰明到那個程度,你知道嗎?不過我們拭目以待。我覺得,是的,我很期待這些 IPO。我的意思是,它們會成為很好的沽空對象,我想。我很確定這會是很好的投資組合 beta 對沖工具。所以我非常興奮。能有一個新的金融工具用於對沖,感覺很好。
Logan Jastremski:
所以繼續做多硬件。我覺得這不是,
Mr. Bubble:
這可能纔是真正的創新。
Logan Jastremski:
是的,對沖,新增千兆瓦的數量。我是說,能不能獲得能源供應當然還有待觀察。但是,我的意思是,對我來說。回到"引領前沿"這個說法,它之所以看起來像是一場鬧劇,是因為他們不可能對正在建設中的那些數據中心按下暫停鍵。
Mr. Bubble:
對我們來說是"引領前沿",但對他們自己來說可不是。
Logan Jastremski:
是的,他們自己不會放慢速度。如果說有什麼變化的話,他們一直在談論想要引入更多千兆瓦,用於訓練和推理。所以,光是建設數據中心本身就已經是多年期的承諾了。所以如果他們是真的認真對待這件事,我覺得他們應該會取消那些資本支出。但他們沒有。這不會發生的。
Mr. Bubble:
是的,我傾向於非常看漲。我是說,我們現在有利率問題和伊朗局勢,但是。我不知道。我的意思是,我有一種感覺,你知道,我們用 AI 發現幾種新藥,把合適的研究人員聚集在一起,或者我們找到一種方法讓 5G 不需要在一平方英里內建一千座基站。是的,是的,是的,隨便什麼,只要是更高效的東西。是的,我是說。我們將會迎來一次快速起飛。 我是說,光靠五到十種新藥就能為所有的資本支出提供合理依據。我是這麼認為的。
Logan Jastremski:
非常對。好的,Mr. Bubble,非常感謝你來參加節目。非常有趣。感謝你陪我聊天,並分享了你的獨家見解。
Mr. Bubble:
當然。謝謝你,Logan。感謝你邀請我。