D

內存不夠用,多數人第一反應是"容量不夠"、加錢堆就行。但真正難翻的,是帶寬這道牆。

先看供給側:內存帶寬長期追不上算力。從 B100 到 GB300 連續五代,帶寬一直卡在 8TB/s 不動,而"帶寬/算力"比值從 1.1 一路掉到 0.5——等於 GPU 越來越多時間在乾等數據。新一代 Rubin 用上 HBM4,總帶寬提到 22TB/s,可算力同步又翻了兩三倍,比值仍只有 0.6,牆沒拆掉。

再看需求側,更陡:推理要讀的數據量,隨生成長度呈"平方級"增長。每吐一個新字,都要把激活參數和此前全部緩存重讀一遍。上下文長 10 倍,讀取量漲的是 100 倍——Qwen3.8 Max 在 10 萬字上下文上再生成 10 萬字,讀取量級就到約 500TB。

供給追不上、需求還在平方級膨脹,帶寬才是存力裏最硬的那塊短板。

图片 1,共 2 张
图片 2,共 2 张

本文版權歸屬於原作者/機構。

以上內容僅代表作者個人觀點,不代表平台立場。本內容僅供投資參考,不應被視為投資建議。如您對平台提供的內容服務有任何疑問或建議,請聯繫我們。