直擊GTC,老黃就指著你燒token了
但今晚真正的新聞是第柒顆芯片,Groq 3 LPU。去年聖誕夜英偉達花200億美元拿下Groq的技術授權和核心團隊,今天是首次產品落地,而且已經在量產。

為什麼需要Groq?黃仁勳在台上講得很清楚,GPU擅長高吞吐的並行計算,做prefill和attention很強,但在超高速token生成這個區間會力不從心。他的原話是NVL72在超過400 tokens/s/user的區間“runs out of steam”(跑不動了)。而Groq的LPU是壹種完全不同的處理器,確定性數據流架構,芯片上全是SRAM,沒有運行時動態調度,編譯器在編譯階段就把每個時鍾周期的計算和數據搬運全部排好了。這種架構天然適合低延遲的decode和token生成。
問題在於SRAM雖快但容量極小。單顆Groq 3 LPU只有500MB SRAM,而Rubin GPU是288GB HBM4,差了500多倍,根本存不下萬億參數的模型。英偉達的解法是用壹套叫Dynamo的軟件把推理過程拆成兩半,Rubin負責prefill和attention,處理上下文需要大量算力和大容量內存;Groq負責feed-forward部分的decode和token生成,需要極低延遲和極高帶寬。兩者通過以太網緊耦合,延遲減半。
黃仁勳管這個叫disaggregated inference(解耦推理),並且總結說高吞吐和低延遲本質上enemies of each other(彼此矛盾),而Groq就是解決這個矛盾的那壹半拼圖。

舞台上的那張對比圖視覺沖擊很強。
左邊壹顆Rubin GPU,288GB HBM4、22TB/s帶寬、50 PFLOPs。
右邊壹排8顆Groq 3 LPU組成的陣列,4GB SRAM、1,200TB/s SRAM帶寬(Rubin的55倍)、9.6 PFLOPs。
兩種極端的處理器,統壹成壹個推理系統。Groq 3 LPX整機把256顆LPU裝進壹個機架,提供128GB SRAM、40PB/s帶寬、315 PFLOPS推理算力和640TB/s互連帶寬。

[物價飛漲的時候 這樣省錢購物很爽]
這條新聞還沒有人評論喔,等著您的高見呢

為什麼需要Groq?黃仁勳在台上講得很清楚,GPU擅長高吞吐的並行計算,做prefill和attention很強,但在超高速token生成這個區間會力不從心。他的原話是NVL72在超過400 tokens/s/user的區間“runs out of steam”(跑不動了)。而Groq的LPU是壹種完全不同的處理器,確定性數據流架構,芯片上全是SRAM,沒有運行時動態調度,編譯器在編譯階段就把每個時鍾周期的計算和數據搬運全部排好了。這種架構天然適合低延遲的decode和token生成。
問題在於SRAM雖快但容量極小。單顆Groq 3 LPU只有500MB SRAM,而Rubin GPU是288GB HBM4,差了500多倍,根本存不下萬億參數的模型。英偉達的解法是用壹套叫Dynamo的軟件把推理過程拆成兩半,Rubin負責prefill和attention,處理上下文需要大量算力和大容量內存;Groq負責feed-forward部分的decode和token生成,需要極低延遲和極高帶寬。兩者通過以太網緊耦合,延遲減半。
黃仁勳管這個叫disaggregated inference(解耦推理),並且總結說高吞吐和低延遲本質上enemies of each other(彼此矛盾),而Groq就是解決這個矛盾的那壹半拼圖。

舞台上的那張對比圖視覺沖擊很強。
左邊壹顆Rubin GPU,288GB HBM4、22TB/s帶寬、50 PFLOPs。
右邊壹排8顆Groq 3 LPU組成的陣列,4GB SRAM、1,200TB/s SRAM帶寬(Rubin的55倍)、9.6 PFLOPs。
兩種極端的處理器,統壹成壹個推理系統。Groq 3 LPX整機把256顆LPU裝進壹個機架,提供128GB SRAM、40PB/s帶寬、315 PFLOPS推理算力和640TB/s互連帶寬。

[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
推薦:
直擊GTC,老黃就指著你燒token了