- B200 的突出特點是擁有 180 GB 的 HBM3e 記憶體和 8 TB/s 的超大頻寬。
- 推出採用第五代 Tensor 核心的 Blackwell 架構,並原生支援 FP4 精確度。
- 它的推理性能遠遠超過 H100,大幅降低了每個令牌的成本。
- 它採用 NVLink 5.0 互連技術,實現每個 GPU 1.8 TB/s 的雙向通訊。
如果你對尖端硬體充滿熱情,那麼你肯定聽說過Blackwell系列帶來的質的飛躍。 NVIDIA B200不僅僅是一次簡單的升級;它是一款專為消除人工智慧的記憶體和運算瓶頸而設計的強大處理器。
這張顯示卡被譽為資料中心的旗艦產品,專注於解決大型語言模型(LLM)這一長久以來的難題。憑藉顛覆性的設計和遠超前代產品的強大性能,B200 讓模型的訓練和部署變得無比輕鬆,遠勝於幾年前的工作方式。
技術規格與內部架構
B200 的核心在於其基於 Blackwell 架構的精湛工程設計。它採用雙晶片 GB100設計,將兩顆晶片透過 10 TB/s 的晶片間互連熔合在一起,使作業系統能夠將其識別為一個整體。 B200 採用台積電4NP 製程製造,內部整合了驚人的 2080 億個電晶體。
就其渲染配置而言,它擁有 18.944 個著色器單元、592 個紋理單元 (TMU) 和 24 個光柵化單元 (ROP)。其基礎時脈頻率為 120 MHz,最高可睿頻至 1830 MHz,而顯存頻率為 2000 MHz。所有這些功耗使得其 SXM 封裝的 TDP 為 1000W,但根據環境的不同,某些實現方案的 TDP 可能在 700W 到 1000W 之間。
記憶體和頻寬:效能的核心
B200 的真正亮點在於其資料管理能力。它配備了180 GB 的 HBM3e 顯存,如此大的容量足以加載大型模型,而無需在多個 GPU 之間進行碎片化處理。但真正讓它脫穎而出的並非僅僅是容量;8 TB/s 的頻寬才是關鍵所在,幾乎是 H100 的 2,4 倍。
簡而言之,LLM推理本質上是一個記憶體讀取問題。產生每個標記時,GPU必須讀取模型的整個權重數組。憑藉這種頻寬,B200可以維持更高的標記生成速度,從而消除通常在參數量達到70億或更多的模型中出現的延遲。
運算能力與向FP4的飛躍
這項重大創新在於第五代 Tensor 核心,它引入了對FP4 精確度的原生支援。這項功能至關重要,因為它與 FP8 相比可減少 5% 的記憶體佔用,從而有效地將可處理的參數數量翻倍。具體來說,B200在 FP4 下可達到 20 PetaFLOPS 的運算速度,在 FP8 下可達到 9 PetaFLOPS 的運算速度。
與 Hopper 世代相比,B200 的飛躍令人矚目。雖然 H100 在低精度性能方面有所欠缺,但 B4 的推理性能卻提升了近四倍。這意味著每百萬代幣的成本大幅降低,對於大規模提供 AI API 的公司而言,這將帶來更高的獲利能力。
直接比較:B200 與 H100 和 H200
如果你還在猶豫是否值得升級,答案是肯定的,前提是你的建造規模夠大。相較於只有 80GB 記憶體的 H100 SXM5,B200 的記憶體容量是其兩倍以上。這意味著一個 70 位元組的 Llama 3.1 FP16 建置可以輕鬆裝在一張顯示卡上,無需處理複雜的張量並行計算。
即使與記憶體容量已提升(141GB)的H200相比,B200也憑藉高達28%的顯存容量和67%的頻寬優勢遙遙領先。此外,NVLink 5.0互連技術將雙向通訊速度提升至1.8TB/s,是NVLink 4.0的兩倍,從而在8GPU配置中實現了近乎線性的效能擴展。
基礎設施和能源需求
我們不能忽視這樣一個事實:如此強大的運算能力需要完善的基礎設施。一套配備八塊GPU的B200系統僅處理能力就可能消耗7到8千瓦的功率。雖然在通風良好的高密度機架中採用風冷散熱是可行的,但為了延長硬體壽命並防止過熱降頻,我們強烈建議採用直接液冷散熱。
在連接方面,它採用PCI-Express 6.0 x16接口,軟體生態系統完全相容於 CUDA 12.x 和 cuDNN 9.x。任何已在 H100 上運行的程式碼都可以在 B200 上無需更改即可運行,但要充分發揮 FP4 的效能,則需要使用TensorRT-LLM 0.17+或更新版本的 vLLM。
雲端成本和可用性分析
在GPU租賃市場,B200已成為極具吸引力的選擇。在RunPod或Spheron等平台上,按需實例的價格通常在每小時5,89美元到9,36美元之間,而競價實例的價格最低可至每小時5,34美元。雖然其每小時的租金高於H100,但由於每個代幣的效率極高,最終的服務成本通常要低得多。
儘管市場需求旺盛,直接購買的訂單積壓數百萬台,但雲端存取 Blackwell 仍然是最快捷的方式。按秒計費的選項讓開發者無需簽訂數百萬美元的實體基礎設施合同,即可測試其 FP4 模型。
NVIDIA B200重新定義了我們對AI加速器的期望,它將海量HBM3e記憶體、突破性的FP4支援和超高速NVLink 5.0互連技術完美結合。它遠遠超越了Hopper系列的頻寬和容量限制,成為管理大規模語言模型使用者的理想工具,能夠優化推理效能和每個詞元的運作成本。