- B200 vyniká svojou 180 GB pamäte HBM3e a masívnou šírkou pásma 8 TB/s.
- Predstavujeme architektúru Blackwell s jadrami Tensor 5. generácie a natívnou podporou presnosti FP4.
- V inferenčnom výkone výrazne prekonáva H100, čím drasticky znižuje náklady na token.
- Využíva prepojenie NVLink 5.0 na dosiahnutie obojsmernej komunikácie s rýchlosťou 1.8 TB/s na GPU.
Ak ste nadšencom špičkového hardvéru, určite ste už počuli o kvantovom skoku, ktorý predstavuje séria Blackwell . NVIDIA B200 nie je len ďalším vylepšením; je to procesorová beštia špeciálne navrhnutá na elimináciu pamäťových a výpočtových úzkych miest pre umelú inteligenciu.
Táto karta je prezentovaná ako klenot pre dátové centrá a zameriava sa na riešenie odvekého problému modelov rozsiahlych jazykov (LLM). Vďaka prevratnému dizajnu a výkonu, ktorý zahanbuje svojich predchodcov, je B200 hračkou pri trénovaní a nasadzovaní modelov v porovnaní s tým, čo sme robili len pred pár rokmi.
Technické špecifikácie a vnútorná architektúra
Pod kapotou sa nachádza B200, majstrovské dielo inžinierstva založené na architektúre Blackwell. Využíva dvojčipový dizajn GB100 , kde sú dva čipy spojené prepojením čip-čip s rýchlosťou 10 TB/s, čo umožňuje operačnému systému rozpoznať ho ako jednu jednotku. Je vyrobený pomocou procesu 4NP od spoločnosti TSMC a obsahuje astronomických 208.000 miliárd tranzistorov.
Pokiaľ ide o konfiguráciu vykresľovania, obsahuje 18 944 shaderových jednotiek, 592 TMU a 24 ROP. Jeho základná taktovacia frekvencia je 120 MHz, ale dá sa zvýšiť až na 1 830 MHz , zatiaľ čo pamäť pracuje na frekvencii 2 000 MHz. Všetok tento výkon vedie k TDP 1 000 W v jeho tvarovom faktore SXM, hoci niektoré implementácie sa môžu pohybovať medzi 700 W a 1 000 W v závislosti od prostredia.
Pamäť a šírka pásma: Srdce výkonu
B200 skutočne vyniká v oblasti správy dát. Môže sa pochváliť 180 GB pamäte HBM3e , čo je množstvo, ktoré umožňuje načítanie rozsiahlych modelov bez nutnosti fragmentácie medzi viacerými grafickými procesormi. Nie je to však len kapacita; rozdiel robí aj šírka pásma 8 TB/s , ktorá je takmer 2,4-krát vyššia ako u H100.
Zjednodušene povedané, inferencia LLM je v podstate problém čítania z pamäte. Pri generovaní každého tokenu musí GPU prečítať celé pole váh modelu. Vďaka tejto šírke pásma dokáže B200 udržať oveľa vyššiu rýchlosť generovania tokenov , čím sa eliminujú oneskorenia, ktoré sa zvyčajne vyskytujú v modeloch so 70 miliardami parametrov alebo viac.
Výpočtový výkon a prechod na 4. rámcový program
Hlavnou inováciou sú jadrá Tensor 5. generácie, ktoré prinášajú natívnu podporu pre presnosť FP4 . Táto schopnosť je kľúčová, pretože umožňuje 50 % zníženie pamäťovej náročnosti v porovnaní s FP8, čím sa efektívne zdvojnásobí počet parametrov, ktoré je možné spracovať. V hrubých vyjadreniach dosahuje B200 20 PetaFLOPS v FP4 a 9 PetaFLOPS v FP8.
V porovnaní s generáciou Hopper je tento skok ohromujúci. Zatiaľ čo H100 zaostáva v oblasti výkonu s nízkou presnosťou, B200 ponúka až štvornásobne vyšší inferenčný výkon . To sa premieta do drasticky nižších nákladov na milión tokenov, vďaka čomu je oveľa ziskovejší pre spoločnosti, ktoré poskytujú rozhrania API pre umelú inteligenciu vo veľkom meradle.
Priame porovnanie: B200 vs H100 a H200
Ak premýšľate, či sa oplatí vykonať upgrade, stručná odpoveď je áno, za predpokladu, že vaše zostavy sú veľké. V porovnaní s H100 SXM5, ktorá má iba 80 GB VRAM, B200 ponúka viac ako dvojnásobok pamäte . To znamená, že 70B Llama 3.1 zostava v FP16 sa pohodlne zmestí na jednu kartu, čím sa vyhnete zložitosti tenzorového paralelizmu.
Aj v porovnaní s H200, ktorý už predstavoval vylepšenie pamäte (141 GB), B200 jednoznačne vyhráva s o 28 % viac VRAM a o 67 % vyššou šírkou pásma. Okrem toho prepojenie NVLink 5.0 zvyšuje obojsmernú komunikáciu na 1.8 TB/s, čo je presne dvojnásobok oproti NVLink 4.0, čo umožňuje takmer lineárne škálovanie v konfiguráciách s 8 GPU.
Požiadavky na infraštruktúru a energiu
Nemôžeme ignorovať fakt, že presun takéhoto výkonu si vyžaduje serióznu infraštruktúru. Systém B200 s ôsmimi grafickými procesormi môže len pri spracovaní spotrebovať 7 až 8 kW. Zatiaľ čo chladenie vzduchom je možné v dobre vetraných rackoch s vysokou hustotou, priame kvapalinové chladenie sa dôrazne odporúča na zachovanie životnosti hardvéru a zabránenie tepelnému škrteniu.
Pokiaľ ide o konektivitu, používa rozhranie PCI-Express 6.0 x16 a softvérový ekosystém je plne kompatibilný s CUDA 12.x a cuDNN 9.x. Akýkoľvek kód, ktorý už funguje na H100, bude bežať na B200 bez zmien, hoci na maximum z FP4 je potrebné použiť TensorRT-LLM 0.17+ alebo aktualizované verzie vLLM.
Analýza nákladov a dostupnosti cloudu
Na trhu s prenájmom GPU sa B200 prezentoval ako veľmi atraktívna možnosť. Na platformách ako RunPod alebo Spheron sa ceny za služby na požiadanie zvyčajne pohybujú od 5,89 do 9,36 USD za hodinu, zatiaľ čo spotové inštancie môžu klesnúť až na 5,34 USD. Hoci je hodinová sadzba vyššia ako u H100, efektivita na token je taká vysoká, že konečné náklady na službu sú zvyčajne oveľa nižšie.
Napriek obrovskému dopytu a miliónom jednotiek čakajúcich na priamy nákup je cloud najrýchlejším spôsobom prístupu k Blackwell. Možnosť sekundovej fakturácie umožňuje vývojárom testovať svoje modely FP4 bez toho, aby sa zaviazali k multimiliónovým zmluvám o fyzickej infraštruktúre.
NVIDIA B200 nanovo definuje naše očakávania od akcelerátora umelej inteligencie, kombinuje masívnu pamäť HBM3e s prelomovou podporou FP4 a ultrarýchlym prepojením NVLink 5.0. Vďaka výraznému prekonaniu obmedzení šírky pásma a kapacity série Hopper sa stáva dokonalým nástrojom pre tých, ktorí spravujú rozsiahle jazykové modely, pričom optimalizuje výkon inferencie aj prevádzkové náklady na token.