- B200 vyniká 180 GB paměti HBM3e a masivní propustností 8 TB/s.
- Představujeme architekturu Blackwell s jádry Tensor 5. generace a nativní podporou přesnosti FP4.
- V inferenčním výkonu výrazně překonává H100 a drasticky snižuje náklady na token.
- Využívá propojení NVLink 5.0 k dosažení obousměrné komunikace o rychlosti 1.8 TB/s na GPU.
Pokud jste nadšení pro špičkový hardware, jistě jste již slyšeli o kvantovém skoku, který představuje řada Blackwell . NVIDIA B200 není jen další upgrade; je to výpočetní bestie speciálně navržená k odstranění paměťových a výpočetních úzkých míst pro umělou inteligenci.
Tato karta je prezentována jako klenot pro datová centra a zaměřuje se na řešení odvěkého problému rozsáhlých jazykových modelů (LLM). Díky inovativnímu designu a výkonu, který zahanbuje své předchůdce, je B200 hračkou pro trénování a nasazení modelů ve srovnání s tím, co jsme dělali ještě před pár lety.
Technické specifikace a vnitřní architektura
Pod kapotou se nachází B200, inženýrské mistrovské dílo založené na architektuře Blackwell. Využívá dvoučipový design GB100 , kde jsou dva čipy spojeny propojením čip-čip s rychlostí 10 TB/s, což umožňuje operačnímu systému jej rozpoznat jako jednu jednotku. Je vyroben pomocí procesu 4NP od TSMC a obsahuje astronomických 208.000 miliard tranzistorů.
Co se týče renderovací konfigurace, obsahuje 18 944 shaderových jednotek, 592 TMU a 24 ROP. Základní taktovací frekvence je 120 MHz, ale lze ji zvýšit až na 1830 MHz , zatímco paměť pracuje na frekvenci 2000 MHz. Veškerý tento výkon vede k TDP 1000 W v provedení SXM, ačkoli některé implementace se mohou lišit mezi 700 W a 1000 W v závislosti na prostředí.
Paměť a šířka pásma: Srdce výkonu
B200 skutečně vyniká ve správě dat. Může se pochlubit 180 GB paměti HBM3e , což je množství, které umožňuje načítání masivních modelů bez nutnosti fragmentace mezi více grafickými procesory. Není to ale jen kapacita; rozdíl dělá i šířka pásma 8 TB/s , která je téměř 2,4krát větší než u H100.
Jednoduše řečeno, inference LLM je v podstatě problém čtení z paměti. Při generování každého tokenu musí GPU přečíst celé pole vah modelu. Díky této šířce pásma dokáže B200 udržet mnohem vyšší rychlost generování tokenů , čímž eliminuje zpoždění, která se obvykle objevují u modelů se 70 B parametry nebo více.
Výpočetní výkon a přechod na 4. rámcový program
Hlavní inovací jsou jádra Tensor 5. generace, která zavádějí nativní podporu pro přesnost FP4 . Tato schopnost je klíčová, protože umožňuje 50% snížení paměťové náročnosti ve srovnání s FP8, čímž se efektivně zdvojnásobí počet zpracovávaných parametrů. V hrubých číslech dosahuje B200 20 PetaFLOPS v FP4 a 9 PetaFLOPS v FP8.
Ve srovnání s generací Hopper je tento skok ohromující. Zatímco H100 zaostává v oblasti výkonu s nízkou přesností, B200 nabízí až čtyřnásobný inferenční výkon . To se promítá do drasticky nižších nákladů na milion tokenů, což z něj činí mnohem ziskovější model pro společnosti, které ve velkém měřítku poskytují API pro umělou inteligenci.
Přímé srovnání: B200 vs. H100 a H200
Pokud přemýšlíte, zda se vyplatí provést upgrade, stručná odpověď zní ano, za předpokladu, že vaše sestavy jsou velké. Ve srovnání s H100 SXM5, která má pouze 80 GB VRAM, nabízí B200 více než dvojnásobek paměti . To znamená, že 70B Llama 3.1 sestava v FP16 se pohodlně vejde na jednu kartu, čímž se vyhnete složitosti tenzorového paralelismu.
I ve srovnání s H200, který již sám o sobě nabízel vylepšení paměti (141 GB), B200 jednoznačně vítězí s o 28 % větší pamětí VRAM a o 67 % vyšší šířkou pásma. Propojení NVLink 5.0 navíc zvyšuje obousměrnou komunikaci na 1.8 TB/s, což je přesně dvojnásobek oproti NVLink 4.0, což umožňuje téměř lineární škálování v konfiguracích s 8 GPU.
Požadavky na infrastrukturu a energii
Nemůžeme ignorovat skutečnost, že přenos takového výkonu vyžaduje seriózní infrastrukturu. Systém B200 s osmi grafickými procesory může spotřebovat 7 až 8 kW pouze při zpracování dat. I když je chlazení vzduchem proveditelné v dobře větraných raccích s vysokou hustotou, pro zachování životnosti hardwaru a prevenci tepelného škrcení se důrazně doporučuje přímé kapalinové chlazení.
Co se týče konektivity, používá rozhraní PCI-Express 6.0 x16 a softwarový ekosystém je plně kompatibilní s CUDA 12.x a cuDNN 9.x. Jakýkoli kód, který již funguje na H100, poběží na B200 beze změn, i když pro maximální využití FP4 je nutné použít TensorRT-LLM 0.17+ nebo aktualizované verze vLLM.
Analýza nákladů a dostupnosti cloudu
Na trhu s pronájmem GPU se B200 prezentuje jako velmi atraktivní volba. Na platformách jako RunPod nebo Spheron se ceny za on-demand obvykle pohybují od 5,89 do 9,36 dolarů za hodinu, zatímco spotové instance mohou klesnout až na 5,34 dolarů. Přestože je hodinová sazba vyšší než u H100, efektivita na token je tak vysoká, že konečné náklady na službu jsou obvykle mnohem nižší.
Navzdory ohromné poptávce a milionům jednotek čekajících na přímý nákup je cloud nejrychlejším způsobem přístupu k Blackwellu. Možnost fakturace po sekundách umožňuje vývojářům testovat své modely FP4, aniž by se zavazovali k mnohamilionovým smlouvám na fyzickou infrastrukturu.
NVIDIA B200 nově definuje naše očekávání od akcelerátoru umělé inteligence. Kombinuje masivní paměť HBM3e s průlomovou podporou FP4 a ultrarychlým propojením NVLink 5.0. Díky dalekosáhlému překonání omezení šířky pásma a kapacity řady Hopper se stává dokonalým nástrojem pro ty, kteří spravují rozsáhlé jazykové modely, a optimalizuje jak inferenční výkon, tak provozní náklady na token.