- B200 se ističe sa svojih 180 GB HBM3e memorije i ogromnim protokom podataka od 8 TB/s.
- Predstavljamo Blackwell arhitekturu sa Tensor jezgrama 5. generacije i izvornom podrškom za FP4 tačnost.
- Daleko nadmašuje H100 u performansama zaključivanja, drastično smanjujući cijenu po tokenu.
- Koristi NVLink 5.0 međusobnu vezu za postizanje dvosmjerne komunikacije od 1.8 TB/s po GPU-u.
Ako ste strastveni ljubitelj najsavremenijeg hardvera, sigurno ste već čuli za kvantni skok koji predstavlja Blackwell serija . NVIDIA B200 nije samo još jedno unapređenje; to je procesorska zvijer posebno dizajnirana da eliminiše uska grla u memoriji i računanju za vještačku inteligenciju.
Ova kartica je predstavljena kao krunski dragulj za podatkovne centre, fokusirajući se na rješavanje vjekovnog problema velikih jezičkih modela (LLM). Sa revolucionarnim dizajnom i snagom koja posramljuje svoje prethodnike, B200 čini obuku i implementaciju modela lakim u poređenju sa onim što smo radili prije samo nekoliko godina.
Tehničke specifikacije i interna arhitektura
Ispod haube, B200 je inženjersko remek-djelo zasnovano na Blackwell arhitekturi. Koristi dvostruki GB100 dizajn, gdje su dva čipa spojena putem čip-to-čip interkonekcije od 10 TB/s, što omogućava operativnom sistemu da ga prepozna kao jednu jedinicu. Proizveden je korištenjem TSMC -ovog 4NP procesa i sadrži astronomskih 208.000 milijardi tranzistora.
Što se tiče konfiguracije renderiranja, ima 18.944 shader jedinica, 592 TMU-a i 24 ROP-a. Osnovna brzina takta je 120 MHz, ali se može povećati do 1830 MHz , dok memorija radi na 2000 MHz. Sva ova izlazna snaga rezultira TDP-om od 1000 W u SXM form faktoru, iako neke implementacije mogu varirati između 700 W i 1000 W, ovisno o okruženju.
Memorija i propusnost: Srž performansi
Ono gdje B200 zaista blista jeste upravljanje podacima. Može se pohvaliti sa 180 GB HBM3e memorije , količinom koja omogućava učitavanje ogromnih modela bez pribjegavanja fragmentaciji na više GPU-ova. Ali nije samo kapacitet; propusni opseg od 8 TB/s je ono što čini razliku, što je skoro 2,4 puta veće od onog kod H100.
Jednostavno rečeno, LLM inferencija je u suštini problem čitanja memorije. Prilikom generisanja svakog tokena, GPU mora pročitati cijeli niz težina modela. Sa ovim propusnim opsegom, B200 može održati mnogo veću brzinu generisanja tokena , eliminišući kašnjenja koja se obično javljaju u modelima sa 70B parametara ili više.
Računarska snaga i prelazak na FP4
Glavna inovacija su Tensor jezgre 5. generacije, koje uvode izvornu podršku za preciznost FP4 . Ova mogućnost je ključna jer omogućava smanjenje memorijskog otiska za 50% u poređenju sa FP8, efektivno udvostručujući broj parametara koji se mogu obraditi. U sirovim vrijednostima, B200 postiže 20 PetaFLOPS-a u FP4 i 9 PetaFLOPS-a u FP8.
U poređenju sa Hopper generacijom, skok je nevjerovatan. Dok H100 zaostaje u performansama niske preciznosti, B200 nudi do četiri puta bolje performanse inferencije . To se prevodi u drastično nižu cijenu po milion tokena, što ga čini daleko profitabilnijim za kompanije koje pružaju usluge AI API-ja u velikim razmjerima.
Direktno poređenje: B200 vs H100 i H200
Ako se pitate da li se isplati izvršiti nadogradnju, kratak odgovor je da, pod uslovom da su vaše konfiguracije velike. U poređenju sa H100 SXM5, koja ima samo 80GB VRAM-a, B200 nudi više nego dvostruko više memorije . To znači da se 70B Llama 3.1 konfiguracija u FP16 može udobno smjestiti na jednu karticu, izbjegavajući složenost tenzorskog paralelizma.
Čak i u poređenju sa H200, koji je već bio poboljšanje u memoriji (141 GB), B200 ubjedljivo pobjeđuje sa 28% više VRAM- a i 67% većim propusnim opsegom. Nadalje, NVLink 5.0 interkonekcija pojačava dvosmjernu komunikaciju na 1.8 TB/s, tačno dvostruko više od NVLink 4.0, omogućavajući gotovo linearno skaliranje u konfiguracijama sa 8 GPU-ova.
Infrastrukturni i energetski zahtjevi
Ne možemo zanemariti činjenicu da premještanje takve snage zahtijeva ozbiljnu infrastrukturu. Sistem B200 s osam GPU-a može potrošiti između 7 i 8 kW samo u obradi. Iako je hlađenje zrakom održivo u dobro prozračenim raccima visoke gustoće, direktno tekuće hlađenje se toplo preporučuje kako bi se održao vijek trajanja hardvera i spriječilo termalno gušenje.
Što se tiče povezivosti, koristi PCI-Express 6.0 x16 interfejs , a softverski ekosistem je u potpunosti kompatibilan sa CUDA 12.x i cuDNN 9.x. Bilo koji kod koji već radi na H100 će raditi na B200 bez promjena, iako je za maksimalno iskorištavanje FP4 potrebno koristiti TensorRT-LLM 0.17+ ili ažurirane verzije vLLM-a.
Analiza troškova i dostupnosti oblaka
Na tržištu najma GPU-a, B200 se pozicionirao kao vrlo atraktivna opcija. Na platformama poput RunPod-a ili Spherona, cijene na zahtjev obično se kreću od 5,89 do 9,36 dolara po satu, dok spot instance mogu pasti i do 5,34 dolara. Iako je satnica viša od H100, efikasnost po tokenu je toliko visoka da je konačni trošak usluge obično mnogo niži.
Uprkos ogromnoj potražnji i milionima jedinica koje čekaju direktnu kupovinu, cloud je najbrži način za pristup Blackwellu. Opcija naplate po sekundi omogućava programerima da testiraju svoje FP4 modele bez obaveza prema višemilionskim ugovorima o fizičkoj infrastrukturi.
NVIDIA B200 redefinira naša očekivanja od AI akceleratora, kombinirajući masivnu HBM3e memoriju s revolucionarnom FP4 podrškom i ultrabrzom NVLink 5.0 međusobnom vezom. Daleko nadmašujući ograničenja propusnog opsega i kapaciteta Hopper serije, postaje ultimativni alat za one koji upravljaju velikim jezičkim modelima, optimizirajući i performanse zaključivanja i operativne troškove po tokenu.