Sveobuhvatna analiza NVIDIA B200 Blackwella

Zadnje ažuriranje: 5 kolovoz 2026
  • B200 se ističe sa svojih 180 GB HBM3e memorije i ogromnom propusnošću od 8 TB/s.
  • Predstavljamo Blackwell arhitekturu s Tensor jezgrama 5. generacije i izvornom podrškom za točnost FP4.
  • Daleko nadmašuje H100 u performansama zaključivanja, drastično smanjujući cijenu po tokenu.
  • Koristi NVLink 5.0 međusobnu vezu za postizanje dvosmjerne komunikacije od 1.8 TB/s po GPU-u.

NVIDIA B200

Ako ste strastveni ljubitelj vrhunskog hardvera, sigurno ste već čuli za kvantni skok koji predstavlja Blackwell serija . NVIDIA B200 nije samo još jedno poboljšanje; to je procesorska zvijer posebno dizajnirana za uklanjanje memorijskih i računalnih uskih grla za umjetnu inteligenciju.

Ova kartica predstavljena je kao krunski dragulj za podatkovne centre, fokusirajući se na rješavanje vječnog problema velikih jezičnih modela (LLM). S disruptivnim dizajnom i snagom koja posramljuje svoje prethodnike, B200 čini obuku i implementaciju modela lakim u usporedbi s onim što smo radili prije samo nekoliko godina.

NVIDIA Blackwell-Next
Povezani članak:
NVIDIA Blackwell i put do Rubin arhitekture

Tehničke specifikacije i unutarnja arhitektura

Ispod haube, B200 je inženjersko remek-djelo temeljeno na Blackwell arhitekturi. Koristi dvostruki GB100 dizajn, gdje su dva čipa spojena međusobnom vezom od 10 TB/s, što omogućuje operativnom sustavu da ga prepozna kao jednu jedinicu. Proizveden je korištenjem TSMC -ovog 4NP procesa i sadrži astronomskih 208.000 milijardi tranzistora.

Što se tiče konfiguracije renderiranja, ima 18.944 shader jedinica, 592 TMU-a i 24 ROP-a. Osnovna brzina takta je 120 MHz, ali se može pojačati do 1830 MHz , dok memorija radi na 2000 MHz. Sva ova izlazna snaga rezultira TDP-om od 1000 W u SXM formatu, iako neke implementacije mogu varirati između 700 W i 1000 W ovisno o okruženju.

  Potpuni vodič za poboljšanja pametnog doma i automatizaciju doma

Memorija i propusnost: Srž performansi

Ono gdje B200 zaista blista jest upravljanje podacima. Može se pohvaliti sa 180 GB HBM3e memorije , količinom koja omogućuje učitavanje masivnih modela bez pribjegavanja fragmentaciji na više GPU-ova. Ali nije samo kapacitet; propusnost od 8 TB/s je ono što čini razliku, gotovo 2,4 puta veća od one kod H100.

Jednostavno rečeno, LLM inferencija je u biti problem čitanja memorije. Prilikom generiranja svakog tokena, GPU mora pročitati cijeli niz težina modela. S ovom propusnošću, B200 može održati puno veću brzinu generiranja tokena , eliminirajući kašnjenja koja se obično javljaju u modelima sa 70B parametara ili više.

Ugovor o OpenAI AWS-u
Povezani članak:
OpenAI i AWS potpisali su mega-ugovor za skaliranje svoje umjetne inteligencije: 38.000 milijardi dolara, Nvidia čipovi i nova karta oblaka

Računalna snaga i skok na FP4

Glavna inovacija su Tensor jezgre 5. generacije, koje uvode izvornu podršku za preciznost FP4 . Ova je mogućnost ključna jer omogućuje 50% smanjenje memorijskog otiska u usporedbi s FP8, učinkovito udvostručujući broj parametara koji se mogu obraditi. U sirovim vrijednostima, B200 postiže 20 PetaFLOPS-a u FP4 i 9 PetaFLOPS-a u FP8.

U usporedbi s Hopperovom generacijom, skok je nevjerojatan. Dok H100 zaostaje u performansama niske preciznosti, B200 nudi do četiri puta bolje performanse zaključivanja . To se prevodi u drastično nižu cijenu po milijun tokena, što ga čini daleko profitabilnijim za tvrtke koje poslužuju AI API-je u velikim razmjerima.

  Kako radi umjetna inteligencija?

Izravna usporedba: B200 vs H100 i H200

Ako se pitate isplati li se nadogradnja, kratak odgovor je da, pod uvjetom da su vaše konfiguracije velike. U usporedbi s H100 SXM5, koja ima samo 80 GB VRAM-a, B200 nudi više nego dvostruko više memorije . To znači da se 70B Llama 3.1 konfiguracija u FP16 može udobno smjestiti na jednu karticu, izbjegavajući složenost tenzorskog paralelizma.

Čak i u usporedbi s H200, koji je već bio poboljšanje u memoriji (141 GB), B200 uvjerljivo pobjeđuje s 28% više VRAM- a i 67% većom propusnošću. Nadalje, NVLink 5.0 međusobna veza pojačava dvosmjernu komunikaciju na 1.8 TB/s, točno dvostruko više od NVLink 4.0, omogućujući gotovo linearno skaliranje u konfiguracijama s 8 GPU-a.

Infrastrukturni i energetski zahtjevi

Ne možemo zanemariti činjenicu da premještanje takve snage zahtijeva ozbiljnu infrastrukturu. Sustav s osam GPU-a B200 može potrošiti između 7 i 8 kW samo u obradi. Iako je hlađenje zrakom održivo u dobro prozračenim raccima visoke gustoće, izravno tekuće hlađenje se toplo preporučuje kako bi se održao vijek trajanja hardvera i spriječilo termalno gušenje.

Što se tiče povezivosti, koristi PCI-Express 6.0 x16 sučelje , a softverski ekosustav je u potpunosti kompatibilan s CUDA 12.x i cuDNN 9.x. Bilo koji kod koji već radi na H100 radit će na B200 bez promjena, iako je za maksimalno iskorištavanje FP4 potrebno koristiti TensorRT-LLM 0.17+ ili ažurirane verzije vLLM-a.

Analiza troškova i dostupnosti oblaka

Na tržištu najma GPU-a, B200 se pozicionirao kao vrlo atraktivna opcija. Na platformama poput RunPoda ili Spherona, cijene na zahtjev obično se kreću od 5,89 do 9,36 dolara po satu, dok spot instance mogu pasti i do 5,34 dolara. Iako je satnica viša od H100, učinkovitost po tokenu je toliko visoka da je konačni trošak usluge obično puno niži.

  Kako prepoznati pregrijava li se vaše računalo zbog virusa ili prljavštine

Unatoč ogromnoj potražnji i milijunima jedinica koje čekaju izravnu kupnju, oblak je najbrži način pristupa Blackwellu. Opcija naplate po sekundi omogućuje programerima da testiraju svoje FP4 modele bez obveze prema višemilijunskim ugovorima o fizičkoj infrastrukturi.

NVIDIA B200 redefinira ono što očekujemo od AI akceleratora, kombinirajući masivnu HBM3e memoriju s revolucionarnom FP4 podrškom i ultrabrzom NVLink 5.0 međusobnom vezom. Daleko nadmašujući ograničenja propusnosti i kapaciteta serije Hopper, postaje ultimativni alat za one koji upravljaju velikim jezičnim modelima, optimizirajući i performanse zaključivanja i operativne troškove po tokenu.