- „B200“ išsiskiria 180 GB HBM3e atmintimi ir didžiuliu 8 TB/s pralaidumu.
- Pristatome „Blackwell“ architektūrą su 5-osios kartos „Tensor“ branduoliais ir vietine FP4 tikslumo palaikymu.
- Jis gerokai lenkia H100 išvadų našumu, smarkiai sumažindamas žetono kainą.
- Jis naudoja „NVLink 5.0“ jungtį, kad pasiektų dvipusį 1.8 TB/s ryšį vienam GPU.
Jei jus domina pažangiausia techninė įranga, tikriausiai jau girdėjote apie kvantinį šuolį, kurį simbolizuoja „Blackwell“ serija . „NVIDIA B200“ – tai ne tik dar vienas atnaujinimas; tai apdorojimo žvėris, specialiai sukurtas pašalinti atminties ir skaičiavimo kliūtis dirbtiniam intelektui.
Ši kortelė pristatoma kaip duomenų centrų karūnos brangakmenis, skirtas spręsti seną didelių kalbų modelių (LLM) problemą. Dėl novatoriško dizaino ir galios, kuri prilygsta jos pirmtakams, B200 leidžia mokyti ir diegti modelius labai lengvai, palyginti su tuo, ką darėme vos prieš porą metų.
Techninės specifikacijos ir vidinė architektūra
Po gaubtu slypi „B200“ – inžinerijos šedevras, paremtas „Blackwell“ architektūra. Jame naudojamas dviejų lustų GB100 dizainas, kuriame du lustai sujungti 10 TB/s lustų tarpusavio jungtimi, leidžiančia operacinei sistemai atpažinti jį kaip vieną įrenginį. Jis pagamintas naudojant TSMC 4NP procesą ir jame yra astronominiai 208.000 milijardai tranzistorių.
Kalbant apie perteikimo konfigūraciją, jame yra 18 944 šešėliavimo įrenginiai, 592 TMU ir 24 ROP. Bazinis taktinis dažnis yra 120 MHz, tačiau jį galima padidinti iki 1830 MHz , o atmintis veikia 2000 MHz dažniu. Visa ši išvesties galia SXM formato koeficientu sudaro 1000 W TDP, nors kai kuriuose įdiegimuose ji gali skirtis nuo 700 W iki 1000 W, priklausomai nuo aplinkos.
Atmintis ir pralaidumas: našumo esmė
„B200“ išties išsiskiria duomenų valdymu. Jis gali pasigirti 180 GB HBM3e atminties – tai kiekis, leidžiantis įkelti didelius modelius nesukeliant fragmentacijos tarp kelių GPU. Tačiau skirtumas slypi ne tik talpoje; 8 TB/s pralaidumas yra tai, kas lemia skirtumą – jis yra beveik 2,4 karto didesnis nei „H100“.
Paprastai tariant, LLM išvada iš esmės yra atminties skaitymo problema. Generuodamas kiekvieną žetoną, GPU turi nuskaityti visą modelio svorių masyvą. Turėdamas šį pralaidumą, B200 gali palaikyti daug didesnį žetonų generavimo greitį , pašalindamas vėlavimus, kurie paprastai atsiranda modeliuose, turinčiuose 70B ar daugiau parametrų.
Skaičiavimo galia ir šuolis į FP4
Svarbiausia naujovė – penktosios kartos „Tensor“ branduoliai, kurie įdiegia vietinį FP4 tikslumo palaikymą . Ši galimybė yra labai svarbi, nes leidžia 5 % sumažinti atminties naudojimą, palyginti su FP8, o apdorojamų parametrų skaičius padidėja dvigubai. Neapdorotais duomenimis, B200 pasiekia 20 petaFLOPŲ FP4 ir 9 petaFLOPŲ FP8.
Palyginti su „Hopper“ karta, šuolis yra stulbinantis. Nors „H100“ atsilieka nuo mažo tikslumo, „B200“ siūlo iki keturių kartų didesnį išvadų našumą . Tai reiškia gerokai mažesnę kainą milijonui žetonų, todėl jis yra daug pelningesnis įmonėms, teikiančioms dirbtinio intelekto API dideliu mastu.
Tiesioginis palyginimas: B200, H100 ir H200
Jei svarstote, ar verta atnaujinti, trumpas atsakymas yra „taip“, jei jūsų sistemos yra didelės. Palyginti su H100 SXM5, kuris turi tik 80 GB vaizdo atminties, B200 siūlo daugiau nei dvigubai daugiau atminties . Tai reiškia, kad 70B „Llama 3.1“ sistema FP16 gali patogiai tilpti vienoje kortelėje, išvengiant tenzorinio lygiagretumo sudėtingumo.
Net lyginant su H200, kuris jau buvo patobulintas atminties atžvilgiu (141 GB), B200 neabejotinai laimi su 28 % didesne vaizdo atminties (VRAM) ir 67 % didesniu pralaidumu. Be to, NVLink 5.0 jungtis padidina dvikryptį ryšį iki 1.8 TB/s, lygiai dvigubai daugiau nei NVLink 4.0, ir įgalina beveik tiesinį mastelio keitimą 8 GPU konfigūracijose.
Infrastruktūros ir energijos poreikiai
Negalime ignoruoti fakto, kad tokiam galingumui perkelti reikalinga rimta infrastruktūra. Aštuonių GPU B200 sistema vien apdorojimui gali sunaudoti nuo 7 iki 8 kW. Nors oro aušinimas yra įmanomas gerai vėdinamose, didelio tankio lentynose, tiesioginis skysčio aušinimas yra labai rekomenduojamas , siekiant išlaikyti aparatinės įrangos ilgaamžiškumą ir išvengti perkaitimo.
Kalbant apie ryšį, jame naudojama PCI-Express 6.0 x16 sąsaja , o programinės įrangos ekosistema yra visiškai suderinama su CUDA 12.x ir cuDNN 9.x. Bet koks kodas, kuris jau veikia H100, veiks B200 be pakeitimų, nors norint išnaudoti visas FP4 galimybes, būtina naudoti „TensorRT-LLM 0.17+ “ arba atnaujintas vLLM versijas.
Debesijos sąnaudų ir prieinamumo analizė
GPU nuomos rinkoje „B200“ užima labai patrauklią poziciją. Tokiose platformose kaip „RunPod“ ar „Spheron“ užsakomųjų paslaugų kainos paprastai svyruoja nuo 5,89 iki 9,36 USD per valandą, o vietinių instancijų kainos gali nukristi iki 5,34 USD. Nors valandinis įkainis yra didesnis nei „H100“, vieno žetono efektyvumas yra toks didelis, kad galutinė paslaugos kaina paprastai yra daug mažesnė.
Nepaisant didžiulės paklausos ir milijonų tiesioginio pirkimo užsakymų sąrašo, debesija yra greičiausias būdas pasiekti „Blackwell“. Pasirinkus sekundės dydžio atsiskaitymą, kūrėjai gali išbandyti savo FP4 modelius neįsipareigojant sudaryti kelių milijonų dolerių vertės fizinės infrastruktūros sutarčių.
„NVIDIA B200“ iš naujo apibrėžia tai, ko tikimės iš dirbtinio intelekto greitintuvo, sujungdamas didžiulę HBM3e atmintį su novatoriška FP4 palaikymu ir itin greitu NVLink 5.0 sujungimu. Gerokai viršydamas „Hopper“ serijos pralaidumo ir talpos apribojimus, jis tampa pagrindiniu įrankiu tiems, kurie valdo didelio masto kalbos modelius, optimizuodamas tiek išvadų našumą, tiek eksploatavimo išlaidas vienam žetonui.