- B200 erottuu edukseen 180 Gt:n HBM3e-muistillaan ja massiivisella 8 Tt/s:n kaistanleveydellään.
- Esittelyssä Blackwell-arkkitehtuuri 5. sukupolven Tensor-ytimillä ja natiivilla FP4-tarkkuuden tuella.
- Se ylittää reilusti H100:n päättelykyvyssä, mikä alentaa merkittävästi tokenia kohden maksettavaa hintaa.
- Se käyttää NVLink 5.0 -yhteenliitäntää saavuttaakseen 1.8 TB/s kaksisuuntaisen tiedonsiirron näytönohjainta kohden.
Jos olet intohimoinen huippuluokan laitteistojen ystävä, olet varmasti jo kuullut Blackwell-sarjan edustamasta kvanttiloikasta . NVIDIA B200 ei ole vain yksi päivitys lisää; se on prosessointipetos, joka on erityisesti suunniteltu poistamaan tekoälyn muisti- ja laskentakapasiteetin pullonkauloja.
Tämä kortti esitellään datakeskusten kruununjalokivenä, ja se keskittyy ratkaisemaan ikivanhan ongelman, joka liittyy suuriin kielimalleihin (LLM). Mullistavan muotoilunsa ja edeltäjänsä häpeään heittävän tehonsa ansiosta B200 tekee mallien kouluttamisesta ja käyttöönotosta helppoa kuin mitä teimme vain pari vuotta sitten.
Tekniset tiedot ja sisäinen arkkitehtuuri
Konepellin alla B200 on Blackwell-arkkitehtuuriin perustuva insinööritaidon mestariteos. Se hyödyntää kaksoispiiristä GB100- rakennetta, jossa kaksi piiriä on yhdistetty 10 TB/s:n sirujen välisellä yhteenliitännällä, jonka avulla käyttöjärjestelmä tunnistaa sen yhtenä yksikkönä. Se on valmistettu TSMC :n 4NP-prosessilla ja siinä on tähtitieteelliset 208.000 miljardia transistoria.
Renderöintikokoonpanonsa osalta siinä on 18 944 varjostinyksikköä, 592 TMU:ta ja 24 ROP:ia. Sen peruskellotaajuus on 120 MHz, mutta se voidaan nostaa jopa 1830 MHz:iin , kun taas muisti toimii 2000 MHz:n kellotaajuusalueella. Kaikki tämä teho tuottaa 1000 W:n TDP:n SXM-muodossa, vaikka jotkut toteutukset voivat vaihdella 700 W:n ja 1000 W:n välillä ympäristöstä riippuen.
Muisti ja kaistanleveys: Suorituskyvyn ydin
B200:n todellinen vahvuus on sen datanhallinta. Siinä on 180 Gt HBM3e-muistia , jonka ansiosta voidaan ladata massiivisia malleja ilman, että ne pirstoutuvat useiden näytönohjainten kesken. Mutta kyse ei ole pelkästään kapasiteetista; 8 Tt/s kaistanleveys tekee eron, sillä se on lähes 2,4 kertaa suurempi kuin H100:ssa.
Yksinkertaisesti sanottuna LLM-päättely on pohjimmiltaan muistinlukuongelma. Jokaisen tokeonin luomisen yhteydessä GPU:n on luettava mallin koko painotaulukko. Tämän kaistanleveyden ansiosta B200 pystyy ylläpitämään paljon suurempaa tokeneiden luontinopeutta , mikä poistaa viiveet, joita tyypillisesti esiintyy malleissa, joissa on 70 B tai enemmän parametreja.
Laskentateho ja harppaus neljänteen puiteohjelmaan
Merkittävä innovaatio on viidennen sukupolven Tensor-ytimet, jotka tarjoavat natiivin tuen FP4-tarkkuudelle . Tämä ominaisuus on ratkaisevan tärkeä, koska se mahdollistaa muistinkulutuksen pienentämisen 5 %:lla FP8:aan verrattuna, mikä käytännössä kaksinkertaistaa käsiteltävien parametrien määrän. Raaka-arvoina B200 saavuttaa 20 petaflopsia FP4:ssä ja 9 petaflopsia FP8:ssa.
Hopper-sukupolveen verrattuna harppaus on huikea. Vaikka H100 jää jälkeen alhaisen tarkkuuden suorituskyvyssä, B200 tarjoaa jopa nelinkertaisen päättelytehon . Tämä tarkoittaa huomattavasti alhaisempia kustannuksia miljoonaa tokenia kohden, mikä tekee siitä paljon kannattavamman yrityksille, jotka tarjoavat tekoälyrajapintoja laajasti.
Suora vertailu: B200 vs. H100 ja H200
Jos mietit, kannattaako päivitys tehdä, lyhyt vastaus on kyllä, edellyttäen, että kokoonpanosi ovat suuria. Verrattuna H100 SXM5:een, jossa on vain 80 Gt VRAM-muistia, B200 tarjoaa yli kaksinkertaisen määrän muistia . Tämä tarkoittaa, että 70B Llama 3.1 -kokoonpano FP16:ssa mahtuu mukavasti yhdelle kortille, välttäen tensoririnnakkaisuuden monimutkaisuuden.
Verrattuna H200:aan, jossa muisti oli jo ennestään parannus (141 Gt), B200 voittaa selvästi 28 % suuremmalla VRAM-muistilla ja 67 % suuremmalla kaistanleveydellä. Lisäksi NVLink 5.0 -yhteenliitäntä nostaa kaksisuuntaisen tiedonsiirron 1.8 TB/s:iin, mikä on täsmälleen kaksinkertainen NVLink 4.0:aan verrattuna, mikä mahdollistaa lähes lineaarisen skaalauksen 8 GPU:n kokoonpanoissa.
Infrastruktuuri- ja energiavaatimukset
Emme voi sivuuttaa sitä tosiasiaa, että tällaisen tehon siirtäminen vaatii vakavasti otettavan infrastruktuurin. Kahdeksan näytönohjaimen B200-järjestelmä voi kuluttaa pelkästään prosessoinnissa 7–8 kW. Vaikka ilmajäähdytys on mahdollista hyvin ilmastoiduissa, tiheissä räkeissä, suoraa nestejäähdytystä suositellaan vahvasti laitteiston pitkäikäisyyden ylläpitämiseksi ja lämpökuristuksen estämiseksi.
Liitettävyyden osalta se käyttää PCI-Express 6.0 x16 -liitäntää , ja ohjelmistoekosysteemi on täysin yhteensopiva CUDA 12.x:n ja cuDNN 9.x:n kanssa. Mikä tahansa koodi, joka jo toimii H100:lla, toimii B200:lla ilman muutoksia, vaikka FP4:n parhaan hyödyn saamiseksi on tarpeen käyttää TensorRT-LLM 0.17+:aa tai vLLM:n päivitettyjä versioita.
Pilvipalveluiden kustannus- ja saatavuusanalyysi
Näytönohjainten vuokrausmarkkinoilla B200 on asemoinut itsensä erittäin houkuttelevaksi vaihtoehdoksi. RunPodin tai Spheronin kaltaisilla alustoilla on-demand-hinnat vaihtelevat tyypillisesti 5,89–9,36 dollarin välillä tunnissa, kun taas spot-instanssien hinnat voivat laskea jopa 5,34 dollariin. Vaikka tuntihinta on korkeampi kuin H100:lla, tehokkuus tokenia kohden on niin korkea, että palvelun lopulliset kustannukset ovat yleensä paljon alhaisemmat.
Huolimatta valtavasta kysynnästä ja miljoonien suoraan ostettavien yksiköiden tilausjonosta, pilvipalvelu on nopein tapa käyttää Blackwelliä. Sekuntiperusteisen laskutuksen mahdollisuus antaa kehittäjille mahdollisuuden testata FP4-mallejaan sitoutumatta useiden miljoonien dollarien arvoisiin fyysisen infrastruktuurin sopimuksiin.
NVIDIA B200 mullistaa tekoälykiihdyttimen odotukset yhdistämällä massiivisen HBM3e-muistin uraauurtavaan FP4-tukeen ja huippunopeaan NVLink 5.0 -yhteenliitäntään. Ylittämällä Hopper-sarjan kaistanleveys- ja kapasiteettirajoitukset reilusti siitä tulee lopullinen työkalu laaja-alaisten kielimallien hallintaan, optimoiden sekä päättelykyvyn että käyttökustannukset tokenia kohden.