- B200 paistab silma oma 180 GB HBM3e mälu ja tohutu 8 TB/s ribalaiuse poolest.
- Tutvustame Blackwelli arhitektuuri 5. põlvkonna Tensori südamike ja FP4 täpsuse natiivse toega.
- See ületab järelduste jõudluse poolest kaugelt H100-d, vähendades drastiliselt žetooni hinda.
- See kasutab NVLink 5.0 ühendust, et saavutada kahesuunaline side kiirusega 1.8 TB/s GPU kohta.
Kui oled tipptasemel riistvarast vaimustuses, oled kindlasti juba kuulnud Blackwelli seeria kvanthüppest . NVIDIA B200 pole lihtsalt järjekordne uuendus; see on töötlemiskoletis, mis on spetsiaalselt loodud tehisintellekti mälu- ja arvutusprobleemide kõrvaldamiseks.
Seda kaarti esitletakse andmekeskuste kroonijuveelina, mis keskendub suurte keelemudelite (LLM) igivana probleemi lahendamisele. Murrangulise disaini ja võimsusega, mis jätab oma eelkäijad häbisse, muudab B200 mudelite treenimise ja juurutamise imelihtsaks võrreldes sellega, mida me tegime vaid paar aastat tagasi.
Tehnilised kirjeldused ja sisemine arhitektuur
Kapoti all on B200 inseneritöö meistriteos, mis põhineb Blackwelli arhitektuuril. See kasutab kahekiibilist GB100 disaini, kus kaks kiipi on ühendatud 10 TB/s kiip-kiibi ühendusega, mis võimaldab operatsioonisüsteemil seda ühe üksusena ära tunda. See on toodetud TSMC 4NP protsessi abil ja sisaldab astronoomilisi 208.000 miljardit transistorit.
Mis puutub renderduskonfiguratsiooni, siis sellel on 18 944 varjutusüksust, 592 TMU-d ja 24 ROP-i. Selle baastaktsagedus on 120 MHz, kuid seda saab suurendada kuni 1830 MHz-ni , samas kui mälu töötab sagedusel 2000 MHz. Kogu see väljundvõimsus annab SXM-vormingus 1000 W TDP-d, kuigi mõned implementatsioonid võivad keskkonnast olenevalt varieeruda 700 W ja 1000 W vahel.
Mälu ja ribalaius: jõudluse süda
B200 tõeline sära peitub andmehalduses. Sellel on 180 GB HBM3e mälu , mis võimaldab laadida suuri mudeleid ilma neid mitme GPU vahel fragmenteerimata. Kuid asi pole ainult mahutavuses; vahet teeb ka 8 TB/s ribalaius , mis on peaaegu 2,4 korda suurem kui H100-l.
Lihtsamalt öeldes on LLM-järeldus sisuliselt mälu lugemise probleem. Iga märgi genereerimisel peab graafikaprotsessor lugema kogu mudeli kaalumassiivi. Selle ribalaiusega suudab B200 säilitada palju suurema märgi genereerimise kiiruse , kõrvaldades viivitused, mis tavaliselt esinevad mudelites, millel on 70B või rohkem parameetreid.
Arvutusvõimsus ja hüpe 4. raamprogrammi
Peamine uuendus on 5. põlvkonna Tensori tuumad, mis pakuvad natiivset tuge FP4 täpsusele . See võimekus on ülioluline, kuna see võimaldab mälukasutust 50% vähendada võrreldes FP8-ga, kahekordistades seega töödeldavate parameetrite arvu. Toores andmevoos saavutab B200 FP4-s 20 petaflopsi ja FP8-s 9 petaflopsi.
Võrreldes Hopperi põlvkonnaga on hüpe vapustav. Kuigi H100 jääb madala täpsusega jõudluse poolest maha, pakub B200 kuni neli korda paremat järeldusjõudlust . See tähendab drastiliselt madalamat hinda miljoni žetooni kohta, muutes selle palju tulusamaks ettevõtetele, kes pakuvad tehisintellekti API-sid suures mahus.
Otsene võrdlus: B200 vs H100 ja H200
Kui mõtled, kas uuendamine on seda väärt, siis lühike vastus on jah, eeldusel, et sinu süsteemid on mahukad. Võrreldes H100 SXM5-ga, millel on ainult 80 GB videomälu, pakub B200 rohkem kui kaks korda rohkem mälu . See tähendab, et 70B Llama 3.1 moodul FP16-s mahub mugavalt ühele kaardile, vältides tensorparalleelsuse keerukust.
Isegi võrreldes H200-ga, mis oli juba mälu osas edasiminek (141 GB), võidab B200 vaieldamatult 28% suurema videomälu ja 67% suurema ribalaiusega. Lisaks suurendab NVLink 5.0 ühendus kahesuunalise side kiirust 1.8 TB/s, mis on täpselt kaks korda rohkem kui NVLink 4.0-l, võimaldades peaaegu lineaarset skaleerimist 8-GPU konfiguratsioonides.
Taristu ja energiavajadused
Me ei saa eirata tõsiasja, et sellise võimsuse liigutamine nõuab tõsist infrastruktuuri. Kaheksa GPU-ga B200 süsteem võib ainuüksi töötlemiseks tarbida 7–8 kW. Kuigi õhkjahutus on hästiventileeritavates ja suure tihedusega rackides teostatav, on riistvara pikaealisuse säilitamiseks ja termilise ahenemise vältimiseks tungivalt soovitatav otsene vedelikjahutus .
Ühenduvuse osas kasutab see PCI-Express 6.0 x16 liidest ning tarkvara ökosüsteem on täielikult ühilduv CUDA 12.x ja cuDNN 9.x-ga. Kõik kood, mis juba töötab H100-l, töötab B200-l muudatusteta, kuigi FP4-st maksimumi saamiseks on vaja kasutada TensorRT-LLM 0.17+ või vLLM-i uuendatud versioone.
Pilve maksumuse ja kättesaadavuse analüüs
GPU-de rentimise turul on B200 positsioneerinud end väga atraktiivse valikuna. Sellistel platvormidel nagu RunPod või Spheron on nõudmisel rendi hinnad tavaliselt vahemikus 5,89–9,36 dollarit tunnis, samas kui kohapeal renditavate eksemplaride hinnad võivad langeda kuni 5,34 dollarini. Kuigi tunnihind on kõrgem kui H100-l, on efektiivsus žetooni kohta nii kõrge, et teenuse lõpphind on tavaliselt palju madalam.
Vaatamata tohutule nõudlusele ja miljonite otseostuks ootavate ühikute ootel olemisele on pilv kiireim viis Blackwelli ligipääsemiseks. Sekundipõhise arvelduse võimalus võimaldab arendajatel testida oma FP4 mudeleid ilma mitme miljoni dollari suuruste füüsilise infrastruktuuri lepinguteta.
NVIDIA B200 annab tehisintellekti kiirendilt ootustele uue tähenduse, ühendades tohutu HBM3e mälu murrangulise FP4 toe ja ülikiire NVLink 5.0 ühendusega. Ületades kaugelt Hopperi seeria ribalaiuse ja mahutavuse piiranguid, saab sellest ülim tööriist neile, kes haldavad suuremahulisi keelemudeleid, optimeerides nii järelduste jõudlust kui ka tegevuskulusid tokeni kohta.