- B200 izceļas ar 180 GB HBM3e atmiņu un iespaidīgu 8 TB/s joslas platumu.
- Iepazīstinām ar Blackwell arhitektūru ar 5. paaudzes Tensor kodoliem un vietējo atbalstu FP4 precizitātei.
- Tas ievērojami pārspēj H100 secinājumu veiktspējas ziņā, ievērojami samazinot izmaksas par vienu žetonu.
- Tas izmanto NVLink 5.0 savienojumu, lai panāktu divvirzienu saziņu ar ātrumu 1.8 TB/s uz vienu GPU.
Ja jūs aizrauj jaunākās paaudzes aparatūra, jūs noteikti jau esat dzirdējuši par kvantu lēcienu, ko pārstāv Blackwell sērija . NVIDIA B200 nav tikai vēl viens jauninājums; tas ir apstrādes zvērs, kas īpaši izstrādāts, lai novērstu atmiņas un skaitļošanas sastrēgumus mākslīgajam intelektam.
Šī karte tiek pasniegta kā datu centru kronis, koncentrējoties uz senās lielo valodu modeļu (LLM) problēmas risināšanu. Ar revolucionāru dizainu un jaudu, kas liek kaunēties tā priekšgājējiem, B200 padara modeļu apmācību un izvietošanu par nieku, salīdzinot ar to, ko mēs darījām tikai pirms pāris gadiem.
Tehniskās specifikācijas un iekšējā arhitektūra
Zem pārsega slēpjas B200 inženierijas šedevrs, kas balstīts uz Blackwell arhitektūru. Tajā izmantots divu mikroshēmu GB100 dizains, kur divi mikroshēmu savienojumi ir apvienoti, izmantojot 10 TB/s mikroshēmu savstarpējo savienojumu, ļaujot operētājsistēmai to atpazīt kā vienu vienību. Tas ir ražots, izmantojot TSMC 4NP procesu , un tajā ir astronomiski 208.000 miljardi tranzistoru.
Runājot par renderēšanas konfigurāciju, tajā ir 18 944 ēnotāju vienības, 592 TMU un 24 ROP. Tā pamata pulksteņa frekvence ir 120 MHz, bet to var palielināt līdz 1830 MHz , savukārt atmiņa darbojas ar 2000 MHz frekvenci. Visa šī jauda SXM formāta faktorā nodrošina 1000 W TDP, lai gan dažās realizācijās tā var atšķirties no 700 W līdz 1000 W atkarībā no vides.
Atmiņa un joslas platums: veiktspējas pamatā
B200 patiesi izceļas ar savu datu pārvaldību. Tam ir 180 GB HBM3e atmiņas — apjoms, kas ļauj ielādēt milzīgus modeļus, neizmantojot fragmentāciju starp vairākiem grafiskajiem procesoriem. Taču atšķirība nav tikai ietilpībā; 8 TB/s joslas platums ir gandrīz 2,4 reizes lielāks nekā H100.
Vienkārši sakot, LLM secinājums būtībā ir atmiņas lasīšanas problēma. Ģenerējot katru marķieri, GPU ir jānolasa viss modeļa svaru masīvs. Ar šo joslas platumu B200 var uzturēt daudz lielāku marķieru ģenerēšanas ātrumu , novēršot kavēšanos, kas parasti rodas modeļos ar 70B vai vairāk parametriem.
Datorjauda un lēciens uz FP4
Galvenais jauninājums ir 5. paaudzes Tensor kodoli, kas ievieš vietējo atbalstu FP4 precizitātei . Šī iespēja ir ļoti svarīga, jo tā ļauj samazināt atmiņas patēriņu par 50% salīdzinājumā ar FP8, faktiski divkāršojot apstrādājamo parametru skaitu. Neapstrādātos skaitļos B200 sasniedz 20 PetaFLOPS FP4 un 9 PetaFLOPS FP8.
Salīdzinot ar Hopper paaudzi, lēciens ir satriecošs. Lai gan H100 atpaliek no zemas precizitātes veiktspējas, B200 piedāvā līdz pat četrām reizēm lielāku secinājumu veiktspēju . Tas nozīmē ievērojami zemākas izmaksas par miljonu žetonu, padarot to daudz ienesīgāku uzņēmumiem, kas plašā mērogā apkalpo mākslīgā intelekta API.
Tiešs salīdzinājums: B200 pret H100 un H200
Ja domājat, vai ir vērts veikt jaunināšanu, īsā atbilde ir jā, ja vien jūsu būves ir lielas. Salīdzinot ar H100 SXM5, kuram ir tikai 80 GB videoatmiņas, B200 piedāvā vairāk nekā divreiz vairāk atmiņas . Tas nozīmē, ka 70B Llama 3.1 būvējums FP16 var ērti ietilpt vienā kartē, izvairoties no tenzoru paralēlisma sarežģītības.
Pat salīdzinot ar H200, kam jau tā bija uzlabota atmiņa (141 GB), B200 nepārprotami uzvar ar par 28 % lielāku videoatmiņu un par 67 % lielāku joslas platumu. Turklāt NVLink 5.0 starpsavienojums palielina divvirzienu saziņu līdz 1.8 TB/s, kas ir tieši divreiz vairāk nekā NVLink 4.0, nodrošinot gandrīz lineāru mērogošanu 8 GPU konfigurācijās.
Infrastruktūras un enerģijas prasības
Mēs nevaram ignorēt faktu, ka šādas jaudas pārvietošanai ir nepieciešama nopietna infrastruktūra. Astoņu GPU B200 sistēma tikai apstrādei var patērēt no 7 līdz 8 kW. Lai gan gaisa dzesēšana ir iespējama labi vēdināmos, augsta blīvuma plauktos, tieša šķidruma dzesēšana ir ļoti ieteicama , lai saglabātu aparatūras ilgmūžību un novērstu termisko droseļvārstu.
Savienojamības ziņā tā izmanto PCI-Express 6.0 x16 saskarni , un programmatūras ekosistēma ir pilnībā saderīga ar CUDA 12.x un cuDNN 9.x. Jebkurš kods, kas jau darbojas uz H100, darbosies uz B200 bez izmaiņām, lai gan, lai maksimāli izmantotu FP4, ir jāizmanto TensorRT-LLM 0.17+ vai atjauninātas vLLM versijas.
Mākoņa izmaksu un pieejamības analīze
GPU nomas tirgū B200 ir pozicionējis sevi kā ļoti pievilcīgu iespēju. Tādās platformās kā RunPod vai Spheron pieprasījuma cenas parasti svārstās no 5,89 līdz 9,36 USD stundā, savukārt lokālo instancu cenas var nokrist līdz pat 5,34 USD. Lai gan stundas likme ir augstāka nekā H100, efektivitāte uz vienu žetonu ir tik augsta, ka pakalpojuma galīgās izmaksas parasti ir daudz zemākas.
Neskatoties uz milzīgo pieprasījumu un miljoniem vienību, kas vēl nav iegādātas tieši, mākonis ir ātrākais veids, kā piekļūt Blackwell. Iespēja norēķināties par sekundi ļauj izstrādātājiem testēt savus FP4 modeļus, neuzņemoties saistības slēgt vairāku miljonu dolāru vērtus fiziskās infrastruktūras līgumus.
NVIDIA B200 no jauna definē to, ko mēs sagaidām no mākslīgā intelekta paātrinātāja, apvienojot iespaidīgu HBM3e atmiņu ar revolucionāru FP4 atbalstu un īpaši ātru NVLink 5.0 savienojumu. Ievērojami pārspējot Hopper sērijas joslas platuma un ietilpības ierobežojumus, tas kļūst par galveno rīku tiem, kas pārvalda liela mēroga valodu modeļus, optimizējot gan secinājumu veiktspēju, gan ekspluatācijas izmaksas uz vienu marķieri.