- La B200 destaca pels seus 180 GB de memòria HBM3e i una amplada de banda massiva de 8 TB/s.
- Introdueix l'arquitectura Blackwell amb nuclis Tensor de 5a generació i suport natiu per a precisió FP4.
- Supera àmpliament a l'H100 en rendiment d'inferència, reduint dràsticament el cost per token.
- Utilitza l'interconnector NVLink 5.0 per assolir una comunicació bidireccional de 1.8 TB/s per GPU.
Si us apassiona el maquinari d'avantguarda, segur que ja heu sentit a parlar del salt quàntic que suposa la sèrie Blackwell . La NVIDIA B200 no és simplement una actualització més, sinó una bèstia del processament dissenyada específicament perquè la intel·ligència artificial deixi d'embussar-se als colls d'ampolla de la memòria i la computació.
Aquesta targeta es presenta com la joia de la corona per als centres de dades, enfocant-se a resoldre el problema etern dels models de llenguatge extens (LLM). Amb un disseny disruptiu i una potència que deixa en ridícul les seves predecessores, la B200 arriba perquè entrenar i desplegar models sigui un passeig comparat amb el que fèiem fa tot just un parell d'anys.
Especificacions Tècniques i Arquitectura Interna
Sota el capó, la B200 és una obra mestra de l?enginyeria basada en l?arquitectura Blackwell. Utilitza un disseny de doble xip GB100 , on dos dies es fusionen mitjançant una interconnexió xip-to-xip de 10 TB/s, fent que el sistema operatiu ho reconegui com una sola unitat. Està fabricada amb el procés de TSMC 4NP i té una xifra astronòmica de 208.000 milions de transistors.
Quant a la configuració de renderització, compta amb 18.944 unitats d'ombreig, 592 TMUs i 24 ROPs. La seva freqüència base se situa en els 120 MHz, però és capaç d'assolir un boost de 1830 MHz , mentre que la memòria opera a 2000 MHz. Tot aquest desplegament energètic comporta un TDP de 1000W en el seu format SXM, encara que algunes implementacions poden variar entre els 700W i els 1000.
Memòria i Ample de Banda: El Cor del Rendiment
El punt on la B200 realment treu els músculs és en la gestió de dades. Equipa 180 GB de memòria HBM3e , una quantitat que permet carregar models massius sense haver de recórrer a la fragmentació entre diverses GPUs. Però no és només la capacitat; l' amplada de banda de 8 TB/s és el que marca la diferència, sent gairebé 2,4 vegades superior al de l'H100.
Perquè ens entenguem, la inferència de LLM és bàsicament un problema de lectura de memòria. En generar cada token, la GPU ha de llegir tota la matriu de pesos del model. Amb aquesta amplada de banda, la B200 pot sostenir una velocitat de generació de tokens molt superior, eliminant els retards que solen aparèixer en models de 70B de paràmetres o més.
Potència de Còmput i el Salt a l'FP4
La gran novetat són els nuclis Tensor de 5a generació, que introdueixen el suport natiu per a precisió FP4 . Aquesta capacitat és fonamental perquè permet reduir a la meitat la petjada de memòria comparada amb l'FP8, duplicant efectivament la quantitat de paràmetres que es poden processar. En termes bruts, la B200 arriba als 20 PetaFLOPS a FP4 i 9 PetaFLOPS a FP8.
Si ho comparem amb la generació Hopper, el salt és abismal. Mentre que l'H100 queda curt en precisió baixa, la B200 ofereix un rendiment d' inferència fins a 4 vegades superior . Això es tradueix que el cost per milió de tokens cau en picat, fent que l'operació sigui molt més rendible per a les empreses que serveixen API d'IA a gran escala.
Comparativa Directa: B200 vs H100 i H200
Si et preguntes si val la pena fer el salt, la resposta curta és sí, sempre que els teus models siguin grans. Enfront de l'H100 SXM5, que només té 80 GB de VRAM, la B200 ofereix més del doble de memòria . Això significa que un model Truca 3.1 de 70B a FP16 pot cabre còmodament en una sola targeta, evitant la complexitat del paral·lelisme de tensors.
Fins i tot comparant-la amb la H200, que ja era una millora en memòria (141 GB), la B200 guanya la partida amb un 28% més de VRAM i una amplada de banda un 67% superior. A més, l'interconnector NVLink 5.0 eleva la comunicació bidireccional a 1.8 TB/s, exactament el doble que el NVLink 4.0, cosa que permet un escalat gairebé lineal en configuracions de 8 GPU.
Infraestructura i Requeriments d´Energia
No podem ignorar que moure aquesta potència requereix una infraestructura seriosa. Un sistema de 8 GPU B200 pot consumir entre 7 i 8 kW només a l'apartat de processament. Tot i que la refrigeració per aire és viable en racks d'alta densitat molt ben ventilats, es recomana encaridament la refrigeració líquida directa per mantenir la longevitat del maquinari i evitar l'escanyament tèrmic.
Pel que fa a la connectivitat, s'utilitza una interfície PCI-Express 6.0 x16 i l'ecosistema de programari és totalment compatible amb CUDA 12.xi cuDNN 9.x. Qualsevol codi que ja funcioni en un H100 correrà en una B200 sense canvis, encara que per esprémer l'FP4 és necessari utilitzar TensorRT-LLM 0.17+ o versions actualitzades de vLLM.
Anàlisi de Costos i Disponibilitat al Núvol
Al mercat de lloguer de GPU, la B200 s'ha posicionat com una opció molt atractiva. En plataformes com RunPod o Spheron, els preus on-demand solen rondar els 5,89 $ – 9,36 $ per hora, mentre que les instàncies espot poden baixar fins als 5,34 $. Tot i que l'hora sigui més cara que un H100, l' eficiència per token és tan alta que el cost final del servei és molt menor.
Tot i la demanda brutal i que hi ha milions d'unitats en cua d'espera per a compra directa, el núvol és la via més ràpida per accedir a Blackwell. La possibilitat de fer servir facturació per segon permet que els desenvolupadors provin els seus models a FP4 sense haver de comprometre's amb contractes milionaris d'infraestructura física.
La NVIDIA B200 redefineix allò que esperem d'un accelerador d'IA, combinant una memòria HBM3e massiva amb l'innovador suport FP4 i una interconnexió NVLink 5.0 ultraràpida. En superar àmpliament les limitacions d'amplada de banda i capacitat de la sèrie Hopper, es converteix en l'eina definitiva per als que gestionen models de llenguatge de gran escala, optimitzant-ne tant el rendiment d'inferència com els costos operatius per token.