Свеобухватна анализа NVIDIA B200 Blackwell-а

Последње ажурирање: КСНУМКС августа КСНУМКС
  • B200 се истиче по својих 180 GB HBM3e меморије и огромном пропусном опсегу од 8 TB/s.
  • Представљамо Blackwell архитектуру са Tensor језгрима 5. генерације и изворном подршком за FP4 тачност.
  • Далеко надмашује H100 у перформансама закључивања, драстично смањујући цену по токену.
  • Користи NVLink 5.0 интерконекцију за постизање двосмерне комуникације од 1.8 TB/s по GPU-у.

НВИДИА Б200

Ако сте страствени љубитељ најсавременијег хардвера, сигурно сте већ чули за квантни скок који представља серија Blackwell . NVIDIA B200 није само још једно надоградња; то је звер за обраду података посебно дизајнирана да елиминише уска грла у меморији и израчунавању за вештачку интелигенцију.

Ова картица је представљена као крунски драгуљ за центре података, фокусирајући се на решавање вековног проблема великих језичких модела (LLM). Са револуционарним дизајном и снагом која посрамљује своје претходнике, B200 чини обуку и имплементацију модела лаким у поређењу са оним што смо радили пре само неколико година.

NVIDIA Blackwell-Next
Повезани чланак:
NVIDIA Blackwell и пут до Rubin архитектуре

Техничке спецификације и унутрашња архитектура

Испод хаубе, B200 је инжењерско ремек-дело засновано на Blackwell архитектури. Користи двочипни GB100 дизајн, где су два кристала спојена преко чип-чип интерконекције од 10 TB/s, што омогућава оперативном систему да га препозна као једну јединицу. Произведен је коришћењем TSMC -овог 4NP процеса и садржи астрономских 208.000 милијарди транзистора.

Што се тиче конфигурације рендеровања, има 18.944 шејдер јединице, 592 TMU и 24 ROP-а. Његова основна брзина такта је 120 MHz, али се може појачати до 1830 MHz , док меморија ради на 2000 MHz. Сва ова излазна снага резултира TDP-ом од 1000 W у његовом SXM форм фактору, иако неке имплементације могу варирати између 700 W и 1000 W у зависности од окружења.

  Комплетан водич за паметна побољшања дома и кућну аутоматизацију

Меморија и пропусни опсег: срж перформанси

Оно где B200 заиста блиста јесте у управљању подацима. Може се похвалити са 180 GB HBM3e меморије , количином која омогућава учитавање огромних модела без прибегавања фрагментацији на више графичких процесора. Али није само капацитет; пропусни опсег од 8 TB/s је оно што прави разлику, што је скоро 2,4 пута већи од оног код H100.

Једноставно речено, LLM инференција је у суштини проблем читања меморије. Приликом генерисања сваког токена, GPU мора да прочита цео низ тежина модела. Са овим пропусним опсегом, B200 може да одржи много већу брзину генерисања токена , елиминишући кашњења која се обично јављају код модела са 70B параметара или више.

Споразум о OpenAI AWS-у
Повезани чланак:
OpenAI и AWS потписују мега-уговор за скалирање своје вештачке интелигенције: 38.000 милијарди долара, Nvidia чипови и нова мапа облака

Рачунарска снага и прелазак на FP4

Главна иновација су Тензор језгра 5. генерације, која уводе изворну подршку за прецизност FP4 . Ова могућност је кључна јер омогућава смањење меморијског отиска за 50% у поређењу са FP8, ефикасно удвостручујући број параметара који се могу обрадити. У сировом смислу, B200 постиже 20 PetaFLOPS-а у FP4 и 9 PetaFLOPS-а у FP8.

У поређењу са Hopper генерацијом, скок је запањујући. Док H100 заостаје по питању перформанси са ниском прецизношћу, B200 нуди до четири пута боље перформансе у закључивању . То се преводи у драстично нижу цену по милиону токена, што га чини далеко профитабилнијим за компаније које пружају AI API-је у великим размерама.

  Како функционише вештачка интелигенција?

Директно поређење: B200 vs H100 и H200

Ако се питате да ли се исплати надоградња, кратак одговор је да, под условом да су ваше верзије велике. У поређењу са H100 SXM5, који има само 80GB VRAM-а, B200 нуди више него двоструко више меморије . То значи да се 70B Llama 3.1 верзија у FP16 може удобно сместити на једну картицу, избегавајући сложеност тензорског паралелизма.

Чак и у поређењу са H200, који је већ био побољшање у погледу меморије (141 GB), B200 убедљиво побеђује са 28% више VRAM- а и 67% већим пропусним опсегом. Штавише, NVLink 5.0 интерконекција појачава двосмерну комуникацију на 1.8 TB/s, тачно двоструко више од NVLink 4.0, омогућавајући скоро линеарно скалирање у конфигурацијама са 8 GPU-а.

Инфраструктурни и енергетски захтеви

Не можемо игнорисати чињеницу да пренос такве снаге захтева озбиљну инфраструктуру. Систем B200 са осам графичких процесора може потрошити између 7 и 8 kW само у процесу обраде. Иако је ваздушно хлађење одрживо у добро вентилираним рековима високе густине, директно течно хлађење се снажно препоручује како би се одржао век трајања хардвера и спречило термално тротлинговање.

Што се тиче повезивања, користи PCI-Express 6.0 x16 интерфејс , а софтверски екосистем је потпуно компатибилан са CUDA 12.x и cuDNN 9.x. Било који код који већ ради на H100 ће радити на B200 без промена, мада је да би се извукао максимум из FP4 потребно користити TensorRT-LLM 0.17+ или ажуриране верзије vLLM-а.

Анализа трошкова и доступности облака

На тржишту изнајмљивања графичких процесора (GPU), B200 се позиционирао као веома атрактивна опција. На платформама попут RunPod или Spheron, цене на захтев се обично крећу од 5,89 до 9,36 долара по сату, док спот инстанце могу пасти и до 5,34 долара. Иако је сатница виша него код H100, ефикасност по токену је толико висока да је коначна цена услуге обично много нижа.

  Како да препознате да ли се рачунар прегрева због вируса или прљавштине

Упркос огромној потражњи и милионима јединица које чекају директну куповину, облак је најбржи начин за приступ Блеквелу. Опција наплате по секунди омогућава програмерима да тестирају своје FP4 моделе без обавезивања на вишемилионске уговоре о физичкој инфраструктури.

NVIDIA B200 редефинише оно што очекујемо од AI акцелератора, комбинујући масивну HBM3e меморију са револуционарном FP4 подршком и ултрабрзом NVLink 5.0 међусобном везом. Далеко превазилазећи ограничења пропусног опсега и капацитета Hopper серије, постаје врхунски алат за оне који управљају великим језичким моделима, оптимизујући и перформансе закључивања и оперативне трошкове по токену.