- B200 се откроява със своите 180 GB HBM3e памет и огромна пропускателна способност от 8 TB/s.
- Представяме ви архитектурата Blackwell с 5-то поколение Tensor ядра и вградена поддръжка за точност на FP4.
- Той далеч превъзхожда H100 по отношение на производителността на извода, драстично намалявайки цената на токен.
- Използва NVLink 5.0 интерконектора, за да постигне двупосочна комуникация от 1.8 TB/s на графичен процесор.
Ако сте запалени по най-съвременния хардуер, със сигурност вече сте чували за квантовия скок, който представлява серията Blackwell . NVIDIA B200 не е просто поредно подобрение; това е процесорен звяр, специално проектиран да елиминира затрудненията в паметта и изчисленията за изкуствения интелект.
Тази карта е представена като перлата в короната за центрове за данни, фокусирайки се върху решаването на вековния проблем с големите езикови модели (LLM). С революционен дизайн и мощност, които засрамват предшествениците си, B200 прави обучението и внедряването на модели изключително лесно в сравнение с това, което правехме само преди няколко години.
Технически спецификации и вътрешна архитектура
Под капака, B200 е инженерен шедьовър, базиран на архитектурата Blackwell. Той използва двучипов GB100 дизайн, където два чипа са свързани чрез 10 TB/s чип-към-чип връзка, което позволява на операционната система да го разпознае като едно цяло. Произведен е с помощта на 4NP процеса на TSMC и съдържа астрономическите 208.000 милиарда транзистора.
Що се отнася до конфигурацията му за рендериране, той разполага с 18 944 шейдърни единици, 592 TMU и 24 ROP. Базовата му тактова честота е 120 MHz, но може да се увеличи до 1830 MHz , докато паметта работи на 2000 MHz. Цялата тази изходна мощност води до TDP от 1000 W във форм-фактора му SXM, въпреки че някои реализации могат да варират между 700 W и 1000 W в зависимост от средата.
Памет и пропускателна способност: Сърцето на производителността
Това, където B200 наистина блести, е в управлението на данните. Той може да се похвали със 180 GB HBM3e памет , количество, което позволява зареждането на масивни модели, без да се прибягва до фрагментация между множество графични процесори. Но не само капацитетът; честотната лента от 8 TB/s е това, което прави разликата, като е почти 2,4 пъти по-голяма от тази на H100.
Казано по-просто, LLM изводът е по същество проблем с четенето на паметта. При генериране на всеки токен, графичният процесор трябва да прочете целия масив от тегла на модела. С тази честотна лента, B200 може да поддържа много по-висока скорост на генериране на токени , елиминирайки закъсненията, които обикновено се появяват в модели със 70B параметри или повече.
Изчислителната мощност и преходът към FP4
Основната иновация са 5-то поколение Tensor ядра, които въвеждат вградена поддръжка за прецизност на FP4 . Тази възможност е от решаващо значение, защото позволява 50% намаляване на паметта в сравнение с FP8, като ефективно удвоява броя на параметрите, които могат да бъдат обработени. В суров вид B200 постига 20 PetaFLOPS в FP4 и 9 PetaFLOPS в FP8.
В сравнение с поколението Hopper, скокът е потресаващ. Докато H100 не е достатъчно прецизен при работа с ниска точност, B200 предлага до четири пъти по-висока производителност при извод . Това се изразява в драстично по-ниска цена на милион токена, което го прави много по-изгоден за компании, обслужващи AI API в голям мащаб.
Директно сравнение: B200 срещу H100 и H200
Ако се чудите дали си струва да направите надстройката, краткият отговор е „да“, стига вашите компилации да са големи. В сравнение с H100 SXM5, който има само 80GB VRAM, B200 предлага повече от два пъти повече памет . Това означава, че 70B Llama 3.1 компилация в FP16 може удобно да се побере на една карта, избягвайки сложността на тензорния паралелизъм.
Дори в сравнение с H200, който вече беше подобрение по отношение на паметта (141 GB), B200 печели безспорно с 28% повече VRAM и 67% по-висока честотна лента. Освен това, NVLink 5.0 интерконекторът увеличава двупосочната комуникация до 1.8 TB/s, точно двойно повече от NVLink 4.0, което позволява почти линейно мащабиране в конфигурации с 8 графични процесора.
Инфраструктурни и енергийни изисквания
Не можем да пренебрегнем факта, че преместването на такава мощност изисква сериозна инфраструктура. Система B200 с осем графични процесора може да консумира между 7 и 8 kW само за обработка. Въпреки че въздушното охлаждане е осъществимо в добре вентилирани шкафове с висока плътност, директното течно охлаждане е силно препоръчително , за да се поддържа дълготрайността на хардуера и да се предотврати термично дроселиране.
По отношение на свързаността, той използва PCI-Express 6.0 x16 интерфейс , а софтуерната екосистема е напълно съвместима с CUDA 12.x и cuDNN 9.x. Всеки код, който вече работи на H100, ще работи на B200 без промени, въпреки че за да се извлече максимума от FP4, е необходимо да се използва TensorRT-LLM 0.17+ или актуализирани версии на vLLM.
Анализ на разходите и наличността на облачни услуги
На пазара за отдаване под наем на графични процесори, B200 се позиционира като много атрактивен вариант. На платформи като RunPod или Spheron, цените за on-demand обикновено варират от $5,89 до $9,36 на час, докато spot инстанциите могат да паднат до $5,34. Въпреки че почасовата ставка е по-висока от тази на H100, ефективността на токен е толкова висока, че крайната цена на услугата обикновено е много по-ниска.
Въпреки огромното търсене и милионите устройства, чакащи директно закупуване, облакът е най-бързият начин за достъп до Blackwell. Опцията за таксуване на секунда позволява на разработчиците да тестват своите FP4 модели, без да се обвързват с многомилионни договори за физическа инфраструктура.
NVIDIA B200 предефинира очакванията ни от един AI ускорител, комбинирайки масивна HBM3e памет с революционна FP4 поддръжка и ултрабърза NVLink 5.0 връзка. Надминавайки значително ограниченията на пропускателната способност и капацитета на серията Hopper, той се превръща в най-добрия инструмент за тези, които управляват мащабни езикови модели, оптимизирайки както производителността на извода, така и оперативните разходи на токен.