- B200, 180 GB HBM3e belleği ve 8 TB/s'lik muazzam bant genişliğiyle öne çıkıyor.
- 5. nesil Tensor çekirdekleri ve FP4 doğruluğuna yerel destek sunan Blackwell mimarisini tanıtıyoruz.
- Çıkarım performansı açısından H100'ü çok geride bırakıyor ve token başına maliyeti önemli ölçüde azaltıyor.
- NVLink 5.0 ara bağlantısını kullanarak, GPU başına 1.8 TB/s hızında çift yönlü iletişim sağlar.
Eğer en yeni donanımlara tutkunsanız, Blackwell serisinin temsil ettiği kuantum sıçramasını mutlaka duymuşsunuzdur . NVIDIA B200 sadece bir yükseltme değil; yapay zeka için bellek ve işlem gücü darboğazlarını ortadan kaldırmak üzere özel olarak tasarlanmış bir işlemci canavarıdır .
Bu kart, veri merkezleri için en değerli ürün olarak sunuluyor ve büyük dil modelleri (LLM) gibi eski bir sorunu çözmeye odaklanıyor. Çığır açan tasarımı ve önceki modellerini geride bırakan gücüyle B200, modellerin eğitilmesini ve dağıtımını, sadece birkaç yıl öncesine kıyasla çok daha kolay hale getiriyor.
Teknik Özellikler ve İç Mimari
B200, kaputun altında Blackwell mimarisine dayalı bir mühendislik şaheseridir. İki yonganın 10 TB/s çip-çip arası bağlantı yoluyla birleştirildiği çift yongalı GB100 tasarımını kullanır ve işletim sisteminin onu tek bir birim olarak tanımasını sağlar. TSMC'nin 4NP prosesi kullanılarak üretilir ve astronomik bir sayı olan 208.000 milyar transistöre ev sahipliği yapar.
İşleme yapılandırmasına gelince, 18.944 shader birimi, 592 TMU ve 24 ROP içeriyor. Temel saat hızı 120 MHz, ancak 1830 MHz'e kadar artırılabiliyor , bellek ise 2000 MHz'de çalışıyor. Tüm bu güç çıkışı, SXM form faktöründe 1000W'lık bir TDP ile sonuçlanıyor, ancak bazı uygulamalar ortama bağlı olarak 700W ile 1000W arasında değişebilir.
Bellek ve Bant Genişliği: Performansın Kalbi
B200'ün gerçekten öne çıktığı nokta veri yönetimidir. 180 GB HBM3e belleğe sahip olan bu işlemci, birden fazla GPU'ya yayılmaya gerek kalmadan büyük modelleri yüklemeye olanak tanır. Ancak fark yaratan sadece kapasite değil; 8 TB/s bant genişliği , H100'ünkinden neredeyse 2,4 kat daha fazladır.
Basitçe ifade etmek gerekirse, LLM çıkarımı esasen bir bellek okuma problemidir. Her bir belirteç oluşturulurken, GPU modelin tüm ağırlık dizisini okumalıdır. Bu bant genişliğiyle, B200 çok daha yüksek bir belirteç oluşturma hızını sürdürebilir ve tipik olarak 70B veya daha fazla parametreye sahip modellerde ortaya çıkan gecikmeleri ortadan kaldırabilir.
Hesaplama Gücü ve FP4'e Geçiş
En önemli yenilik, FP4 hassasiyetine yerel destek sağlayan 5. nesil Tensor çekirdekleridir . Bu özellik çok önemlidir çünkü FP8'e kıyasla bellek kullanımında %50'lik bir azalma sağlayarak işlenebilecek parametre sayısını ikiye katlar. Ham değerler açısından, B200, FP4'te 20 PetaFLOPS ve FP8'de 9 PetaFLOPS performans elde eder.
Hopper nesliyle karşılaştırıldığında, sıçrama inanılmaz. H100 düşük hassasiyetli performansta yetersiz kalırken, B200 dört kata kadar daha yüksek çıkarım performansı sunuyor . Bu da milyon token başına maliyeti önemli ölçüde düşürerek, büyük ölçekte yapay zeka API'leri sunan şirketler için çok daha karlı hale getiriyor.
Doğrudan Karşılaştırma: B200 ile H100 ve H200
Yükseltmenin değip değmeyeceğini merak ediyorsanız, kısa cevap evet, ancak büyük ölçekli projeleriniz olması şartıyla. Sadece 80 GB VRAM'e sahip H100 SXM5 ile karşılaştırıldığında, B200 iki katından fazla bellek sunuyor . Bu, FP16'da 70B'lık bir Llama 3.1 projesinin tek bir karta rahatlıkla sığabileceği ve tensör paralelliğinin karmaşıklığından kaçınılabileceği anlamına geliyor.
Zaten bellek açısından (141 GB) bir iyileştirme sunan H200 ile karşılaştırıldığında bile, B200 %28 daha fazla VRAM ve %67 daha yüksek bant genişliğiyle açık ara önde. Dahası, NVLink 5.0 ara bağlantısı, çift yönlü iletişimi NVLink 4.0'ın tam iki katı olan 1.8 TB/s'ye çıkararak 8 GPU'lu konfigürasyonlarda neredeyse doğrusal ölçeklendirme sağlıyor.
Altyapı ve Enerji Gereksinimleri
Bu kadar gücü taşımak için ciddi bir altyapıya ihtiyaç duyulduğu gerçeğini göz ardı edemeyiz. Sekiz GPU'lu bir B200 sistemi, yalnızca işlem gücü tüketiminde 7 ila 8 kW arasında güç tüketebilir. İyi havalandırılmış, yüksek yoğunluklu raflarda hava soğutma uygulanabilir olsa da, donanımın ömrünü uzatmak ve termal kısıtlamayı önlemek için doğrudan sıvı soğutma şiddetle tavsiye edilir.
Bağlantı açısından PCI-Express 6.0 x16 arayüzünü kullanır ve yazılım ekosistemi CUDA 12.x ve cuDNN 9.x ile tamamen uyumludur. H100 üzerinde zaten çalışan herhangi bir kod, B200 üzerinde değişiklik yapılmadan çalışacaktır; ancak FP4'ten en iyi şekilde yararlanmak için TensorRT-LLM 0.17+ veya vLLM'nin güncellenmiş sürümlerini kullanmak gereklidir .
Bulut Maliyeti ve Erişilebilirlik Analizi
GPU kiralama pazarında B200, oldukça cazip bir seçenek olarak kendini konumlandırdı. RunPod veya Spheron gibi platformlarda, talep üzerine fiyatlar genellikle saatte 5,89 ila 9,36 dolar arasında değişirken, anlık kullanım fiyatları 5,34 dolara kadar düşebiliyor. Saatlik ücret H100'den daha yüksek olsa da, token başına verimlilik o kadar yüksek ki, hizmetin nihai maliyeti genellikle çok daha düşük oluyor.
Yoğun talebe ve doğrudan satın alma için milyonlarca adetlik sipariş birikimine rağmen, bulut Blackwell'e erişmenin en hızlı yoludur. Saniye başına faturalandırma seçeneği, geliştiricilerin milyonlarca dolarlık fiziksel altyapı sözleşmelerine girmeden FP4 modellerini test etmelerine olanak tanır.
NVIDIA B200, devasa HBM3e belleği, çığır açan FP4 desteği ve ultra hızlı NVLink 5.0 ara bağlantısını birleştirerek yapay zeka hızlandırıcılarından beklentilerimizi yeniden tanımlıyor. Hopper serisinin bant genişliği ve kapasite sınırlamalarını çok aşan bu ürün, büyük ölçekli dil modellerini yönetenler için en üstün araç haline geliyor ve hem çıkarım performansını hem de belirteç başına işletme maliyetlerini optimize ediyor.