- ה-B200 בולט בזכות 180 ג'יגה-בייט של זיכרון HBM3e ורוחב פס עצום של 8 טרה-בייט/שנייה.
- הצגת ארכיטקטורת Blackwell עם ליבות Tensor מדור חמישי ותמיכה מובנית בדיוק FP4.
- הוא עולה בהרבה על ה-H100 בביצועי הסקה, ומפחית באופן דרסטי את העלות לכל אסימון.
- הוא משתמש בחיבור NVLink 5.0 כדי להשיג תקשורת דו כיוונית של 1.8 טרה-בייט/שנייה לכל GPU.
אם אתם נלהבים מחומרה מתקדמת, בוודאי כבר שמעתם על קפיצת הדרך הקוונטית שמייצגת סדרת Blackwell . ה-NVIDIA B200 אינו סתם עוד שדרוג; זוהי מפלצת עיבוד שתוכננה במיוחד כדי לחסל צווארי בקבוק בזיכרון ובמחשוב עבור בינה מלאכותית.
כרטיס זה מוצג כיהלום שבכתר עבור מרכזי נתונים, ומתמקד בפתרון הבעיה עתיקת היומין של מודלים לשוניים גדולים (LLM). עם עיצוב וכוח פורצים שמביישים את קודמיו, ה-B200 הופך את אימון ופריסת המודלים לקלים בהשוואה למה שעשינו רק לפני כמה שנים.
מפרט טכני וארכיטקטורה פנימית
מתחת למכסה המנוע, ה-B200 הוא יצירת מופת הנדסית המבוססת על ארכיטקטורת Blackwell. הוא משתמש בתכנון GB100 בעל שני שבבים , שבו שני שבבים מחוברים באמצעות חיבור שבב-לשבב של 10 טרה-בייט לשנייה, המאפשר למערכת ההפעלה לזהות אותו כיחידה אחת. הוא מיוצר באמצעות תהליך 4NP של TSMC ומכיל 208.000 מיליארד טרנזיסטורים אסטרונומיים.
מבחינת תצורת הרינדור שלו, הוא כולל 18.944 יחידות שיידר, 592 יחידות TMU ו-24 יחידות ROP. מהירות השעון הבסיסית שלו היא 120 מגה-הרץ, אך הוא יכול להגביר אותו עד 1830 מגה-הרץ , בעוד שהזיכרון פועל בתדר 2000 מגה-הרץ. כל תפוקת ההספק הזו מביאה ל-TDP של 1000 וואט בגורם הצורה SXM שלו, אם כי חלק מהיישומים עשויים לנוע בין 700 וואט ל-1000 וואט בהתאם לסביבה.
זיכרון ורוחב פס: לב הביצועים
המקום שבו ה-B200 באמת בולט הוא בניהול הנתונים שלו. הוא מתגאה ב -180 ג'יגה-בייט של זיכרון HBM3e , כמות המאפשרת טעינת מודלים גדולים מבלי להזדקק לפיצול על פני מספר כרטיסי מסך. אבל זו לא רק הקיבולת; רוחב הפס של 8 טרה-בייט לשנייה הוא מה שעושה את ההבדל, והוא גדול כמעט פי 2,4 מזה של ה-H100.
במילים פשוטות, הסקת LLM היא למעשה בעיית קריאת זיכרון. בעת יצירת כל אסימון, ה-GPU חייב לקרוא את כל מערך המשקלים של המודל. עם רוחב פס זה, ה-B200 יכול לעמוד במהירות יצירת אסימון גבוהה בהרבה , ובכך לבטל את העיכובים המופיעים בדרך כלל במודלים עם 70B של פרמטרים או יותר.
כוח מחשוב והקפיצה ל-FP4
החידוש העיקרי הוא ליבות Tensor מהדור החמישי, המציגות תמיכה מובנית בדיוק FP4 . יכולת זו חיונית משום שהיא מאפשרת הפחתה של 5% בטביעת רגל של הזיכרון בהשוואה ל-FP8, ובכך למעשה מכפילה את מספר הפרמטרים שניתן לעבד. במונחים גולמיים, ה-B200 משיג 20 PetaFLOPS ב-FP4 ו-9 PetaFLOPS ב-FP8.
בהשוואה לדור ה-Hopper, הקפיצה מדהימה. בעוד ש-H100 לוקה בחסר מבחינת ביצועים בדיוק נמוך, ה-B200 מציע ביצועי הסקה טובים עד פי ארבעה . משמעות הדבר היא עלות נמוכה משמעותית לכל מיליון טוקנים, מה שהופך אותו לרווחי הרבה יותר עבור חברות המספקות ממשקי API של בינה מלאכותית בקנה מידה גדול.
השוואה ישירה: B200 לעומת H100 ו-H200
אם אתם תוהים האם כדאי לבצע את השדרוג, התשובה הקצרה היא כן, בתנאי שהמחשבים שלכם גדולים. בהשוואה ל-H100 SXM5, שיש לו רק 80GB של VRAM, ה-B200 מציע יותר מכפול זיכרון . משמעות הדבר היא ש-70GB Llama 3.1 ב-FP16 יכול להתאים בנוחות לכרטיס יחיד, תוך הימנעות מהמורכבות של מקבילות טנזור.
אפילו בהשוואה ל-H200, שכבר היה שיפור בזיכרון (141 ג'יגה-בייט), ה-B200 מנצח ללא ספק עם 28% יותר VRAM ו-67% יותר רוחב פס. יתר על כן, חיבור NVLink 5.0 מגביר את התקשורת הדו-כיוונית ל-1.8 טרה-בייט/שנייה, בדיוק כפול מזה של NVLink 4.0, ומאפשר קנה מידה כמעט ליניארי בתצורות של 8 GPU.
דרישות תשתית ואנרגיה
איננו יכולים להתעלם מהעובדה שהעברת כוח כזה דורשת תשתית רצינית. מערכת B200 עם שמונה כרטיסי מסך יכולה לצרוך בין 7 ל-8 קילוואט בעיבוד בלבד. בעוד שקירור אוויר אפשרי בארונות תקשורת מאווררים היטב ובעלי צפיפות גבוהה, קירור נוזלי ישיר מומלץ מאוד כדי לשמור על אורך חיים של החומרה ולמנוע ויסות תרמי.
מבחינת קישוריות, הוא משתמש בממשק PCI-Express 6.0 x16 , ומערכת האקולוגית של התוכנה תואמת לחלוטין ל-CUDA 12.x ול-cuDNN 9.x. כל קוד שכבר עובד על H100 יפעל על B200 ללא שינויים, אם כי כדי להפיק את המרב מ-FP4, יש צורך להשתמש ב- TensorRT-LLM 0.17+ או בגרסאות מעודכנות של vLLM.
ניתוח עלויות וזמינות בענן
בשוק השכרת כרטיסי המסך, ה-B200 מיצב את עצמו כאופציה אטרקטיבית מאוד. בפלטפורמות כמו RunPod או Spheron, מחירי ה-on-demand נעים בדרך כלל בין 5,89$ ל-9,36$ לשעה, בעוד ש- spot instances יכולים לרדת עד ל-5,34$. למרות שהתעריף השעתי גבוה יותר מזה של H100, היעילות לכל טוקן כה גבוהה שהעלות הסופית של השירות בדרך כלל נמוכה בהרבה.
למרות ביקוש עצום ומיליוני יחידות בצבר הזמנות לרכישה ישירה, הענן הוא הדרך המהירה ביותר לגשת לבלקוול. אפשרות החיוב לפי שנייה מאפשרת למפתחים לבחון את מודלי FP4 שלהם מבלי להתחייב לחוזי תשתית פיזית בשווי מיליוני דולרים.
ה-NVIDIA B200 מגדיר מחדש את מה שאנו מצפים ממאיץ בינה מלאכותית, ומשלב זיכרון HBM3e עצום עם תמיכה פורצת דרך ב-FP4 וחיבור NVLink 5.0 מהיר במיוחד. הוא עולה בהרבה על מגבלות רוחב הפס והקיבולת של סדרת Hopper, והופך לכלי האולטימטיבי עבור אלו המנהלים מודלי שפה בקנה מידה גדול, תוך אופטימיזציה של ביצועי הסקה ועלויות תפעול לכל טוקן.