এনভিডিয়া বি২০০ ব্ল্যাকওয়েলের বিশদ বিশ্লেষণ

সর্বশেষ আপডেট: 5 আগস্ট 2026
  • B200 মডেলটি এর ১৮০ জিবি HBM3e মেমোরি এবং ৮ টিবি/সেকেন্ডের বিশাল ব্যান্ডউইথের জন্য বিশেষভাবে উল্লেখযোগ্য।
  • ৫ম প্রজন্মের টেনসর কোর এবং FP4 নির্ভুলতার জন্য নেটিভ সমর্থন সহ ব্ল্যাকওয়েল আর্কিটেকচার উপস্থাপন করা হচ্ছে।
  • এটি ইনফারেন্স পারফরম্যান্সে H100-কে বহুলাংশে ছাড়িয়ে যায় এবং টোকেন প্রতি খরচ ব্যাপকভাবে কমিয়ে আনে।
  • এটি প্রতি জিপিইউ-তে ১.৮ টেরাবাইট/সেকেন্ড গতিতে দ্বিমুখী যোগাযোগ অর্জনের জন্য এনভি-লিঙ্ক ৫.০ ইন্টারকানেক্ট ব্যবহার করে।

এনভিডিয়া বি২০০

আপনি যদি অত্যাধুনিক হার্ডওয়্যারের অনুরাগী হন, তবে ব্ল্যাকওয়েল সিরিজ যে যুগান্তকারী অগ্রগতি এনেছে, সে সম্পর্কে আপনি নিশ্চয়ই ইতিমধ্যেই শুনেছেন । এনভিডিয়া বি২০০ শুধু আরেকটি আপগ্রেড নয়; এটি কৃত্রিম বুদ্ধিমত্তার জন্য মেমরি এবং কম্পিউটিং-এর প্রতিবন্ধকতা দূর করতে বিশেষভাবে ডিজাইন করা একটি শক্তিশালী প্রসেসিং ডিভাইস ।

এই কার্ডটিকে ডেটা সেন্টারের জন্য সেরা সম্পদ হিসেবে উপস্থাপন করা হয়েছে, যা বৃহৎ ল্যাঙ্গুয়েজ মডেল (LLM)-এর বহু পুরনো সমস্যার সমাধানে মনোনিবেশ করে। এর যুগান্তকারী ডিজাইন এবং এমন শক্তি যা এর পূর্বসূরিদেরও লজ্জায় ফেলে দেয়, তার ফলে মাত্র কয়েক বছর আগের তুলনায় B200 মডেলের প্রশিক্ষণ এবং স্থাপনকে অত্যন্ত সহজ করে তুলেছে।

এনভিডিয়া ব্ল্যাকওয়েল-নেক্সট
সম্পর্কিত নিবন্ধ:
এনভিডিয়া ব্ল্যাকওয়েল এবং রুবিন আর্কিটেকচারের পথ

প্রযুক্তিগত বিবরণ এবং অভ্যন্তরীণ স্থাপত্য

অভ্যন্তরীণভাবে, বি২০০ হলো ব্ল্যাকওয়েল আর্কিটেকচারের উপর ভিত্তি করে নির্মিত একটি প্রকৌশলগত শ্রেষ্ঠ নিদর্শন। এটি একটি ডুয়াল-চিপ জিবি১০০ ডিজাইন ব্যবহার করে, যেখানে দুটি ডাই একটি ১০ টিবি/এস চিপ-টু-চিপ ইন্টারকানেক্টের মাধ্যমে সংযুক্ত থাকে, যা অপারেটিং সিস্টেমকে এটিকে একটি একক ইউনিট হিসেবে শনাক্ত করতে সাহায্য করে। এটি টিএসএমসি -র ৪এনপি প্রসেস ব্যবহার করে নির্মিত এবং এতে রয়েছে বিপুল সংখ্যক ২০৮ বিলিয়ন ট্রানজিস্টর।

এর রেন্ডারিং কনফিগারেশনের ক্ষেত্রে, এতে রয়েছে ১৮,৯৪৪টি শেডার ইউনিট, ৫৯২টি টিএমইউ (TMU), এবং ২৪টি আরওপি (ROP)। এর বেস ক্লক স্পিড হলো ১২০ মেগাহার্টজ, কিন্তু এটি ১৮৩০ মেগাহার্টজ পর্যন্ত বুস্ট করতে পারে , এবং এর মেমোরি ২০০০ মেগাহার্টজে কাজ করে। এই বিপুল পরিমাণ পাওয়ার আউটপুটের ফলে এর এসএক্সএম (SXM) ফর্ম ফ্যাক্টরে টিডিপি (TDP) দাঁড়ায় ১০০০ ওয়াট, যদিও পরিবেশের উপর নির্ভর করে কিছু ক্ষেত্রে এটি ৭০০ ওয়াট থেকে ১০০০ ওয়াটের মধ্যে পরিবর্তিত হতে পারে।

  স্মার্ট হোম উন্নয়ন এবং হোম অটোমেশনের সম্পূর্ণ নির্দেশিকা

মেমোরি ও ব্যান্ডউইথ: পারফরম্যান্সের মূল ভিত্তি

B200-এর আসল বিশেষত্ব হলো এর ডেটা ম্যানেজমেন্ট। এতে রয়েছে ১৮০ জিবি HBM3e মেমরি , যা একাধিক জিপিইউ-তে ফ্র্যাগমেন্টেশন ছাড়াই বিশাল মডেল লোড করার সুযোগ দেয়। তবে শুধু ধারণক্ষমতাই নয়; এর ৮ টিবি/সেকেন্ড ব্যান্ডউইথই আসল পার্থক্য গড়ে দেয়, যা H100-এর চেয়ে প্রায় ২.৪ গুণ বেশি।

সহজ কথায় বলতে গেলে, LLM ইনফারেন্স মূলত একটি মেমোরি রিড সমস্যা। প্রতিটি টোকেন তৈরি করার সময়, GPU-কে মডেলের সম্পূর্ণ ওয়েট অ্যারে পড়তে হয়। এই ব্যান্ডউইথের সাহায্যে, B200 অনেক বেশি গতিতে টোকেন তৈরি করতে পারে , যা সাধারণত ৭০ বাইট বা তার বেশি প্যারামিটারযুক্ত মডেলে দেখা যাওয়া বিলম্ব দূর করে।

OpenAI AWS চুক্তি
সম্পর্কিত নিবন্ধ:
OpenAI এবং AWS তাদের AI স্কেল করার জন্য একটি মেগা-চুক্তি স্বাক্ষর করেছে: $38.000 বিলিয়ন, Nvidia চিপস এবং নতুন ক্লাউড মানচিত্র

কম্পিউটিং শক্তি এবং FP4-এ উত্তরণ

এর প্রধান উদ্ভাবন হলো পঞ্চম প্রজন্মের টেনসর কোর, যা FP4 প্রিসিশনের জন্য নেটিভ সাপোর্ট নিয়ে এসেছে । এই সক্ষমতাটি অত্যন্ত গুরুত্বপূর্ণ, কারণ এটি FP8-এর তুলনায় মেমোরি ফুটপ্রিন্ট ৫০% কমিয়ে দেয়, যার ফলে প্রসেস করা যায় এমন প্যারামিটারের সংখ্যা কার্যকরভাবে দ্বিগুণ হয়ে যায়। সাধারণ পরিমাপে, B200 মডেলটি FP4-এ ২০ পেটাফ্লপস এবং FP8-এ ৯ পেটাফ্লপস পারফরম্যান্স অর্জন করে।

হপার প্রজন্মের তুলনায় এই অগ্রগতি বিস্ময়কর। যদিও H100 নিম্ন-প্রিসিশন পারফরম্যান্সে পিছিয়ে আছে, B200 চার গুণ পর্যন্ত ইনফারেন্স পারফরম্যান্স প্রদান করে । এর ফলে প্রতি মিলিয়ন টোকেনের খরচ ব্যাপকভাবে কমে আসে, যা বৃহৎ পরিসরে এআই এপিআই প্রদানকারী সংস্থাগুলোর জন্য এটিকে অনেক বেশি লাভজনক করে তোলে।

  কৃত্রিম বুদ্ধিমত্তা কীভাবে কাজ করে?

সরাসরি তুলনা: B200 বনাম H100 এবং H200

আপনি যদি ভেবে থাকেন যে আপগ্রেড করাটা লাভজনক হবে কিনা, তাহলে এর সংক্ষিপ্ত উত্তর হলো হ্যাঁ, তবে শর্ত হলো আপনার বিল্ডগুলো যেন বড় হয়। মাত্র ৮০ জিবি ভিআরএএম থাকা H100 SXM5-এর তুলনায়, B200 দ্বিগুণেরও বেশি মেমোরি প্রদান করে । এর মানে হলো, টেনসর প্যারালালিজমের জটিলতা এড়িয়ে একটি মাত্র কার্ডেই FP16-এ একটি ৭০-বাইটের Llama 3.1 বিল্ড স্বাচ্ছন্দ্যে এঁটে যাবে।

এমনকি H200-এর সাথে তুলনা করলেও, যা মেমোরির (১৪১ জিবি) দিক থেকে ইতিমধ্যেই একটি উন্নত সংস্করণ ছিল, B200 ২৮% বেশি VRAM এবং ৬৭% উচ্চতর ব্যান্ডউইথের কারণে অনায়াসে জয়ী হয়। অধিকন্তু, NVLink 5.0 ইন্টারকানেক্ট দ্বিমুখী যোগাযোগকে ১.৮ টিবি/সেকেন্ড পর্যন্ত উন্নীত করে, যা NVLink 4.0-এর ঠিক দ্বিগুণ, এবং ৮-জিপিইউ কনফিগারেশনে প্রায়-রৈখিক স্কেলিং সক্ষম করে।

অবকাঠামো এবং শক্তির প্রয়োজনীয়তা

এই বিপুল শক্তি সঞ্চালনের জন্য যে একটি শক্তিশালী পরিকাঠামো প্রয়োজন, সেই সত্যটি আমরা উপেক্ষা করতে পারি না। একটি আটটি জিপিইউ-যুক্ত বি২০০ সিস্টেম শুধুমাত্র প্রসেসিংয়ের কাজেই ৭ থেকে ৮ কিলোওয়াট পর্যন্ত শক্তি খরচ করতে পারে। যদিও ভালোভাবে বায়ু চলাচল করে এমন উচ্চ-ঘনত্বের র‍্যাকে এয়ার কুলিং ব্যবহার করা সম্ভব, হার্ডওয়্যারের দীর্ঘস্থায়িত্ব বজায় রাখতে এবং থার্মাল থ্রটলিং প্রতিরোধ করতে সরাসরি লিকুইড কুলিং ব্যবহারের জন্য জোরালোভাবে সুপারিশ করা হয়।

কানেক্টিভিটির ক্ষেত্রে, এটি একটি PCI-Express 6.0 x16 ইন্টারফেস ব্যবহার করে এবং এর সফটওয়্যার ইকোসিস্টেম CUDA 12.x ও cuDNN 9.x-এর সাথে সম্পূর্ণরূপে সামঞ্জস্যপূর্ণ। যে কোনো কোড যা ইতিমধ্যেই একটি H100-এ কাজ করে, তা কোনো পরিবর্তন ছাড়াই একটি B200-এ চলবে, যদিও FP4 থেকে সেরা পারফরম্যান্স পেতে TensorRT-LLM 0.17+ অথবা vLLM-এর আপডেট করা সংস্করণ ব্যবহার করা আবশ্যক ।

ক্লাউড খরচ এবং প্রাপ্যতা বিশ্লেষণ

জিপিইউ ভাড়ার বাজারে, B200 নিজেকে একটি অত্যন্ত আকর্ষণীয় বিকল্প হিসেবে প্রতিষ্ঠিত করেছে। RunPod বা Spheron-এর মতো প্ল্যাটফর্মে, অন-ডিমান্ড মূল্য সাধারণত প্রতি ঘণ্টায় $5,89 থেকে $9,36 পর্যন্ত হয়ে থাকে, যেখানে স্পট ইনস্ট্যান্সের ক্ষেত্রে এই মূল্য $5,34-এর মতো কমও হতে পারে। যদিও এর ঘণ্টাপ্রতি রেট H100-এর চেয়ে বেশি, কিন্তু প্রতিটি টোকেনের কার্যকারিতা এতটাই বেশি যে এই পরিষেবার চূড়ান্ত খরচ সাধারণত অনেক কম হয়।

  ভাইরাস বা ময়লার কারণে আপনার কম্পিউটার অতিরিক্ত গরম হচ্ছে কিনা তা কীভাবে বুঝবেন

বিপুল চাহিদা এবং সরাসরি ক্রয়ের জন্য লক্ষ লক্ষ ইউনিট অপেক্ষমাণ থাকা সত্ত্বেও, ক্লাউডই ব্ল্যাকওয়েল ব্যবহারের দ্রুততম উপায়। প্রতি-সেকেন্ড বিলিংয়ের বিকল্পটি ডেভেলপারদের বহু-মিলিয়ন ডলারের ভৌত অবকাঠামো চুক্তিতে আবদ্ধ না হয়েই তাদের FP4 মডেল পরীক্ষা করার সুযোগ দেয়।

এনভিডিয়া বি২০০ একটি এআই অ্যাক্সেলারেটর থেকে আমাদের প্রত্যাশাকে নতুনভাবে সংজ্ঞায়িত করে, যা বিশাল এইচবিএম৩ই (HBM3e) মেমোরির সাথে যুগান্তকারী এফপি৪ (FP4) সাপোর্ট এবং অতি দ্রুতগতির এনভি-লিঙ্ক ৫.০ (NVLink 5.0) ইন্টারকানেক্টকে একত্রিত করে। হপার সিরিজের ব্যান্ডউইথ এবং ধারণক্ষমতার সীমাবদ্ধতাকে বহুগুণে ছাড়িয়ে গিয়ে, এটি বৃহৎ আকারের ল্যাঙ্গুয়েজ মডেল পরিচালনাকারীদের জন্য একটি চূড়ান্ত টুলে পরিণত হয়, যা ইনফারেন্স পারফরম্যান্স এবং প্রতি টোকেনের অপারেটিং খরচ উভয়কেই অপ্টিমাইজ করে।