Google TPU v7 Ironwood คืออะไร และเหตุใดจึงเปลี่ยนแปลง AI?

การปรับปรุงครั้งล่าสุด: 27 de Noviembre เดอ 2025
  • Google TPU v7 Ironwood เป็น TPU รุ่นที่เจ็ดและได้รับการออกแบบมาโดยเฉพาะสำหรับยุคอนุมาน โดยมี FP8 อยู่ที่ 4.614 TFLOP และ HBM3e 192 GB ต่อชิป
  • สถาปัตยกรรมนี้รองรับชิปได้สูงสุดถึง 9.216 ชิปในซูเปอร์พอดพร้อมหน่วยความจำร่วม 1,77 PB เครือข่าย ICI 9,6 Tb/s และระบบระบายความร้อนด้วยของเหลวที่ปรับให้เหมาะสมสำหรับเกือบ 10 MW
  • เมื่อรวมเข้ากับ AI Hypercomputer ร่วมกับ CPU ของ Axion แล้ว Ironwood จะให้ความสมดุลที่แข็งแกร่งระหว่างประสิทธิภาพ ประสิทธิภาพการใช้พลังงาน และต้นทุนสำหรับเวิร์กโหลด AI ขนาดใหญ่
  • สัญญาขนาดใหญ่กับ Anthropic และกลยุทธ์การบูรณาการแนวตั้งช่วยเสริมบทบาทของ Google ในฐานะคู่แข่งสำคัญของ Nvidia ในตลาดชิป AI

Google TPU v7 Ironwood

การพัฒนาปัญญาประดิษฐ์ (AI) กำลังเปลี่ยนแปลงไป อย่างรวดเร็ว การฝึกฝนโมเดลขนาดใหญ่และโอ้อวดพารามิเตอร์ของมันนั้นไม่เพียงพออีกต่อไปแล้ว ตอนนี้ความท้าทายที่แท้จริงคือการทำให้มันทำงานได้ทุกวันสำหรับผู้ใช้หลายล้านคน โดยที่ ต้นทุน ด้านพลังงานและโครงสร้างพื้นฐานของ AIไม่พุ่งสูงขึ้น ในบริบทนี้ Google TPU v7 Ironwood จึงถือกำเนิดขึ้น ฮาร์ดแวร์ชิ้นนี้ได้รับการออกแบบมาสำหรับ AI ที่ไม่เพียงแต่ตอบสนอง แต่ยังคิด วิเคราะห์ และลงมือทำอย่างต่อเนื่องอีกด้วย

Ironwood คือหน่วยประมวลผล Tensor Processing Unit (TPU)รุ่นที่เจ็ดของ Googleและตามที่บริษัทเองระบุไว้ มันคือชิปที่ทรงพลัง ปรับขนาดได้ และมีประสิทธิภาพมากที่สุดเท่าที่เคยมีมา มันถูกออกแบบมาสำหรับสิ่งที่เรียกว่า "ยุคแห่งการอนุมาน" ซึ่งสิ่งที่สำคัญไม่ใช่ระยะเวลาในการฝึกโมเดลใหม่ แต่เป็นต้นทุนในการให้บริการ การรักษาให้โมเดลทำงานได้อย่างต่อเนื่อง การประมวลผล และการสร้างผลลัพธ์ตลอด 24 ชั่วโมง มาดูกันอย่างละเอียดว่า Google TPU v7 Ironwood คืออะไร อะไรที่ทำให้มันพิเศษ และทำไมมันถึงกำลังสร้างความเปลี่ยนแปลงครั้งใหญ่ให้กับอุตสาหกรรมนี้ เมื่อเทียบกับ Nvidia และยักษ์ใหญ่รายอื่น ๆ

Google TPU v7 Ironwood คืออะไร และเหตุใดจึงสำคัญมาก?

Ironwood เป็นตัวเร่งความเร็ว AI ที่ Google สร้างขึ้นเป็นพิเศษเพื่อใช้กับโมเดลปัญญาประดิษฐ์ล้ำสมัย มันอยู่ในตระกูลหน่วยประมวลผลเทนเซอร์ (TPU) ซึ่งเป็นชิปที่ออกแบบมาโดยเฉพาะสำหรับงานด้านการเรียนรู้ของเครื่อง และถูกใช้งานในบริการภายในของ Google (การค้นหา YouTube โฆษณา การแปล ฯลฯ) มาเกือบสิบปีแล้ว และล่าสุดก็ถูกนำมาใช้ในโซลูชัน Google Cloud ด้วย

หน่วยประมวลผล TPU รุ่นที่เจ็ดนี้สร้างขึ้นจากประสบการณ์ทั้งหมดที่สะสมมาจากหน่วยประมวลผล TPU รุ่นก่อนๆ โดยมีเป้าหมายที่ชัดเจนคือการเพิ่มประสิทธิภาพสูงสุดในงานอนุมานและการให้เหตุผลที่ซับซ้อนโดยไม่ลดทอนความสามารถในการฝึกฝน โมเดลภาษาขนาดใหญ่ (LLMs), การผสมผสานของผู้เชี่ยวชาญ, ระบบเรียกคืนข้อมูลแบบเสริม และเอเจนต์ AIที่ต้องการเก็บรักษาบริบทจำนวนมากไว้ในหน่วยความจำ คือประเภทของภาระงานที่ Ironwood ออกแบบมาเพื่อรองรับ

แทนที่จะเป็นเพียง “ชิปที่เร็วกว่า” Ironwood ถูกผสานรวมเข้ากับ สถาปัตยกรรม AI Hypercomputer ของ Google Cloudซึ่งเป็นแนวทางที่การประมวลผล การเชื่อมต่อเครือข่าย การจัดเก็บข้อมูล และซอฟต์แวร์ได้รับการออกแบบร่วมกัน これにより ทำให้สามารถปรับแต่งได้อย่างละเอียดตั้งแต่ระดับซิลิคอนไปจนถึงตัวจัดการคอนเทนเนอร์ เพื่อดึงประสิทธิภาพสูงสุดจากทุกวัตต์และทุกรอบสัญญาณนาฬิกา

อีกประเด็นสำคัญคือ Ironwood เป็นTPU ตัวแรกที่ได้รับการออกแบบตั้งแต่เริ่มต้นเพื่อยุคแห่งการอนุมานจนถึงปัจจุบัน ระบบ AI ส่วนใหญ่ได้รับการออกแบบมาเพื่อฝึกฝนโมเดลขนาดใหญ่เป็นหลัก แต่ตอนนี้จุดสนใจกำลังเปลี่ยนไปสู่การเรียกใช้โมเดลเหล่านั้นอย่างมีประสิทธิภาพซ้ำๆ ด้วยเอเจนต์ที่ไม่เพียงแต่ตอบสนอง แต่ยังคาดการณ์ ค้นหาข้อมูล ผสานรวมข้อมูล และส่งข้อสรุปกลับมาด้วย

สถาปัตยกรรม TPU v7 Ironwood

คุณสมบัติทางเทคนิคหลักของ TPU v7 Ironwood

ในด้านเทคนิค Ironwood มีตัวเลขที่น่าประทับใจ แม้ในตลาดชิป AI ที่มีการแข่งขันสูงก็ตาม ชิปแต่ละตัวให้กำลังการประมวลผลความแม่นยำสูงแบบ FP8 ถึง 4.614 teraflopsซึ่งมากกว่ากำลังการประมวลผลของ TPU v4 ถึง 16 เท่า และเป็นการก้าวกระโดดครั้งใหญ่เมื่อเทียบกับรุ่นก่อนๆ

เพื่อรองรับความสามารถในการประมวลผลมหาศาลนี้ ชิปแต่ละตัวจึงผสานรวมหน่วยความจำ HBM3e รุ่นใหม่ขนาด 192 GBซึ่งมีแบนด์วิดท์ประมาณ 7,3-7,4 TB/s การผสมผสานระหว่างการประมวลผลความเร็วสูงและหน่วยความจำนี้เองที่ทำให้สามารถจัดการกับโมเดลขนาดใหญ่และบริบทที่ยาวมากได้โดยไม่เกิดปัญหาคอขวด

ชิป Ironwood ผลิตโดยใช้กระบวนการผลิตขั้นสูงระดับ 5 นาโนเมตรและใช้พลังงานประมาณ 600 วัตต์ต่อชิป ซึ่งอาจฟังดูสูง แต่เมื่อเทียบกับประสิทธิภาพต่อวัตต์แล้ว ผลลัพธ์ที่ได้ถือว่ายอดเยี่ยมมาก เมื่อเทียบกับ Trillium รุ่นก่อนหน้า (TPU v6e) แล้วIronwood มีประสิทธิภาพต่อวัตต์เพิ่มขึ้นเป็นสองเท่า

การปรับปรุงเหล่านี้เห็นได้ชัดเจนทั้งในด้านการฝึกอบรมและภาระงานด้านการให้บริการ สำหรับการฝึกอบรม Ironwood สามารถเร่งความเร็วในการประมวลผลโมเดลรุ่นใหม่ (เช่น Gemini หรือ Veo) และโมเดลจากผู้จำหน่ายรายอื่น ๆ และสำหรับการให้บริการนั้น ช่วยให้สามารถ เรียกใช้ การประมวลผลแบบอนุมานขนาดใหญ่ได้ด้วยต้นทุนด้านพลังงานที่ต่ำลง ซึ่งเป็นสิ่งสำคัญอย่างยิ่งในปัจจุบันที่ศูนย์ข้อมูล AI มีขนาดเป็นกิกะวัตต์

ซูเปอร์พอด ไอรอนวูด

จากชิปสู่ซูเปอร์พอด: Ironwood ปรับขนาดอย่างไร

ความมหัศจรรย์ที่แท้จริงของ Ironwood ไม่ได้อยู่ที่ชิปเพียงตัวเดียว แต่在于วิธีการขยายขนาดเพื่อสร้างซูเปอร์คอมพิวเตอร์ AIแต่ละ Ironwood SoC ถูกติดตั้งบนแผงวงจรพิมพ์ (PCBA) ที่มีชิปสี่ตัว และแต่ละแร็คจะรวมบอร์ดเหล่านี้ 16 บอร์ด ทำให้มีชิปทั้งหมด 64 ตัวต่อแร็ค

  ChatGPT Go เทียบกับ Plus: ความแตกต่าง ราคา ข้อจำกัด และคุ้มค่าสำหรับใคร

จากนั้น แร็คต่างๆ จะถูกจัดกลุ่มเข้าด้วยกันเพื่อสร้างเป็นIronwood Superpod Superpod ที่สมบูรณ์ประกอบด้วยแร็ค 144 แร็ค ซึ่งเทียบเท่ากับชิปที่เชื่อมต่อกัน 9.216 ตัว โดยรวมแล้ว นี่หมายถึงประสิทธิภาพ FP8 ประมาณ 42,5 exaflops และหน่วยความจำ HBM ที่ใช้ร่วมกันประมาณ 1,77 เพตาไบต์ ซึ่งทั้งหมดนี้สามารถเข้าถึงได้ในฐานะทรัพยากรเชิงตรรกะขนาดใหญ่สำหรับโมเดล AI

การเชื่อมต่อระหว่างชิปทำได้ผ่าน เครือข่าย Inter-Chip Interconnect (ICI)ด้วยการออกแบบ 3D Torus (4x4x4) และความเร็วสูงสุดถึง 9,6 Tb/s โครงสร้างนี้ช่วยลดความหน่วงและรักษาอัตราการถ่ายโอนข้อมูลสูงแม้ว่าระบบจะขยายขนาดไปถึงตัวเร่งความเร็วหลายพันตัว ซึ่งเป็นสิ่งสำคัญสำหรับการฝึกอบรมแบบกระจายและการประมวลผลแบบขนานสูง

นอกเหนือจากซูเปอร์พอดแล้ว โครงสร้างพื้นฐานยังสามารถขยายเพิ่มเติมได้โดยการรวมบล็อกของชิปที่เชื่อมต่อกัน 64 ตัวและเชื่อมโยงเข้าด้วยกันผ่านโครงข่ายใยแก้วนำแสงที่มีความเร็วสูงสุดถึง 1,8 เพตาไบต์ต่อวินาที การผสมผสานระหว่างสายทองแดงแบบพาสซีฟ ใยแก้วนำแสง และสวิตช์ใยแก้วนำแสงนี้ มอบความยืดหยุ่นอย่างมหาศาลในการกำหนดค่าคลัสเตอร์แบบกำหนดเองสำหรับลูกค้าและรุ่นต่างๆ

ในแง่ของกำลังไฟฟ้า ระบบขนาดนี้ใช้กำลังไฟฟ้าเกือบ 10 เมกะวัตต์ซึ่งเป็นตัวเลขที่ทำให้จำเป็นต้องให้ความสำคัญกับการระบายความร้อนและประสิทธิภาพเป็นอย่างมาก แต่ละแร็คได้รับการออกแบบให้ใช้พลังงานเกิน 100 กิโลวัตต์ ดังนั้นระบบทั้งหมดจึงได้รับการออกแบบตั้งแต่เริ่มต้นเพื่อรองรับการระบายความร้อนด้วยของเหลวและการกระจายพลังงานขั้นสูง

โครงสร้างพื้นฐานการระบายความร้อน TPU ของ Ironwood

การทำความเย็น การบริโภค และประสิทธิภาพการใช้พลังงาน

ด้วยความหนาแน่นของพลังงานมหาศาลเช่นนี้ คำถามที่ชัดเจนก็คือGoogle ควบคุมอุณหภูมิทั้งหมดนี้ได้อย่างไรคำตอบอยู่ที่ระบบระบายความร้อนด้วยของเหลวที่ล้ำสมัย ซึ่งออกแบบมาโดยเฉพาะสำหรับซูเปอร์พ็อด Ironwood

แต่ละแร็คประกอบด้วยชุดกระจายสารหล่อเย็น (CBU) พร้อมตัวตรวจจับการรั่วไหลและระบบสำรองไฟฟ้ากระแสสลับ 416Vการกำหนดค่านี้ไม่เพียงแต่ป้องกันความร้อนสูงเกินไป แต่ยังให้ความน่าเชื่อถือสูงสำหรับงานประมวลผล AI ที่สำคัญ ซึ่งการหยุดทำงานเป็นเวลานานอาจส่งผลให้เกิดความเสียหายหลายล้านยูโรหรือการหยุดชะงักของบริการในวงกว้าง

Ironwood ไม่ได้มุ่งหวังเพียงแค่จะเป็นระบบที่ทรงพลังที่สุด แต่ยังเป็นหนึ่งในระบบที่มีประสิทธิภาพสูงสุดอีกด้วย เมื่อเทียบกับ Trillium แล้ว TPU v7 มีประสิทธิภาพต่อวัตต์ที่ใช้สูงกว่าถึงสองเท่าซึ่งหมายความว่า ด้วยงบประมาณด้านพลังงานในปี 2024 เท่าเดิม ศูนย์ข้อมูลที่ติดตั้ง Ironwood จะสามารถรองรับการประมวลผลแบบอนุมานได้มากถึงสองเท่าภายในปี 2026

แนวทางนี้เป็นการแก้ไขปัญหาที่ไม่น่าพึงพอใจในภาคส่วนนี้ นั่นคือพลังงาน ไม่ใช่ซิลิคอน กำลังกลายเป็นปัจจัยจำกัดการขยายตัวของ AI โครงข่ายไฟฟ้าของหลายประเทศเริ่มถึงขีดจำกัดในพื้นที่ศูนย์ข้อมูลสำคัญ ดังนั้นการดึงประสิทธิภาพการทำงานที่เป็นประโยชน์มากขึ้นจากแต่ละวัตต์จึงไม่ใช่แค่ข้อได้เปรียบอีกต่อไป แต่เป็นสิ่งจำเป็น

นอกจากนี้ สถาปัตยกรรมของ Ironwood ยังได้รับการปรับแต่งเพื่อลดการเคลื่อนย้ายข้อมูลที่ไม่จำเป็น ซึ่งเป็นตัวการสำคัญที่ใช้พลังงานในระบบแบบกระจาย การผสมผสานระหว่างหน่วยความจำ HBM ขนาดใหญ่และเครือข่ายความเร็วสูงมีเป้าหมายเพื่อจุดประสงค์นั้นโดยเฉพาะ นั่นคือการประมวลผลที่มากขึ้นใกล้กับข้อมูล และการเดินทางที่สิ้นเปลืองค่าใช้จ่ายข้ามศูนย์ข้อมูลน้อยลง

AI ไฮเปอร์คอมพิวเตอร์ Google Cloud

Ironwood ภายใน AI Hypercomputer และเลเยอร์ซอฟต์แวร์

Ironwood ไม่ได้อยู่โดดเดี่ยว แต่ถูกผสานรวมอย่างลึกซึ้งเข้ากับสถาปัตยกรรม AI Hypercomputer ของ Google Cloudแนวคิดนี้เป็นการรวมฮาร์ดแวร์ (ซีพียู Axion และ TPU) เครือข่ายความเร็วสูง พื้นที่จัดเก็บข้อมูล และซอฟต์แวร์การจัดการและการจัดตารางเวลาเข้าไว้ในกรอบการออกแบบเดียว

ในระดับซอฟต์แวร์ Google ใช้ชุดซอฟต์แวร์ Pathways ซึ่งช่วยให้สามารถประสานงาน Ironwood TPU นับหมื่นตัวได้ ราวกับว่าเป็นทรัพยากรเชิงตรรกะเดียว นอกจาก Pathways แล้ว ยัง มีการเสริม ความแข็งแกร่งให้กับเครื่องมือต่างๆ เช่น MaxText (สำหรับ การฝึกอบรม LLM ขนาดใหญ่ ) และการผสานรวมกับ Kubernetes Engine ผ่าน Cluster Director เพื่อเพิ่มประสิทธิภาพการจัดตารางเวลาและความยืดหยุ่นของคลัสเตอร์

สำหรับส่วนประกอบการอนุมาน (Inference component) Google ได้ขยายการรองรับ vLLM ให้ใช้งานได้ทั้งกับ GPU และ TPUทำให้การย้ายโมเดลและเวิร์กโหลดระหว่างตัวเร่งความเร็วประเภทต่างๆ ทำได้ง่ายขึ้นด้วยการเปลี่ยนแปลงโค้ดเพียงเล็กน้อย นอกจากนี้ GKE Inference Gateway ยังสามารถลดความหน่วงแฝงของคำขอเริ่มต้นได้สูงสุดถึง 96% และลดต้นทุนการให้บริการลงได้ประมาณ 30% ตามข้อมูลที่บริษัทเปิดเผย

ทั้งหมดนี้หมายความว่าลูกค้าไม่เพียงแต่จะได้รับชิปที่เร็วเท่านั้น แต่ยังได้รับแพลตฟอร์มที่สมบูรณ์แบบและได้รับการปรับแต่งอย่างครบวงจรอีกด้วยที่จริงแล้ว IDC ระบุว่าผลตอบแทนจากการลงทุนสูงถึง 353% ในช่วงสามปีสำหรับลูกค้า AI Hypercomputer โดยลดต้นทุนด้านไอทีได้เกือบ 28%

เป้าหมายสูงสุดนั้นชัดเจน: คือการช่วยให้ธุรกิจต่างๆ สามารถใช้ประโยชน์จากพลังของ Ironwood โดยไม่ต้องยุ่งยากกับการจัดการโครงสร้างพื้นฐานที่ซับซ้อน ผู้ใช้ในอุดมคติเพียงแค่กำหนดโมเดลและความต้องการของตนเอง และระบบควบคุมของ Google Cloud จะจัดการ TPU, Axion, เครือข่าย, พื้นที่จัดเก็บข้อมูล และซอฟต์แวร์ได้อย่างราบรื่น

  อุปกรณ์ต่อพ่วงพีซีที่จำเป็น: คู่มือฉบับสมบูรณ์และใช้งานได้จริง

TPU Ironwood ในศูนย์ข้อมูล

“ยุคแห่งการอนุมาน” และบทบาทของไอรอนวูด

เป็นเวลาหลายปีที่การพูดคุยเกี่ยวกับ AI ส่วนใหญ่หมุนรอบการฝึกฝนโมเดลที่มีขนาดใหญ่ขึ้นเรื่อยๆอย่างไรก็ตาม ตลาดต้องเผชิญกับความเป็นจริงที่โหดร้าย: ไม่ว่าการฝึกฝนจะยอดเยี่ยมเพียงใด รายได้ที่ยั่งยืนมาจากการให้ผลลัพธ์ในระดับที่ใหญ่ขึ้นอย่างต่อเนื่องทุกวัน

Google เรียกยุคใหม่นี้ว่า“ยุคแห่งการอนุมาน ” แทนที่จะเป็นเพียงโมเดลตอบสนองที่รอให้ผู้ใช้ถามคำถาม เรากำลังก้าวไปสู่เอเจนต์ AI ที่ดึงข้อมูล วิเคราะห์บริบท ประสานงานกระบวนการย่อย และริเริ่มในการให้คำแนะนำและข้อมูลที่ผ่านการประมวลผลแล้ว

Ironwood ได้รับการออกแบบมาเพื่อรองรับงานประเภทนี้โดยเฉพาะ ได้แก่โมเดลที่มีการให้เหตุผลซับซ้อน บริบทที่กว้างขวาง และสถานะที่คงอยู่ยาวนานหน่วยความจำที่ใช้ร่วมกันจำนวนมากและแบนด์วิดท์เครือข่ายมีจุดประสงค์เพื่อให้ส่วนประกอบหลายส่วนของระบบ AI เดียวกันสามารถทำงานร่วมกันได้อย่างราบรื่นโดยไม่เกิดปัญหาการรับส่งข้อมูลมากเกินไป

ในสถานการณ์นี้ Google ใช้กลยุทธ์ที่แตกต่างจาก Nvidia ในขณะที่ชิป Blackwell ยังคงครองความเป็นผู้นำด้านการฝึกอบรมที่ล้ำสมัยและให้คำมั่นสัญญาว่าจะให้ความเร็วในการประมวลผลที่สูงมากในบางการกำหนดค่า Google กลับมุ่งเน้นไปที่การเพิ่มประสิทธิภาพการทำงานของโมเดลอย่างต่อเนื่องและในปริมาณมากในสภาพแวดล้อมการใช้งานจริงโดยผสานรวมฮาร์ดแวร์และคลาวด์เข้าไว้ในแพ็กเกจเดียวที่สอดคล้องกัน

บริษัทไม่ได้ตั้งใจที่จะเข้ามาแทนที่ Nvidia ในทุกด้าน แต่ตั้งเป้าที่จะแย่งชิงส่วนแบ่งตลาดการประมวลผลแบบอนุมาน (Inference) ที่กำลังเติบโตขึ้นเรื่อย ๆ จากการประมาณการภายในบางส่วน ชี้ให้เห็นว่าภายในปี 2027 หน่วยประมวลผล TPU ของ Google อาจมีส่วนแบ่งตลาดมากถึง 30% โดยเฉพาะในกลุ่มลูกค้ารายใหญ่ที่ใช้ Google Cloud อยู่แล้ว

ข้อตกลงกับ Anthropic และการส่งเสริมทางการค้า

แรงผลักดันทางการค้าครั้งสำคัญของ Ironwood มาจากAnthropic ผู้พัฒนาโมเดล Claudeเมื่อวันที่ 23 ตุลาคม 2025 บริษัทได้ลงนามในข้อตกลงครั้งใหญ่กับ Google โดยให้คำมั่นว่าจะใช้ TPU มากถึงหนึ่งล้านชิ้นและลงทุนหลายหมื่นล้านดอลลาร์ในโครงสร้างพื้นฐานบน Google Cloud

สัญญาฉบับนี้คาดการณ์ว่าการใช้พลังงานจะเกิน 1 กิกะวัตต์ภายในปี 2026ซึ่งเป็นตัวเลขมหาศาลที่แสดงให้เห็นถึงขนาดการดำเนินงานของผู้เล่นรายใหญ่ในอุตสาหกรรม AI ในชั่วข้ามคืน Ironwood ก็เปลี่ยนจากโครงการที่ทะเยอทะยานในแผนงานไปเป็นการลงทุนจริงที่ได้รับการสนับสนุนจากความต้องการที่แข็งแกร่ง

สำหรับ Google ข้อตกลงนี้ช่วยแก้ปัญหาความกังวลที่สำคัญที่สุดอย่างหนึ่งของบริษัท นั่นคือการสร้างศูนย์ข้อมูลโดยไม่มีการรับประกันการใช้งานด้วย Anthropic เป็นลูกค้าหลัก บริษัทสามารถวางแผนสิ่งอำนวยความใหม่ สัญญาด้านพลังงาน และการติดตั้งซูเปอร์พอด Ironwood ได้อย่างชัดเจนยิ่งขึ้นเกี่ยวกับผลตอบแทนจากการลงทุน

การที่ Anthropic เลือกใช้ Ironwood แทนที่จะรอชิปรุ่นต่อไปของ Nvidia หรือหันไปใช้ฮาร์ดแวร์เฉพาะของบริษัทผู้ให้บริการคลาวด์รายอื่น ๆ นั้น เป็นสัญญาณที่ชัดเจนถึงความเชื่อมั่นในประสิทธิภาพและระยะเวลาในการออกสู่ตลาดของ TPU ของ Googleในทางปฏิบัติแล้ว "ประมวลผลได้มากขึ้น ใช้พลังงานน้อยลง" คือคติพจน์โดยนัยของการตัดสินใจครั้งนี้

ข้อตกลงระยะยาวประเภทนี้ยังช่วยให้ Google สามารถเจรจาต่อรองต้นทุนของตนเองได้ดียิ่งขึ้น (ตั้งแต่การผลิตชิปไปจนถึงการจัดหาพลังงาน) และเสริมสร้างตำแหน่งของตนในตลาดที่ความต้องการการประมวลผล AI มีมากกว่าอุปทานที่มีอยู่มาก

ผลกระทบต่อตลาดชิป AI และการแข่งขันกับ Nvidia

การเปิดตัว Ironwood ถือเป็นการเปลี่ยนแปลงครั้งสำคัญในตลาดฮาร์ดแวร์ AIซึ่งก่อนหน้านี้ถูกครอบงำโดย GPU ของ Nvidia มาโดยตลอด Google ไม่ใช่บริษัทเดียวที่กำลังเคลื่อนไหว AWS ก็กำลังผลักดันผลิตภัณฑ์ Trainium2 ของตน และ Microsoft ก็กำลังพัฒนาโปรแกรม Maia ต่อไป แม้ว่าจะล่าช้าไปบ้างก็ตาม

Nvidia ยังคงเป็นผู้นำด้านเทคโนโลยีการประมวลผลล้ำสมัย ด้วยสถาปัตยกรรม Hopper, Blackwell และ Rubin ที่กำลังจะเปิดตัว ซึ่งมุ่งเป้าไปที่การกำหนดค่าระดับหลายเอ็กซาฟลอปต่อแร็ค อย่างไรก็ตาม Google กำลังผลักดันตลาดไปสู่โมเดลของระบบนิเวศแบบบูรณาการในแนวดิ่งหลายแห่งโดยที่ผู้ให้บริการคลาวด์ขนาดใหญ่แต่ละรายออกแบบชิป เครือข่าย ซอฟต์แวร์ และบริการคลาวด์ของตนเอง

ในสภาพแวดล้อมใหม่นี้ Ironwood วางตำแหน่งตัวเองเป็นทางเลือกที่แข็งแกร่งสำหรับบริษัทต่างๆ ที่ต้องการโครงสร้างพื้นฐานการประมวลผลแบบอนุมานขนาดใหญ่โดยไม่ต้องพึ่งพาระบบนิเวศ CUDA อย่างสมบูรณ์ การผสมผสานระหว่าง TPU ที่ออกแบบเองและ CPU Axion รวมถึงแพลตฟอร์ม Google Cloud ทำให้เกิดข้อเสนอที่น่าสนใจอย่างยิ่งสำหรับบริษัทที่ต้องการต้นทุน ประสิทธิภาพ และความพร้อมใช้งานที่คาดการณ์ได้

การเปลี่ยนแปลงนี้ยังเพิ่มแรงกดดันให้กับ Nvidia ซึ่งต้องหาเหตุผลมาสนับสนุนราคาสูงในสภาพแวดล้อมที่ตนเองไม่ใช่ตัวเลือกเดียวที่เหมาะสมอีกต่อไปเนื่องจาก Amazon, Microsoft และ Google ต่างเสริมความแข็งแกร่งให้กับระบบของตนเอง ตลาดจึงกำลังเปลี่ยนไปจากโมเดลผู้จำหน่ายชิปรายเดียว ไปสู่โมเดลของระบบที่ครบวงจรแต่ได้รับการปรับแต่งอย่างดีเยี่ยมภายในผู้ให้บริการคลาวด์แต่ละราย

อย่างไรก็ตาม ความสำเร็จของ Ironwood และ TPU โดยทั่วไปจะขึ้นอยู่กับว่าซอฟต์แวร์ของ Google จะพัฒนาไปพร้อมกับระบบนิเวศของ CUDA อย่างต่อเนื่องหรือไม่หากอัตราการใช้งานคลัสเตอร์ลดลง (เช่น จาก 90% เหลือ 70%) ประสิทธิภาพโดยรวมจะลดลง และอาจส่งผลกระทบต่อความสามารถในการแข่งขันด้านราคาได้

  การดำเนินงานแบบอัตโนมัติในภาคอุตสาหกรรม: จากข้อมูลสู่การตัดสินใจอย่างชาญฉลาด

Axion: ส่วนเสริม CPU สำหรับโครงสร้างพื้นฐาน AI

นอกเหนือจากการเปิดตัว Ironwood แล้ว Google ยังได้เสริมความแข็งแกร่งให้กับตระกูลซีพียูแบบกำหนดเอง Axionซึ่งใช้สถาปัตยกรรม Arm Neoverse โดยที่ TPU จะจัดการกับงานประมวลผลขั้นสูงด้านแมชชีนเลิร์นนิง ในขณะที่ Axion จะดูแลงานทั่วไปที่เกี่ยวข้องกับ AI

อินสแตนซ์ N4A ใหม่นี้มี vCPU สูงสุดถึง64 ตัว หน่วยความจำ DDR5 ขนาด 512 GB และแบนด์วิดท์เครือข่าย 50 Gbpsพร้อมประสิทธิภาพด้านราคาที่ดีขึ้นสูงสุดถึง 100% เมื่อเทียบกับเครื่อง x86 ที่เทียบเท่ากัน ในขณะเดียวกัน C4A Metal เป็นเวอร์ชัน bare-metal ตัวแรกของ Google Cloud ที่ใช้สถาปัตยกรรม Arm เหมาะสำหรับสถานการณ์ต่างๆ เช่น การพัฒนา Android แอปพลิเคชันในยานยนต์ และการจำลองขั้นสูง

บริษัทต่างๆ เช่น Vimeo รายงานว่าการแปลงรหัสวิดีโอดีขึ้น 30%ในขณะที่ ZoomInfo รายงานว่ากระบวนการวิเคราะห์ข้อมูลมีประสิทธิภาพเพิ่มขึ้น 60% บริษัทอื่นๆ เช่น Rise อ้างว่าลดการใช้พลังงานในการประมวลผลลงประมาณ 20% ในขณะที่ยังคงรักษาความหน่วงเวลาให้คงที่

แนวคิดพื้นฐานคือให้ Axion ทำหน้าที่เป็นชั้นฐานการประมวลผลอเนกประสงค์เช่น การเตรียมข้อมูล ไมโครเซอร์วิส เว็บเซอร์วิส ตรรกะทางธุรกิจ เป็นต้น บนพื้นฐานนั้น Ironwood TPU จะมุ่งเน้นไปที่สิ่งที่ทำได้ดีที่สุด นั่นคือการเร่งความเร็วในการฝึกฝน การอนุมาน และการให้เหตุผลของโมเดล AI

การผสมผสานนี้ตอกย้ำวิสัยทัศน์ที่ว่าการประมวลผลยุคใหม่จะเป็นแบบไฮบริด : CPU ประสิทธิภาพสูงสำหรับการจัดการเวิร์กโฟลว์ และ TPU (หรือตัวเร่งความเร็วอื่นๆ) สำหรับการคำนวณที่เข้มข้น ทั้งหมดนี้ถูกรวมเข้าด้วยกันโดยแพลตฟอร์ม AI Hypercomputer และเครื่องมือ Google Cloud

แนวโน้มการลงทุนและการปกป้องมาร์จิ้นของ Alphabet

จากมุมมองทางการเงิน Ironwood ไม่ใช่แค่ชิปทรงพลังเท่านั้น แต่ยังเป็นองค์ประกอบเชิงกลยุทธ์ในการปกป้องอัตรากำไรของ Alphabetในธุรกิจ AI บนคลาวด์อีกด้วย ผู้ให้บริการคลาวด์ขนาดใหญ่กำลังมุ่งหน้าสู่การมีกำลังการผลิตไฟฟ้าหลายสิบกิกะวัตต์ภายในปี 2027 และทุกสัญญาณบ่งชี้ว่าการลงทุนด้านโครงสร้างพื้นฐานจะยังคงมหาศาลต่อไป

ด้วยการออกแบบชิปของตนเอง Google สามารถสร้างมูลค่าได้ตลอดทั้งห่วงโซ่คุณค่าตั้งแต่การออกแบบซิลิคอนไปจนถึงการใช้งานบนคลาวด์ แทนที่จะขายฮาร์ดแวร์ของบริษัทอื่นด้วยกำไรเพียงเล็กน้อย Google สามารถเปลี่ยนค่าใช้จ่ายด้านการลงทุน (CAPEX) ให้กลายเป็นข้อได้เปรียบในการแข่งขันและเครื่องมือในการสร้างความแตกต่างให้กับบริการของตนได้

ประสิทธิภาพต่อวัตต์ที่ได้รับการปรับปรุงของ Ironwood หมายความว่าความจุของศูนย์ข้อมูลแต่ละเมกะวัตต์สามารถรองรับการประมวลผลได้มากขึ้นอย่างเห็นได้ชัดเมื่อรวมกับการปรับแต่งซอฟต์แวร์ (vLLM, Pathways, GKE Inference Gateway เป็นต้น) ทำให้ Google สามารถเสนอราคาที่แข่งขันได้โดยไม่กระทบต่อผลกำไร

สัญญากับ Anthropic ช่วยเพิ่มความมั่นคงให้กับแผนการใช้จ่ายเงินทุนของ Googleแทนที่จะสร้างโครงสร้างพื้นฐานแบบ "ไร้ทิศทาง" โดยรอให้ลูกค้าเข้ามา ตอนนี้ Google สามารถกำหนดขนาดการขยายตัวส่วนใหญ่ได้โดยอิงจากข้อตกลงระยะยาว ซึ่งช่วยลดความไม่แน่นอนและความเสี่ยงจากกำลังการผลิตที่มากเกินไป

ถึงกระนั้น คำถามที่ยังค้างคาอยู่ก็คือ Google จะดึงดูดลูกค้ารายใหญ่ได้มากขึ้นหรือไม่ โครงการด้านพลังงานและสถานีไฟฟ้าย่อยใหม่จะดำเนินไปตามกำหนดการหรือไม่ และซอฟต์แวร์ของบริษัทจะรักษาระดับการใช้งานที่สูงไว้ได้หรือไม่ ศักยภาพมีอยู่ แต่การลงมือปฏิบัติจะเป็นกุญแจสำคัญสำหรับ Ironwood ในการประสบความสำเร็จทั้งในด้านเทคโนโลยีและเป็นกลไกขับเคลื่อนผลกำไรอย่างยั่งยืนนี่ไม่ใช่คำแนะนำด้านการลงทุน

โดยรวมแล้ว Google TPU v7 Ironwood แสดงถึงการก้าวกระโดดครั้งสำคัญที่เหนือกว่าแค่ตัวเลขเทราฟลอปในเอกสารสเปค: มันผสานรวมพลังการประมวลผลมหาศาล หน่วยความจำร่วมขนาดใหญ่ เครือข่ายออปติคอลขั้นสูง ระบบระบายความร้อนด้วยของเหลว และคลาวด์ที่ผสานรวมอย่างลึกซึ้ง เพื่อรองรับคลื่นลูกใหม่ของเอเจนต์และโมเดล AI ที่ทำงานตลอด 24 ชั่วโมง ในโลกที่พลังงานมีจำกัด โมเดลเติบโตอย่างต่อเนื่อง และการแข่งขันเพื่อควบคุมระบบ AI นั้นดุเดือดIronwood กำลังกลายเป็นหัวใจสำคัญของโครงสร้างพื้นฐานที่ออกแบบมาเพื่อนำไปสู่ ​​"ยุคแห่งการอนุมาน"และกำหนดนิยามใหม่ว่าปัญญาประดิษฐ์จะทำงานอย่างไร ที่ไหน และด้วยต้นทุนเท่าใดในระดับโลก

tensorflow-0 คืออะไร
บทความที่เกี่ยวข้อง:
TensorFlow คืออะไร และปฏิวัติวงการปัญญาประดิษฐ์ได้อย่างไร