Google TPU v7 Ironwood 是什麼?它為何能改變人工智慧?

最後更新: 27月2025
  • Google TPU v7 Ironwood 是第七代 TPU,專為推理時代而設計,每個晶片具有 4.614 TFLOPs FP8 和 192 GB HBM3e。
  • 該架構在一個超級晶片組中可擴展至 9.216 個晶片,具有 1,77 PB 的共享內存、9,6 Tb/s 的 ICI 網路以及針對近 10 MW 優化的液冷系統。
  • Ironwood 與 Axion CPU 整合到 AI 超級電腦中,為大規模 AI 工作負載提供了效能、能源效率和成本之間的良好平衡。
  • 與 Anthropic 簽訂的巨額合約以及垂直整合策略,鞏固了Google作為英偉達在人工智慧晶片市場主要競爭對手的地位。

Google TPU v7 Ironwood

人工智慧的加速發展正在經歷一場變革。僅僅訓練龐大的模型並炫耀其參數遠遠不夠:如今真正的挑戰在於如何讓這些模型每天為數百萬用戶提供服務,同時避免人工智慧的能源和基礎設施成本飆升。正是在這種背景下,Google推出了 TPU v7 Ironwood,這是一款專為人工智慧設計的硬件,它不僅能夠回應指令,還能持續思考、推理和行動。

Ironwood 是Google第七代張量處理單元 (TPU),據Google自己稱,它是迄今為止功能最強大、可擴展性最強、效率最高的晶片。它是為所謂的「推理時代」而設計,在這個時代,重要的不再是訓練新模型所需的時間,而是維護模型、使其保持運作、進行推理並全天候產生結果的成本。讓我們仔細看看Google TPU v7 Ironwood 究竟是什麼,它的獨特之處是什麼,以及它為何能撼動英偉達和其他行業巨頭的地位。

什麼是 Google TPU v7 Ironwood?為什麼它如此重要?

Ironwood本質上是Google自主研發的AI加速器,用於運行尖端人工智慧模型。它屬於張量處理單元(TPU)系列,這類晶片專為機器學習工作負載而設計,近十年來一直為Google內部服務(搜尋、YouTube、廣告、翻譯等)提供支持,最近也開始為Google雲端解決方案提供支援。

第七代TPU凝聚了以往TPU累積的所有經驗,並擁有一個明確的目標:在不犧牲可訓練性的前提下,最大限度地提升推理和複雜推理任務的表現。 Ironwood旨在處理大型語言模型(LLM)、混合專家模型、增強型回憶系統以及需要在記憶體中維護大量上下文資訊的AI代理等工作負載。

Ironwood並非只是“速度更快的晶片”,它被整合到Google雲端的AI超級電腦架構中。這種架構將運算、網路、儲存和軟體協同設計,從而能夠從晶片到容器編排器進行精細調整,最大限度地利用每一瓦功耗和每一個時脈週期。

另一個關鍵點是,Ironwood 是首款從零開始為推理時代設計的 TPU。先前,大多數 AI 系統的主要設計目標是訓練大規模模型;而現在,重點正轉向如何高效、重複地運行這些模型,並讓智能體不僅能夠做出反應,還能預測、搜尋數據、整合數據並返回結論。

TPU v7 鐵木架構

TPU v7 Ironwood 的主要技術特性

在技​​術層面,Ironwood 的數據令人印象深刻,即使在競爭激烈的 AI 晶片市場也是如此。每顆晶片都擁有4.614 兆次浮點運算/秒 (4.614 teraflops) 的 FP8 精度運算能力,是 TPU v4 運算能力的 16 倍以上,與前幾代產品相比更是實現了巨大的飛躍。

為了實現如此強大的處理能力,每個晶片都整合了192 GB 的新一代 HBM3e 內存,頻寬約為 7,3-7,4 TB/s。正是這種高速運算和記憶體的結合,使得處理龐大的模型和超長的上下文而不出現瓶頸成為可能。

Ironwood採用先進的5奈米製程製造,每顆晶片的功耗約為600瓦。這聽起來可能很高,但如果將其每瓦性能進行比較,結果就非常有競爭力了:與上一代Trillium(TPU v6e)相比,Ironwood的每瓦性能提高了一倍。

這些改進在訓練和服務工作負載方面都十分顯著。在訓練方面,Ironwood 可以加速處理下一代模型(例如 Gemini 或 Veo)以及其他供應商的模型;在服務方面,它能夠以更低的能耗運行大規模推理,這在如今人工智慧資料中心能耗以吉瓦計價的情況下至關重要。

超鐵木

從晶片到超級艙:Ironwood 如何實現規模化

Ironwood 的真正魔力不在於單一晶片,而是它如何擴展以建構人工智慧超級電腦。每個 Ironwood SoC 都安裝在一個包含四個晶片的 PCBA 上,每個機架集成 16 個這樣的電路板,每個機架總共包含 64 個晶片。

  樹莓派上 Home Assistant 安裝完整指南

這些機架組合在一起,形成一個Ironwood超級資料中心。一個完整的超級資料中心包含144個機架,相當於9.216個互連的晶片。總而言之,這相當於約42,5 exaflops的FP8運算性能和約1,77 PB的共享HBM內存,所有這些都可作為人工智慧模型的龐大邏輯資源。

晶片間的互連是透過晶片間互連(ICI)網路實現的,該網路採用 3D 環形(4x4x4)設計,速度高達 9,6 Tb/s。這種拓撲結構可以降低延遲,即使系統擴展到數千個加速器,也能保持高傳輸速率,這對於分散式訓練和高度平行推理工作負載至關重要。

除了超級模組之外,還可以透過組合由 64 個互連晶片組成的模組,並透過高達 1,8 PB/s 的光纖骨幹網路連接,進一步擴展基礎設施。這種被動銅纜、光纖和光交換器的組合,在為不同客戶和型號配置客製化叢集時,提供了極大的靈活性。

就電力而言,如此規模的系統部署容量接近 10 兆瓦,因此必須高度重視冷卻和效率。每個機架的設計功耗都超過 100 千瓦,所以整個系統從一開始就針對液冷和先進的配電技術進行了設計。

Ironwood TPU冷卻基礎設施

冷氣、消耗和能源效率

如此驚人的功率密度,自然會引出一個問題:谷歌是如何控制所有這些設備的散熱的?答案在於一套專為Ironwood超級處理器設計的尖端液冷系統。

每個機架都整合了一個冷卻液分配單元 (CBU),配備洩漏偵測器和 416V 交流電冗餘系統。這種配置不僅可以防止過熱,還能為關鍵的 AI 工作負載提供高可靠性,因為長時間的停機可能會造成數百萬歐元的損失或大規模的服務中斷。

Ironwood的目標不僅是成為最強大的系統,還要成為最高效的系統之一。與Trillium相比,TPU v7的每瓦效能提升了一倍。這意味著,在2024年相同的能源預算下,配備Ironwood的資料中心到2026年可以處理高達兩倍的推理任務。

這種方法直面了這個領域一個令人不安的現實:能源而非矽正在成為人工智慧擴張的限制因素。許多國家的電網在關鍵資料中心區域已接近飽和,因此,如何從每一瓦特能源中榨取更多有用能量不再是優勢,而是必然。

此外,Ironwood 的架構經過最佳化,可最大限度地減少不必要的資料傳輸,而資料傳輸則是分散式系統中主要的能耗來源。海量 HBM 記憶體和高速網路的結合正是為了實現這一點:在更靠近資料的地方進行更多處理,減少資料中心內昂貴的資料傳輸。

人工智慧超級電腦 Google Cloud

人工智慧超級電腦和軟體層中的Ironwood

Ironwood並非獨立存在,它與Google雲端的AI超級電腦架構深度整合。這個概念將硬體(Axion CPU和TPU)、高速網路、儲存以及編排和調度軟體整合到一個統一的設計框架中。

在軟體層,Google依賴其 Pathways 技術棧,該技術堆疊能夠將數萬個 Ironwood TPU 協調起來,如同它們是單一的邏輯資源。除了 Pathways 之外,諸如 MaxText(用於大規模 LLM 訓練)之類的工具以及透過 Cluster Director 與 Kubernetes Engine 的整合也得到了加強,從而優化了叢集調度和彈性。

在推理組件方面,Google擴展了 vLLM 的支援範圍,使其能夠同時相容於 GPU 和 TPU,從而只需極少的程式碼變更即可輕鬆地在不同類型的加速器之間遷移模型和工作負載。此外,根據Google分享的數據,GKE 推理閘道可以將初始請求延遲降低高達 96%,並將服務成本降低約 30%。

這一切意味著客戶不僅能獲得高速晶片,還能獲得一個完整的端對端優化平台。事實上,IDC 的數據顯示,人工智慧超級電腦客戶三年內的投資報酬率高達 353%,IT 成本降低了近 28%。

最終目標很明確:讓企業能夠輕鬆駕馭 Ironwood 的強大功能,而無需費心管理複雜的底層架構。理想使用者只需定義其模式和需求,Google Cloud 控制平台即可無縫協調 TPU、Axion、網路、儲存和軟體。

  英偉達 RTX Spark:重新定義 Windows PC 的 ARM 超級晶片

資料中心中的 TPU Ironwood

「推理時代」與鐵木的作用

多年來,人工智慧領域的討論大多圍繞著訓練越來越大的模型。然而,市場面臨著一個殘酷的現實:無論訓練多麼出色,持續的收入都來自於日復一日地提供大規模的推理結果。

谷歌將這個新時代稱為「推理時代」。我們不再是被動地等待使用者提問的模型,而是朝著能夠檢索資料、分析上下文、協調子流程並主動提供建議和處理資訊的AI代理發展。

Ironwood 正是為這類工作負載而設計的:具有複雜推理、廣泛上下文和持久狀態的模型。其大量的共享記憶體和網路頻寬旨在使同一 AI 系統的多個元件能夠協同工作,而不會因流量過大而崩潰。

在這種情況下,谷歌採取了與英偉達不同的策略。雖然Blackwell晶片繼續主導著尖端訓練領域,並在特定配置下承諾極高的推理速度,但谷歌則專注於優化生產環境中模型的持續大規模執行,將硬體和雲端整合到一個統一的軟體包中。

該公司並非意圖全面取代英偉達,而是試圖佔據日益增長的推理市場。一些內部估計表明,到2027年,Google的TPU可能佔據該市場高達30%的份額,尤其是在已經使用Google雲端的大型客戶群中。

與 Anthropic 的協議及其帶來的商業推動作用

Ironwood 的主要商業動力來自Claude 模型開發商 Anthropic。 2025年 10 月 23 日,該公司與Google簽署了一項巨額協議,承諾使用多達一百萬個 TPU,並在Google雲端基礎設施上投資數百億美元。

這份合約預計到2026年能源消耗將超過1吉瓦,這是一個龐大的數字,足以體現人工智慧領域主要參與者的營運規模。一夜之間,Ironwood從一個雄心勃勃的路線圖項目變成了由強勁需求支撐的真正投資項目。

對Google而言,這項協議解決了最大的擔憂之一:在無法保證使用率的情況下建立資料中心容量。有了 Anthropic 作為其主要客戶,Google在規劃新設施、電力合約和 Ironwood 超級資料中心部署時,可以更清晰地了解其投資回報。

Anthropico 選擇 Ironwood,而不是等待英偉達的下一代產品或採用其他超大規模數據中心運營商的專有硬件,這清楚地表明了其對谷歌 TPU 的效率和上市速度充滿信心。 「更高的推理能力,更低的功耗」其實是此舉的隱含概念。

這類長期協議也有助於Google更好地協商自身的成本(從晶片製造到能源供應),並鞏固其在人工智慧運算需求遠遠超過可用供應的市場中的地位。

對人工智慧晶片市場的影響以及與英偉達的競爭

Ironwood的發布對人工智慧硬體市場來說意義重大,此前該市場一直由英偉達GPU主導。谷歌並非唯一採取行動的公司:AWS正在大力推廣其Trainium2產品線,微軟也在推進其Maia項目,儘管進度有所延遲。

英偉達憑藉其 Hopper、Blackwell 以及即將推出的 Rubin 架構,繼續引領尖端訓練技術的發展,這些架構的目標是實現每個機架數百億億次浮點運算的配置。然而,Google正在推動市場朝著多個垂直整合生態系統的模式發展,在這種模式下,每個超大規模資料中心營運商都自主設計晶片、網路、軟體和雲端服務。

在這種新情況下,Ironwood 將自身定位為尋求大規模推理基礎設施但又不想完全依賴 CUDA 生態系統的企業的可靠替代方案。客製化 TPU 和 Axion CPU 的組合,加上 Google Cloud 平台,為那些需要可預測的成本、效能和可用性的企業打造了極具吸引力的解決方案。

此舉也給英偉達帶來了壓力,它必須在不再是唯一選擇的情況下,證明其高價的合理性。隨著亞馬遜、微軟和谷歌不斷增強自身的技術棧,市場正從單一晶片供應商模式轉向各雲端服務供應商內部封閉但高度優化的解決方案體系。

然而,Ironwood 和 TPU 的整體成功很大程度上取決於Google的軟體堆疊能否與 CUDA 生態系統保持同步發展。如果集群利用率下降(例如從 90% 降至 70%),整體效率將會降低,價格競爭力也可能受到影響。

  面向老年人的無障礙智慧家庭:助力獨立生活的技術

Axion:面向人工智慧基礎架構的 CPU 附加元件

在發布 Ironwood 的同時,Google也加強了其基於 Arm Neoverse 架構的Axion 系列客製化 CPU。 TPU主要處理機器學習中最繁重的任務,而 Axion 則負責人工智慧相關的通用工作負載。

全新的 N4A 執行個體提供高達64 個虛擬 CPU、512 GB DDR5 記憶體和 50 Gbps 的網路頻寬,與同等 x86 架構的機器相比,性價比提升高達 100%。同時,C4A Metal 是 Google Cloud 首個基於 Arm 架構的裸機版本,專為 Android 開發、汽車應用和進階模擬等場景設計。

Vimeo等公司報告影片轉碼效能提升了30%,而ZoomInfo則報告資料分析流程效率提高了60%。其他公司,例如Rise,聲稱在保持穩定延遲的同時,將運算能耗降低了約20%。

其基本理念是讓 Axion 充當通用運算基礎層:資料準備、微服務、Web 服務、業務邏輯等。在此基礎上,Ironwood TPU 專注於它們最擅長的領域:加速 AI 模型的訓練、推理和推理。

這種組合強化了下一代運算將是混合型的願景:高效的 CPU 用於管理工作流程,而 TPU(或其他加速器)則用於密集型運算。所有這些都由 AI 超級電腦平台和 Google Cloud 工具整合在一起。

Alphabet 的投資前景和保證金保護

從財務角度來看,Ironwood 不只是一顆強大的晶片:它是Alphabet在雲端運算 AI 業務中保障利潤率的策略組成部分。超大規模資料中心預計在 2027 年達到兩位數吉瓦的電力容量,而且種種跡象表明,基礎設施投資仍將保持龐大規模。

透過自主設計晶片,Google可以從晶片設計到雲端部署的整個價值鏈中獲取價值。它不再以微薄的利潤轉售第三方硬件,而是將資本支出轉化為競爭優勢和差異化服務的工具。

Ironwood 的每瓦效能提升意味著每兆瓦資料中心容量能夠顯著提高推理服務量。結合軟體最佳化(vLLM、Pathways、GKE 推理網關等),這使得 Google 能夠在不影響獲利能力的前提下提供極具競爭力的價格。

與 Anthropic 的合約為Google的資本支出計劃增添了一層穩定性。谷歌不再需要「盲目」建設基礎設施,等待客戶到來,而是可以根據長期協議來規劃大部分擴張規模,從而降低不確定性和產能過剩的風險。

即便如此,仍有一些懸而未決的問題:Google能否吸引更多大型核心客戶,能源專案和新建變電站能否按計畫進行,以及其軟體堆疊能否保持高利用率。潛力是存在的,但執行力將是Ironwood能否在技術上取得成功並成為持續獲利引擎的關鍵。本文並非投資建議。

總而言之,Google TPU v7 Ironwood 代表著一次世代飛躍,其意義遠不止於規格表上的 teraflops 性能:它融合了強大的運算能力、海量共享內存、先進的光網絡、液冷技術以及深度集成的雲平台,旨在支持新一代 AI 代理和模型全天候運行。在能源緊張、模型規模不斷擴大、AI 技術棧控制權競爭異常激烈的今天,Ironwood 正崛起為基礎設施的核心,引領「推理時代」的到來,並重新定義人工智慧在全球範圍內的運作方式、地點和成本。

什麼是 TensorFlow-0
相關文章:
TensorFlow 是什麼以及它如何徹底改變人工智慧