- O Google TPU v7 Ironwood é a sétima geração de TPUs e foi projetado especificamente para a era da inferência, com 4.614 TFLOPs FP8 e 192 GB de HBM3e por chip.
- A arquitetura é escalável até 9.216 chips em um superpod com 1,77 PB de memória compartilhada, redes ICI de 9,6 Tb/s e resfriamento líquido otimizado para quase 10 MW.
- Integrado ao hipercomputador de IA juntamente com as CPUs Axion, o Ironwood oferece um excelente equilíbrio entre desempenho, eficiência energética e custo para cargas de trabalho de IA de grande escala.
- O megacontrato com a Anthropic e a estratégia de integração vertical reforçam o papel do Google como um concorrente chave da Nvidia no mercado de chips de IA.
A aceleração da inteligência artificial está passando por uma transformação . Não basta mais treinar modelos massivos e se gabar de seus parâmetros: agora, a verdadeira batalha é como fazê-los funcionar diariamente, para milhões de usuários, sem que os custos de energia e infraestrutura da IA disparem. Nesse contexto, surge o Google TPU v7 Ironwood, um hardware projetado para uma IA que não apenas responde, mas também pensa, raciocina e age continuamente.
Ironwood é a Unidade de Processamento Tensorial (TPU) de sétima geração do Google e, segundo a própria empresa, seu chip mais poderoso, escalável e eficiente até o momento. Ele foi projetado para a chamada "era da inferência", onde o que importa não é tanto o tempo necessário para treinar um novo modelo, mas sim o custo de mantê-lo ativo, raciocinando e gerando resultados ininterruptamente. Vamos analisar mais de perto o que exatamente é o Google TPU v7 Ironwood, o que o torna especial e por que ele está revolucionando o mercado, competindo com a Nvidia e outros gigantes da indústria.
O que é o Google TPU v7 Ironwood e por que ele é tão importante?
O Ironwood é essencialmente um acelerador de IA personalizado, desenvolvido pelo Google para executar modelos de inteligência artificial de ponta. Ele pertence à família de Unidades de Processamento Tensorial (TPUs), chips projetados especificamente para cargas de trabalho de aprendizado de máquina que vêm impulsionando os serviços internos do Google (busca, YouTube, publicidade, tradução etc.) há quase uma década e, mais recentemente, as soluções do Google Cloud.
Esta sétima geração foi construída com base em toda a experiência acumulada com as TPUs anteriores e com um objetivo claro: maximizar o desempenho em tarefas de inferência e raciocínio complexo , sem sacrificar a capacidade de treinamento. Modelos de Linguagem de Grande Porte (LLMs), Mistura de Especialistas, sistemas de recuperação aumentada e agentes de IA que precisam manter muito contexto na memória são os tipos de cargas de trabalho que o Ironwood foi projetado para lidar.
Em vez de ser simplesmente “um chip mais rápido”, o Ironwood está integrado à arquitetura de hipercomputadores de IA do Google Cloud , uma abordagem em que computação, rede, armazenamento e software são projetados em conjunto. Isso permite um ajuste fino desde o silício até o orquestrador de contêineres para aproveitar ao máximo cada watt e cada ciclo de clock.
Outro ponto fundamental é que o Ironwood é a primeira TPU projetada desde o início para a era da inferência . Até agora, a maioria dos sistemas de IA era projetada principalmente para treinar modelos massivos; agora o foco está mudando para a execução eficiente e repetida desses modelos, com agentes que não apenas reagem, mas também antecipam, buscam dados, os combinam e retornam conclusões.

Principais características técnicas do TPU v7 Ironwood
Em termos técnicos, a Ironwood apresenta números impressionantes, mesmo em um mercado tão competitivo quanto o de chips de IA. Cada chip oferece 4.614 teraflops de poder computacional de precisão FP8 , o que representa mais de 16 vezes a capacidade computacional do TPU v4 e um enorme salto em comparação com as gerações anteriores.
Para alimentar essa imensa capacidade de processamento, cada chip integra 192 GB de memória HBM3e de última geração , com uma largura de banda aproximada de 7,3 a 7,4 TB/s. Essa combinação de computação de alta velocidade e memória é precisamente o que torna possível lidar com modelos gigantescos e contextos muito longos sem gargalos.
O Ironwood é fabricado usando um processo avançado de 5 nanômetros e consome aproximadamente 600 watts por chip. Isso pode parecer muito, mas quando comparado ao seu desempenho por watt, o resultado é muito competitivo: em comparação com a geração anterior, Trillium (TPU v6e), o Ironwood dobra o desempenho por watt.
Essas melhorias são perceptíveis tanto no treinamento quanto nas cargas de trabalho de serviço. Para treinamento, o Ironwood pode acelerar o processamento de modelos de última geração (como Gemini ou Veo) e de outros fornecedores, e para serviço, permite que inferências massivas sejam executadas com custos de energia mais baixos, algo crucial agora que os data centers de IA são medidos em gigawatts.

Do chip ao Superpod: como a Ironwood escala
A verdadeira magia do Ironwood reside não em um único chip, mas em como ele se dimensiona para formar supercomputadores de IA . Cada SoC Ironwood é montado em uma placa de circuito impresso com quatro chips, e cada rack integra 16 dessas placas, totalizando 64 chips por rack.
A partir daí, os racks são agrupados para formar um Ironwood Superpod . Um superpod completo inclui 144 racks, o que equivale a 9.216 chips interconectados. No total, isso se traduz em cerca de 42,5 exaflops de desempenho FP8 e aproximadamente 1,77 petabytes de memória HBM compartilhada, tudo acessível como um vasto recurso lógico para modelos de IA.
A interconexão entre os chips é realizada através da rede Inter-Chip Interconnect (ICI) , com um design 3D Torus (4x4x4) e velocidades de até 9,6 Tb/s. Essa topologia permite latência reduzida e mantém altas taxas de transferência mesmo quando o sistema é escalado para milhares de aceleradores, o que é essencial para treinamento distribuído e cargas de trabalho de inferência altamente paralelas.
Além do superpod, a infraestrutura pode ser ainda mais expandida combinando blocos de 64 chips interconectados e interligando-os por meio de uma rede óptica de até 1,8 PB/s. Essa combinação de cabos de cobre passivos, fibra óptica e switches ópticos oferece enorme flexibilidade na configuração de clusters personalizados para diferentes clientes e modelos.
Em termos de potência, uma instalação deste porte se aproxima de 10 megawatts de capacidade elétrica , um valor que exige que o resfriamento e a eficiência sejam levados muito a sério. Cada rack foi projetado para consumir mais de 100 kW, portanto, todo o sistema foi concebido desde o início para resfriamento líquido e distribuição de energia avançada.

Refrigeração, consumo e eficiência energética
Com densidades de potência tão monstruosas, a pergunta óbvia é: como o Google mantém tudo isso sob controle térmico? A resposta está em um sistema de resfriamento líquido de última geração, projetado especificamente para os superpods Ironwood.
Cada rack integra uma unidade de distribuição de líquido refrigerante (CBU) com detectores de vazamento e redundância elétrica de 416 V CA. Essa configuração não apenas evita o superaquecimento, mas também proporciona alta confiabilidade para cargas de trabalho críticas de IA, onde uma interrupção prolongada poderia resultar em milhões de euros em prejuízos ou em grandes paralisações de serviço.
O Ironwood não visa apenas ser o sistema mais poderoso, mas também um dos mais eficientes. Comparado ao Trillium, o TPU v7 atinge o dobro do desempenho por watt consumido . Isso significa que, com o mesmo orçamento de energia de 2024, um data center equipado com Ironwood poderia lidar com até o dobro de inferências até 2026.
Essa abordagem aborda uma realidade incômoda no setor: a energia, e não o silício, está se tornando o fator limitante para a expansão da IA. As redes elétricas de muitos países estão começando a atingir sua capacidade em áreas críticas de data centers, portanto, extrair mais trabalho útil de cada watt não é mais uma vantagem, mas sim uma necessidade.
Além disso, a arquitetura do Ironwood é otimizada para minimizar a movimentação desnecessária de dados, um dos principais consumidores de energia em sistemas distribuídos. A combinação de memória HBM massiva e redes de alta velocidade visa justamente isso: mais processamento próximo aos dados e menos deslocamentos dispendiosos pelo data center.

Ironwood dentro do Hipercomputador de IA e da camada de software
Ironwood não existe isoladamente; está profundamente integrado à arquitetura de hipercomputadores de IA do Google Cloud . Esse conceito reúne hardware (CPUs Axion e TPUs), redes de alta velocidade, armazenamento e software de orquestração e agendamento em uma única estrutura de design.
Na camada de software, o Google utiliza sua plataforma Pathways, que permite a coordenação de dezenas de milhares de TPUs Ironwood como se fossem um único recurso lógico. Além do Pathways, ferramentas como o MaxText (para treinamento em larga escala de LLM ) e a integração com o Kubernetes Engine via Cluster Director foram aprimoradas , otimizando o agendamento e a resiliência do cluster.
Para o componente de inferência, o Google ampliou o suporte ao vLLM para funcionar tanto com GPUs quanto com TPUs , facilitando a migração de modelos e cargas de trabalho entre diferentes tipos de aceleradores com alterações mínimas no código. Além disso, o GKE Inference Gateway pode reduzir a latência da solicitação inicial em até 96% e diminuir o custo do serviço em cerca de 30%, de acordo com dados divulgados pela empresa.
Tudo isso significa que os clientes não apenas obtêm um chip rápido, mas também uma plataforma completa e otimizada de ponta a ponta . A IDC, inclusive, cita um retorno sobre o investimento de 353% em três anos para clientes de hipercomputadores de IA, com reduções de custos de TI de quase 28%.
O objetivo final é claro: permitir que as empresas aproveitem o poder do Ironwood sem a dificuldade de gerenciar infraestruturas complexas. O usuário ideal simplesmente define seus modelos e necessidades, e o plano de controle do Google Cloud orquestra perfeitamente TPUs, Axion, redes, armazenamento e software.
A “era da inferência” e o papel de Ironwood
Durante anos, grande parte do discurso sobre IA girou em torno do treinamento de modelos cada vez maiores . No entanto, o mercado se deparou com uma dura realidade: por mais espetacular que seja o treinamento, a receita sustentável vem do fornecimento de inferências em escala, dia após dia.
O Google se refere a essa nova era como a “era da inferência ”. Em vez de modelos meramente reativos que esperam que o usuário faça perguntas, estamos caminhando para agentes de IA que recuperam dados, analisam contextos, coordenam subprocessos e tomam a iniciativa de oferecer recomendações e informações processadas.
O Ironwood foi projetado precisamente para esses tipos de cargas de trabalho: modelos com raciocínio complexo, contextos extensos e estados persistentes . A grande quantidade de memória compartilhada e largura de banda de rede visa permitir que vários componentes do mesmo sistema de IA trabalhem de forma coordenada, sem serem sobrecarregados pelo tráfego.
Nesse cenário, o Google adota uma estratégia diferente da Nvidia. Enquanto os chips Blackwell continuam a dominar o treinamento de ponta e prometem velocidades de inferência muito altas em configurações específicas, o Google se concentra em otimizar a execução contínua e massiva de modelos em produção , integrando hardware e nuvem em um único pacote coerente.
A empresa não pretende substituir a Nvidia por completo, mas sim conquistar uma fatia crescente do mercado geral de inferência . Algumas estimativas internas sugerem que, até 2027, as TPUs do Google poderão representar até 30% desse mercado, especialmente entre os grandes clientes que já utilizam o Google Cloud.
O acordo com a Anthropic e o impulso comercial
O grande impulso comercial da Ironwood veio da Anthropic, desenvolvedora dos modelos Claude . Em 23 de outubro de 2025, a empresa assinou um acordo gigantesco com o Google, comprometendo-se a usar até um milhão de TPUs e investir dezenas de bilhões de dólares em infraestrutura no Google Cloud.
Este contrato prevê um consumo de energia superior a 1 gigawatt até 2026 , um número enorme que dá uma ideia da escala em que os principais intervenientes na área da IA operam. Da noite para o dia, o Ironwood passou de um projeto ambicioso no planejamento estratégico para um investimento real, apoiado por uma forte procura.
Para o Google, o acordo resolve uma de suas maiores preocupações: construir capacidade de data center sem garantia de uso . Com a Anthropic como cliente principal, a empresa pode planejar novas instalações, contratos de energia e implantações de superpods Ironwood com muito mais visibilidade sobre o retorno do investimento.
A escolha da Anthropic pelo Ironwood, em vez de esperar pela próxima geração da Nvidia ou recorrer a hardware proprietário de outros hiperescaladores, é um claro sinal de confiança na eficiência e no tempo de lançamento no mercado das TPUs do Google . "Mais inferência, menos consumo de energia" é, na prática, o lema implícito dessa decisão.
Esses tipos de acordos de longo prazo também ajudam o Google a negociar melhor seus próprios custos (da fabricação de chips ao fornecimento de energia) e a fortalecer sua posição em um mercado onde a demanda por computação de IA supera em muito a oferta disponível.
Impacto no mercado de chips de IA e concorrência com a Nvidia.
O lançamento do Ironwood representa uma mudança radical no mercado de hardware de IA , que até então era claramente dominado pelas GPUs da Nvidia. O Google não é o único a se movimentar: a AWS está impulsionando sua linha Trainium2 e a Microsoft está avançando com seu programa Maia, embora com atrasos.
A Nvidia continua na liderança em tecnologia de ponta para treinamento, com suas arquiteturas Hopper, Blackwell e a futura Rubin, que visam configurações de vários exaflops por rack. No entanto, o Google está impulsionando o mercado em direção a um modelo de múltiplos ecossistemas verticalmente integrados , onde cada provedor de hiperescala projeta seus próprios chips, rede, software e serviços em nuvem.
Nesse novo cenário, a Ironwood se posiciona como uma alternativa sólida para empresas que buscam infraestrutura de inferência em larga escala sem depender inteiramente do ecossistema CUDA. A combinação de TPUs personalizadas e CPUs Axion, além da plataforma Google Cloud, cria uma oferta altamente atraente para empresas que exigem custos, desempenho e disponibilidade previsíveis.
Essa mudança também aumenta a pressão sobre a Nvidia, que precisa justificar os altos preços em um ambiente no qual não é mais a única opção viável . À medida que Amazon, Microsoft e Google reforçam suas próprias plataformas, o mercado está se afastando do modelo de fornecedor único de chip em direção a um conjunto diversificado de soluções fechadas, porém altamente otimizadas, dentro de cada provedor de nuvem.
No entanto, o sucesso do Ironwood e das TPUs em geral dependerá muito da continuidade da evolução do conjunto de softwares do Google no mesmo ritmo que o ecossistema CUDA . Se as taxas de utilização dos clusters caírem (por exemplo, de 90% para 70%), a eficiência geral será prejudicada e a competitividade de preços poderá ser afetada.
Axion: o complemento de CPU para infraestrutura de IA
Juntamente com o lançamento do Ironwood, o Google reforçou sua família de CPUs personalizadas Axion , baseadas na arquitetura Arm Neoverse. Enquanto as TPUs lidam com os aspectos mais complexos do aprendizado de máquina, o Axion cuida das cargas de trabalho de uso geral relacionadas à IA.
As novas instâncias N4A oferecem até 64 vCPUs, 512 GB de memória DDR5 e largura de banda de rede de 50 Gbps , com melhorias de até 100% na relação custo-benefício em comparação com máquinas x86 equivalentes. Enquanto isso, o C4A Metal é a primeira versão bare-metal do Google Cloud baseada em Arm, voltada para cenários como desenvolvimento Android, aplicações automotivas e simulações avançadas.
Empresas como a Vimeo relataram uma melhoria de 30% na transcodificação de vídeo , enquanto a ZoomInfo reporta um aumento de 60% na eficiência dos processos de análise de dados. Outras empresas, como a Rise, afirmam ter reduzido o consumo de energia computacional em cerca de 20%, mantendo a latência estável.
A ideia fundamental é que o Axion atue como uma camada base de computação de propósito geral : preparação de dados, microsserviços, serviços web, lógica de negócios, etc. Sobre essa base, as TPUs do Ironwood se concentram naquilo que fazem melhor: acelerar o treinamento, a inferência e o raciocínio de modelos de IA.
Essa combinação reforça a visão de que a computação de próxima geração será híbrida : CPUs eficientes para gerenciar fluxos de trabalho e TPUs (ou outros aceleradores) para computação intensiva. Tudo isso é reunido pela plataforma AI Hypercomputer e pelas ferramentas do Google Cloud.
Perspectivas de investimento e proteção de margem para a Alphabet
Do ponto de vista financeiro, o Ironwood é muito mais do que um chip poderoso: é um componente estratégico para proteger as margens da Alphabet no negócio de IA em nuvem. Os hiperescaladores estão a caminho de atingir capacidades de energia de dois dígitos em gigawatts até 2027, e tudo indica que o investimento em infraestrutura continuará sendo massivo.
Ao projetar seus próprios chips, o Google consegue capturar valor em toda a cadeia de valor : do projeto do silício à implantação na nuvem. Em vez de revender hardware de terceiros com margens reduzidas, a empresa transforma o investimento de capital (CAPEX) em uma vantagem competitiva e uma ferramenta para diferenciar seus serviços.
O desempenho aprimorado por watt do Ironwood significa que cada megawatt de capacidade do data center oferece significativamente mais em termos de inferências atendidas . Combinado com otimizações de software (vLLM, Pathways, GKE Inference Gateway, etc.), isso permite que o Google ofereça preços competitivos sem comprometer a lucratividade.
O contrato com a Anthropic adiciona uma camada extra de estabilidade ao plano de investimentos da Google . Em vez de construir infraestrutura "às cegas", esperando que os clientes cheguem, a empresa agora pode dimensionar grande parte de sua expansão com base em acordos de longo prazo, reduzindo a incerteza e o risco de excesso de capacidade.
Ainda assim, permanecem questões em aberto: se o Google conseguirá atrair mais grandes clientes âncora, se os projetos de energia e as novas subestações permanecerão dentro do cronograma e se sua plataforma de software manterá altas taxas de utilização. O potencial existe, mas a execução será fundamental para que a Ironwood seja um sucesso técnico e um motor de lucros sustentáveis . ESTE TEXTO NÃO É UMA RECOMENDAÇÃO DE INVESTIMENTO.
Em conjunto, o Google TPU v7 Ironwood representa um salto geracional que vai muito além dos teraflops em uma ficha técnica: ele combina potência bruta, memória compartilhada massiva, redes ópticas avançadas, resfriamento líquido e uma nuvem profundamente integrada para suportar a nova onda de agentes e modelos de IA que operam ininterruptamente. Em um mundo onde a energia é escassa, os modelos crescem constantemente e a competição pelo controle da infraestrutura de IA é acirrada, o Ironwood emerge como o núcleo de uma infraestrutura projetada para inaugurar a "era da inferência" e redefinir como, onde e a que custo a inteligência artificial é executada em escala global.

