¡Cuídate, Jensen! Con sus TPU, Google ha demostrado una y otra vez que lo que importa no es el tamaño de sus aceleradores, sino la eficiencia con la que pueden escalarse en producción.
Ahora que su última generación de aceleradores Ironwood está programada para disponibilidad general en las próximas semanas, Chocolate Factory no solo tiene la escala de su lado, sino también un procesador tensorial (TPU) con la capacidad de competir con los gigantes de Nvidia, Blackwell.
Anunciados por primera vez en abril junto con una comparación cómicamente pobre con la supercomputadora El Capitán (no, el Ironwood TPU Pod no es 24 veces más rápido que el hierro más grande del Departamento de Energía), los aceleradores TPU v7 de Google son un gran salto en rendimiento con respecto a las generaciones anteriores.
Históricamente, las TPU de Google palidecen en comparación con las GPU modernas de la talla de Nvidia y, más recientemente, AMD en términos de FLOPS sin procesar, capacidad de memoria y ancho de banda, compensando este déficit simplemente teniendo más.
Google ofrece sus TPU en pods (dominios informáticos grandes y escalables) que contienen cientos o incluso miles de chips. Si se requieren cálculos adicionales, los usuarios pueden expandirse a varios pisos.
Con TPU v7, los aceleradores de Google ofrecen un rendimiento a una distancia sorprendente de las GPU Blackwell de Nvidia al normalizar el rendimiento de punto flotante con la misma precisión.
Cada Ironwood TPU cuenta con 4,6 petaFLOPS de rendimiento sólido FP8, ligeramente superior al B200 de Nvidia con 4,5 petaFLOPS y poco menos de los 5 petaFLOPS proporcionados por los aceleradores GB200 y GB300, más potentes y que consumen más energía, del gigante de las GPU.
Este cómputo se alimenta con 192 GB de memoria HBM3e que ofrecen 7,4 TB/s de ancho de banda, lo que nuevamente lo coloca en el mismo rango que el B200 de Nvidia con 192 GB de HBM y 8 TB/s de ancho de banda de memoria.
Para la comunicación de chip a chip, cada TPU incluye cuatro enlaces ICI que proporcionan 9,6 Tbps de ancho de banda bidireccional total, en comparación con los 14,4 Tbps (1,8 TB/s) del B200 y B300.
En pocas palabras, Ironwood es el TPU más capaz de Google hasta la fecha, ofreciendo 10 veces el rendimiento del TPU v5p, 4 veces el rendimiento de los aceleradores TPU v6e «Trillium» presentados el año pasado y aproximadamente igualando el de los últimos chips Nvidia y AMD.
El rendimiento coincide con la escala
Pero, como mencionamos anteriormente, el verdadero truco de Google es la capacidad de escalar TPU en dominios informáticos realmente enormes. Los sistemas de rack NVL72 de Nvidia reúnen 72 de los últimos aceleradores Blackwell en un único dominio informático utilizando su tecnología de conectividad NVLink patentada. AMD hará algo similar con sus racks Helios y la serie MI450 el próximo año.
En comparación, el Ironwood es monstruoso: Google ofrece los chips en paquetes de 256 en el extremo inferior y 9216 en el extremo superior. Si eso no es suficiente, los usuarios con bolsillos lo suficientemente profundos pueden expandirse a POD adicionales. En abril, Google nos dijo que su tecnología de red de centros de datos Júpiter podría, en teoría, soportar grupos informáticos a gran escala de hasta 43 módulos TPU v7, o aproximadamente 400.000 aceleradores. Dicho esto, si bien puede ser compatible, no está claro qué tan grandes serán en la práctica los clústeres TPU v7 de Google.
Para ser claros, los clústeres de computación que contienen cientos de miles de GPU Nvidia existen y de hecho se han convertido en algo común. La diferencia es que hasta la generación Blackwell, estos clústeres se construían utilizando cajas GPU de ocho vías dispuestas en dominios de escala masiva. El NVL72 de Nvidia aumentó la unidad de cómputo en un factor de nueve, pero todavía está muy lejos del TPU POD de Google.
El enfoque de Google para escalar las estructuras informáticas difiere significativamente del de Nvidia. Mientras que el gigante de las GPU optó por una topología de conmutador grande y relativamente plana para sus plataformas montadas en bastidor, que hemos discutido detalladamente aquí, Google utiliza una topología tórica 3D donde cada chip se conecta a los demás en una red tridimensional.
La topología elimina la necesidad de conmutadores de paquetes de alto rendimiento, que son costosos, consumen mucha energía y, bajo cargas pesadas, pueden introducir retrasos no deseados.
Si bien un toroide puede eliminar la latencia del conmutador, una topología de malla significa que pueden ser necesarios más saltos para que un chip se comunique con otro. A medida que crece el toroide, también crece el potencial de latencia entre chips. Al utilizar conmutadores, Nvidia y AMD pueden garantizar que sus GPU estén como máximo a dos saltos del siguiente chip.
Como entendemos, cuál es mejor depende de la carga de trabajo. Algunas cargas de trabajo pueden beneficiarse de grandes topologías de múltiples saltos, como el toro 2D y 3D utilizado en las cápsulas de TPU de Google, mientras que otras pueden funcionar mejor en los dominios de computación conmutados más pequeños proporcionados por los diseños de rack de Nvidia y AMD.
Debido a esto, Google utiliza un tipo diferente de tecnología de conmutación que le permite dividir sus módulos de TPU en diferentes formas y tamaños para adaptarse mejor a sus cargas de trabajo internas y de clientes.
En lugar de los conmutadores de paquetes con los que quizás esté familiarizado, Google utiliza conmutadores de circuitos ópticos (OCS). Están más cerca de las centrales telefónicas del siglo XX. Los dispositivos OCS utilizan diferentes métodos, siendo uno los dispositivos MEMS, para conectar una TPU a otra. Y dado que esta conexión generalmente se realiza a través de un proceso físico que conecta un puerto a otro, introduce poca o ninguna demora.
Como beneficio adicional, OCS también ayuda con la tolerancia a fallas porque si la TPU falla, los dispositivos OCS pueden desconectarla de la red y reemplazarla con una pieza que funcione.
Victoria sobre la competencia
Google ha estado utilizando toros 2D y 3D junto con dispositivos OCS en sus módulos TPU desde al menos 2021, cuando TPU v4 hizo su debut. Google tampoco es ajeno a la ejecución de estructuras informáticas masivas en la fabricación.
Su TPU v4 admite POD de hasta 4096 chips de tamaño, mientras que su TPU v5p lo duplica con creces a 8960. Por lo tanto, el salto a 9216 TPU POD con Ironwood no debería ser difícil para Google.
La presencia de estos dominios informáticos masivos ciertamente ha atraído la atención de los principales fabricantes de modelos, incluidos aquellos para los cuales los modelos Gemini de Google son un competidor directo. Anthropic se encuentra entre los clientes más importantes de Google y ha anunciado planes para utilizar hasta un millón de TPU para entrenar y dar servicio a la próxima generación de modelos Claude.
La adopción por parte de Anthropic de la tecnología TPU de Google no es sorprendente dado que los desarrolladores del modelo también alojan sus cargas de trabajo en cientos de miles de aceleradores Trainium 2 de Amazon bajo el Proyecto Rainier, que también utilizan topologías de malla tórica 2D y 3D en sus estructuras informáticas.
Si bien el director ejecutivo de Nvidia, Jensen Huang, puede desdeñar la amenaza de los ASIC de IA a su imperio de GPU, es difícil ignorar el hecho de que los chips de Google, Amazon y otros se están poniendo al día rápidamente en términos de capacidades de hardware y escalabilidad de red, y el software a menudo demuestra ser el factor decisivo.
Quizás por eso los analistas siguen planteando la pregunta trimestre tras trimestre. ®

