La noticia que corrió como la pólvora anoche era de esperar, y de hecho, ha tardado bastante en llegar dado el atraso que tienen actualmente los de Lisa Su. AMD no se ha lanzado a comprar Taalas porque necesite otra GPU para competir con NVIDIA, sino porque esta startup canadiense ha demostrado una forma muy distinta de ejecutar modelos de Inteligencia Artificial: en lugar de almacenar el modelo en memoria HBM y mover continuamente sus pesos hasta las unidades de cálculo, Taalas convierte el propio modelo en hardware, integrando almacenamiento y computación dentro del silicio.
AMD confirmó ayer noche un acuerdo definitivo para adquirir la compañía por una cantidad no revelada, con la intención de incorporar esta tecnología a su roadmap de aceleradores para IA y utilizarla junto a sus GPU AMD Instinct. ¿Qué buscan los rojos con esta adquisición?
AMD compra Taalas para competir con NVIDIA y su adquisición de Groq gracias a 17.000 tokens/s con Llama 3.1 8B
La gracia está en atacar uno de los grandes problemas de la inferencia actual, donde buena parte del coste y consumo nace de mantener alimentadas las unidades de cálculo con datos procedentes de memoria externa. Taalas denomina a su propuesta Hardcore Models y asegura que puede transformar un modelo en silicio personalizado en apenas dos meses, eliminando HBM, empaquetado avanzado, apilamiento 3D, enlaces de E/S de alta velocidad e incluso refrigeración líquida.
Su primera demostración es el HC1, un chip fabricado por TSMC a 6 nm, con 815 mm² y 53.000 millones de transistores, donde Taalas ha integrado directamente Llama 3.1 8B. En un servidor de 2,5 kW, la compañía asegura alcanzar 17.000 tokens por segundo y usuario, casi diez veces el rendimiento de las alternativas utilizadas en su comparativa, mientras habla de un sistema 20 veces más barato de fabricar y con un consumo diez veces inferior.
Este enfoque es realmente el motivo de que AMD se haya lanzado a comprar Taalas, porque es muy similar a lo que NVIDIA va a poner en el mercado en breve con las LPU de Groq, y claro, los rojos no quieren quedarse atrás en rendimiento, eficiencia y costes.
AMD quiere combinar esta especialización con Instinct
No todo es magia, porque este primer HC1 utiliza una cuantización agresiva mezclando parámetros de 3 y 6 bits, algo que la propia Taalas reconoce que provoca cierta pérdida de calidad frente a ejecutar el modelo sobre una GPU. Su segunda generación, HC2, dará el salto a formatos FP4 estandarizados y ofrecerá mayor densidad para modelos más grandes.
Y aquí está probablemente la razón principal de la compra. AMD no plantea sustituir sus GPU Instinct por chips Taalas, sino ampliar su plataforma con aceleradores especializados para cargas de inferencia donde un mismo modelo tenga que ejecutarse millones de veces. La compañía confirma que integrará la tecnología dentro de su roadmap de aceleradores y desarrollará soluciones a nivel de sistema junto a AMD Instinct, encajándolas además con EPYC, ROCm y los sistemas AMD Helios a escala de rack.
Instinct puede mantener la flexibilidad necesaria para trabajar con modelos diferentes, mientras Taalas puede encargarse de modelos consolidados donde importe sacar la máxima cantidad de tokens por euro y por vatio. La startup había levantado unos 219 millones de dólares desde 2023 y afirma haber gastado unos 30 millones para llevar su primer producto hasta este punto con un equipo de 24 personas, así que AMD compra tanto una arquitectura poco convencional como un equipo capaz de convertirla en silicio real.
Lo que no se sabe todavía es el precio que AMD ha pagado por comprar Taalas, pero seguro que no será barato precisamente. Veremos en algo más de un año los primeros frutos de esta adquisición y sus métricas de rendimiento.
La entrada AMD compra Taalas para integrar modelos de IA directamente en silicio: hasta 17.000 tokens/s sin recurrir a memoria HBM aparece primero en El Chapuzas Informático.







