Equipo editorial de Tinta Tech. Cobertura diaria de tecnología, IA, mercados y criptomonedas con perspectiva latinoamericana. Conoce al equipo →
La inferencia de IA desagregada está demostrando ser más que una respuesta complementaria al cuello de botella de precarga y decodificación que ralentiza la IA empresarial a escala, y Cerebras y AMD acaban de anunciar una asociación para construir la versión más rápida del mundo.
La reciente colaboración combina la arquitectura de escala de rack Helios de AMD para la fase de precarga de computación intensiva con Cerebras Wafer-Scale Engine para decodificación de latencia ultrabaja, según Julie Choi (en la foto), directora de marketing de Cerebras. La combinación resultante ofrece tokens por segundo por vatio 5 veces más altos en comparación con las soluciones existentes. A finales de este año, Cerebras incorporará los sistemas AMD Helios a sus propios centros de datos para impulsar la capa de precarga de la implementación de producción.
“Lisa y Andrew anunciaron cómo AMD y Cerebras están colaborando en la solución de inferencia desagregada más poderosa del mundo”, dijo Choi. “En este caso, uno más uno es igual a cinco X”.
Choi habló con John Furrier de , en el evento Neo4j GraphTalk durante una transmisión exclusiva en el estudio de transmisión en vivo de Media. Discutieron la arquitectura técnica detrás de la inferencia de IA desagregada, junto con qué cargas de trabajo están impulsando la demanda más rápida y por qué la asociación se extiende a la implementación de AMD Helios dentro de los centros de datos de Cerebras antes de finales de 2026.
La inferencia de IA desagregada combina AMD Helios con Cerebras para lograr un rendimiento máximo y una latencia mínima
La lógica arquitectónica es bastante sencilla. El precarga requiere un uso intensivo de computación, pero se puede administrar con una infraestructura de GPU optimizada como AMD Helios. La decodificación está limitada por el ancho de banda de la memoria. Cerebras Wafer-Scale Engine transporta aproximadamente 2000 veces el ancho de banda de memoria de las GPU Nvidia de la competencia, lo que lo hace especialmente diseñado para el cuello de botella de decodificación que limita la inferencia de IA a gran escala en la producción.
“En la parte de decodificación, este es un problema de ancho de banda de memoria limitado”, dijo Choi. "El motor Cerebras Wafer-Scale tiene la mayor cantidad de ancho de banda de memoria. 2000 veces más que las GPU de Nvidia".
Las cargas de trabajo que impulsan la mayor demanda de inferencia de IA desagregada son la codificación agente, la voz en tiempo real y la generación multimodal. Todas estas son categorías en las que la velocidad de respuesta es un requisito funcional. La ganancia de rendimiento 5 veces mayor significa que la misma infraestructura puede servir a un número dramáticamente mayor de usuarios simultáneos, y se esperan esfuerzos conjuntos de comercialización antes de fin de año, señaló Choi. Cerebras también incorporará los sistemas AMD Helios a sus propios centros de datos este año para impulsar la capa de precarga, haciendo de la asociación una colaboración de productos y un compromiso de infraestructura de producción.
“Nuestra visión es realmente proporcionar esta velocidad y máxima inteligencia, sin concesiones, a todos los desarrolladores de la Tierra”, dijo Choi.
Aquí está la entrevista completa en video, parte de la cobertura de y del evento Neo4j GraphTalk:
(* Divulgación: es un socio de medios pago para el evento Neo4j GraphTalk. Ni Neo4j, el patrocinador de la cobertura del evento, ni otros patrocinadores tienen control editorial sobre el contenido de o.)