Dos rivales construyeron una sola máquina
El 23 de julio, AMD y Cerebras anunciaron que ejecutarían un único flujo de inferencia de IA sobre los chips de ambas empresas, el tipo de unión que los competidores suelen evitar. AMD Helios, el rack formado por procesadores EPYC y GPU Instinct, procesa el prompt y la gran ventana de contexto. Después, la Cerebras Wafer-Scale Engine genera los tokens, la parte que los usuarios perciben como velocidad.
La consejera delegada de AMD, Lisa Su, describió la inferencia como una de las mayores oportunidades de infraestructura de la IA, cuya creciente diversidad exige un enfoque más flexible. El consejero delegado de Cerebras, Andrew Feldman, vendió el mismo acuerdo por la pura latencia. Lo que ambos dejaron sin decir es rotundo: ya ningún chip gana solo el trabajo entero.
Prefill y decode quieren silicio distinto
La inferencia moderna tiene dos fases con apetitos opuestos. El prefill, leer el prompt y su contexto, es intensivo en cómputo y premia el rendimiento, justo lo que hace bien un rack de GPU como Helios. El decode, escribir cada token nuevo, es intensivo en ancho de banda de memoria y premia una latencia ultrabaja, y ahí brilla una única oblea gigante de Cerebras. Obligar a un solo chip a hacer ambas cosas significa pagar capacidad que la otra fase desperdicia.
Separar las dos, un enfoque que el sector llama inferencia desagregada, permite que cada fase corra sobre el hardware pensado para ella. Esa es la verdadera noticia, más que el logotipo de cualquier proveedor: se rompe la suposición de que un acelerador sirve a un modelo entero.
Lea la nota al pie del 5x
Las empresas prometen hasta cinco veces más tokens por segundo y vatio. Lea las condiciones: la cifra la modelaron AMD y Cerebras en julio de 2026 con el modelo Kimi 2.6 1T, y la comparación es frente a una configuración solo de Cerebras en un punto de interactividad comparable, no frente a Nvidia ni como benchmark medido en producción. El propio material de prensa advierte de que configuraciones distintas dan resultados distintos.
El despliegue también es estrecho. Se espera el sistema conjunto en Cerebras Cloud en la segunda mitad de 2026, un servicio alojado antes de ser algo que usted instale. Los mercados lo leyeron como incremental, y la acción de AMD cedió alrededor del 3 por ciento ese día. Trate el 5x como un techo modelado, no como un recibo.
Qué cambia para su presupuesto de cómputo
Para un operador europeo que dimensiona una función de IA, la lección es tarificar la inferencia por fase, no por chip. Un chatbot de atención al cliente vive en la fase de decode, donde la latencia y los vatios por token deciden la factura; una tubería de análisis de contratos que ingiere documentos largos se apoya en el rendimiento del prefill. El mismo euro de hardware compra economías muy distintas según en qué mitad se apoye.
La señal amplia pesa más que un producto: fuera de Nvidia se forma un segundo stack de inferencia creíble a escala de rack, y se vende como capacidad en la nube que puede alquilar este año. Eso no destrona a nadie, pero da a los compradores un segundo presupuesto, y un segundo presupuesto es como los precios dejan de imponerse.
Leer a continuación: El arreglo de Claude no llega hasta 2027 | Una segunda fuente de chips de IA despierta



