750 tokens por segundo, en vista previa limitada

OpenAI y Cerebras anunciaron el modo Ultrafast para GPT-5.6 Sol el 13 de agosto de 2026, con hasta 750 tokens de salida por segundo, hasta 14 veces más rápido que el procesamiento estándar del modelo, según el propio anuncio de OpenAI sobre la vista previa. El nivel está disponible ahora solo para un grupo selecto de clientes mientras OpenAI evalúa cómo la velocidad adicional cambia los productos reales; otras empresas pueden apuntarse a una lista de espera enviando los detalles de su carga de trabajo. El investigador de OpenAI Jeffrey Wang describió el efecto práctico en los propios materiales de la empresa: 'Ahora termina antes de que yo tenga siquiera la oportunidad de cambiar de contexto. Me hace mucho más productivo.'

OpenAI señala interfaces de voz, atención al cliente, comercio, agentes para desarrolladores, investigación financiera y respuesta a incidentes de seguridad como los casos de uso previstos, y afirma que sus propios desarrolladores han usado la vista previa para analizar registros y trazas durante incidentes y para comprimir ciclos de investigación que antes duraban toda la noche en varias iteraciones dentro de una sola jornada de trabajo. GPT-5.6 Sol se lanzó en junio de 2026 junto con las variantes Terra (equilibrada) y Luna (centrada en velocidad), y en julio pasó a estar ampliamente disponible en ChatGPT, Codex y la API.

El chip que hace el trabajo no es de Nvidia

La ganancia de velocidad procede de la Wafer-Scale Engine de Cerebras, que mantiene los pesos completos de un modelo residentes en el propio chip, distribuidos en 44 gigabytes de SRAM integrados en cada procesador del tamaño de una oblea, según la propia entrada del blog de Cerebras sobre la colaboración. Eso elimina las transferencias repetidas entre memoria y cómputo que generan latencia en los clústeres de GPU convencionales, permitiendo que los tokens fluyan sin interrupción a través de capas del modelo organizadas en cadena y distribuidas entre varias obleas, un diseño pensado para escalar a medida que los modelos crecen, según la propia descripción técnica de Cerebras.

Cerebras lleva años posicionando esta arquitectura como una alternativa más rápida, aunque menos flexible, a los clústeres de GPU de Nvidia para cargas de trabajo de inferencia, pero sus colaboraciones públicas más destacadas hasta ahora se habían inclinado hacia laboratorios pequeños o medianos, no hacia el mayor comprador individual de capacidad de Nvidia de todo el sector. Los propios compromisos de infraestructura de OpenAI con Nvidia ascienden a cientos de miles de millones de dólares, una relación que este medio ha cubierto en detalle, lo que convierte la decisión de encauzar incluso un nivel de vista previa limitada a través de una arquitectura de chip rival en un dato notable, no en una simple diversificación rutinaria de proveedores.

Lo que la velocidad realmente compra

En GDP-Val, un punto de referencia construido en torno a tareas laborales económicamente valiosas, OpenAI reporta una aceleración de extremo a extremo de 5,6 veces sin pérdida de calidad medida. En Humanity's Last Exam, una prueba de 2.500 preguntas de nivel doctoral, GPT-5.6 Sol Ultrafast completó el conjunto entero en 11 horas y 11 minutos frente a las 78 horas y 27 minutos de Claude Fable 5, según la comparación publicada por el propio Cerebras, aproximadamente siete veces más rápido en ese punto de referencia concreto, junto con las afirmaciones separadas de Cerebras de 11 veces más rendimiento que Claude Fable 5 y 5 veces más que el modo rápido de Claude Opus 4.8.

Nada de esto convierte a GPT-5.6 Sol en un modelo más inteligente. Es el mismo modelo, respondiendo de la misma manera, solo que llega antes, lo cual importa específicamente para cargas de trabajo donde la latencia en sí misma es el cuello de botella y no la calidad del razonamiento: un agente de soporte al que un cliente no va a esperar, una respuesta de seguridad que tiene que producirse en mitad de un incidente activo, o un modelo financiero que tiene que ejecutar varios escenarios antes de que cierre el mercado.

Una cobertura frente a Nvidia, incluso para OpenAI

La lección práctica aquí no es que Cerebras haya superado a Nvidia en un punto de referencia. Es que la empresa más entrelazada financieramente con la expansión de IA de Nvidia tuvo, aun así, una razón comercial para ejecutar su nivel de producto más crítico en latencia sobre una arquitectura de chip distinta, porque la física de mantener los pesos en el propio chip gana a la física de moverlos por un clúster de GPU para esta tarea concreta. Cualquier empresa europea que construya una estrategia de infraestructura de IA a largo plazo en torno a un único proveedor de cómputo, por dominante que ese proveedor parezca hoy, debería tomar esto como prueba de que hasta los clientes más grandes se cubren cuando una carga de trabajo concreta lo exige.

Se trata de una vista previa limitada sin precios publicados, no de una decisión de producto general sobre la que las empresas deban actuar de inmediato. El movimiento útil no es cambiar de proveedor por el peso de un solo anuncio, sino anotarlo como un dato a seguir: identificar cuáles de las propias cargas de trabajo están realmente limitadas por la latencia y no por el razonamiento, porque esas son las que, con el tiempo, podrían justificar una segunda opción de infraestructura, y no solo un segundo contrato de nube, pese a la complejidad añadida.