Un modelo insignia se quita la etiqueta de vista previa
DeepSeek llevó su modelo insignia V4 Pro de la vista previa a la disponibilidad general el 12 de agosto de 2026, cerrando un período de pruebas que llevaba en marcha desde el 24 de abril. La compilación lleva la etiqueta de versión 0813 y sigue a la variante más pequeña, V4-Flash, que dio el mismo paso a estatus oficial el 31 de julio. Ambos modelos residen ahora en la API de producción de DeepSeek y ya no en un nivel de vista previa en el que se advirtió a los desarrolladores de posibles cambios sin aviso.
V4 Pro conserva la ventana de contexto de un millón de tokens que tenía durante la vista previa, con una salida máxima de 384.000 tokens por solicitud. DeepSeek construyó el modelo como un sistema de mezcla de expertos con 1,6 billones de parámetros totales, de los cuales 49.000 millones se activan para cada token individual, el mismo patrón de arquitectura que la empresa usa desde V3 para mantener bajos los costes de servicio mientras escala la capacidad total.
El argumento de eficiencia detrás de 1,6 billones de parámetros
El titular no es el número de parámetros, sino cómo consigue DeepSeek servirlos de forma barata. Un nuevo mecanismo de atención que la empresa llama Compressed Sparse Attention, combinado con lo que denomina Heavily Compressed Attention, reduce el cómputo necesario por cada token de inferencia al 27 por ciento de lo que requería el modelo anterior V3.2, y encoge la caché de clave-valor, intensiva en memoria, al 10 por ciento del tamaño anterior.
En los puntos de referencia, V4 Pro resuelve el 80,6 por ciento de las tareas de SWE-bench Verified, a la par con Gemini-3.1-Pro de Google en la misma prueba, y logra una tasa de acierto del 90,1 por ciento en GPQA Diamond y del 93,5 por ciento en LiveCodeBench. Se queda por detrás de GPT-5.4 de OpenAI en Terminal Bench 2.0, con un 67,9 frente a 75,1, y registra una puntuación Codeforces de 3.206, prueba de que a DeepSeek ya se le mide frente a los laboratorios estadounidenses líderes, no a su alrededor.
Un 98 por ciento más barato, y no por mucho tiempo
En su lanzamiento general, V4 Pro tiene un precio de 0,435 dólares por millón de tokens de entrada en caso de fallo de caché, 0,003625 dólares por millón en caso de acierto de caché, y 0,87 dólares por millón de tokens de salida, sin cambios respecto a la vista previa. El nivel más barato, V4-Flash, cuesta 0,14 dólares por millón de tokens de entrada y 0,28 dólares por la salida. La firma de investigación Artificial Analysis midió el coste efectivo de V4-Flash en unos 0,03 dólares por tarea de referencia, frente a 1,86 dólares del GPT-5.6 Sol de OpenAI y 3,15 dólares del Claude Fable 5 de Anthropic, una diferencia de más del 98 por ciento.
En la misma ventana que el lanzamiento de V4 Pro, la página de documentación para desarrolladores de DeepSeek incluía un aviso aparte: el precio general de la API va a subir de forma significativa en un futuro cercano, aunque la empresa no dio ni fecha ni porcentaje. Se pidió a los desarrolladores que planifiquen su uso en consecuencia, con la estructura de precios definitiva por anunciar por separado, una admisión inusual de que la lista de precios de hoy no es aquella contra la que los clientes deberían presupuestar.
La partida que acaba de volverse variable
El momento importa más que la cifra. DeepSeek avisa de una repreciación en el mismo ciclo de lanzamiento que acaba de dar a V4 Pro estatus de producción, lo que indica a los equipos de compras que la fiabilidad del modelo maduró antes que su coste. Un límite de 500 solicitudes simultáneas en el punto de acceso Pro, una quinta parte del techo de 2.500 del nivel más barato Flash, es una segunda señal en la misma dirección: la capacidad del nivel más caro y de mayor calidad es la limitación que DeepSeek gestiona primero, y el precio es la palanca que le queda.
Las empresas que trasladaron cargas de trabajo hacia modelos chinos precisamente para escapar de la imprevisible fijación de precios estadounidense ahora cargan con la misma exposición desde la dirección contraria, sin suelo y sin fecha en el calendario. Solo a modo de ilustración, no una previsión: para una startup madrileña que presupuesta en euros, una subida de unos 0,80 a 1,38 euros por millón de tokens de salida en una carga de trabajo de varios miles de millones de tokens al mes convertiría un error de redondeo en una variación anual de seis cifras, y DeepSeek no ha dado ninguna garantía de que el aumento se detenga ahí. Tratar una lista de precios subvencionada como una partida fija en un presupuesto plurianual siempre fue apostar a que un mercado con descuento se mantendría quieto; el proveedor acaba de decir, en su propia documentación, que no lo hará.
Leer a continuación: El modelo cambió, el nombre de la API no | El horario de Pekín ya fija su factura de IA



