Una línea del registro de cambios hace todo el trabajo

Un equipo que llamó a deepseek-v4-flash el jueves y volvió a llamarlo el viernes recibió respuestas de dos modelos distintos. Nada cambió en su código, nada cambió en su configuración y no se lanzó ningún error. DeepSeek publicó el 31 de julio la versión oficial de su API V4-Flash bajo el nombre de compilación DeepSeek-V4-Flash-0731, y la documentación es admirablemente directa sobre lo que eso significa para quien llama: el modelo se ha actualizado, el método de llamada permanece invariable y el nombre simple alcanza la última versión.

No se ocultó. El registro de cambios es público, la tabla de resultados está publicada y la compilación lleva una fecha en el nombre. El problema no es la divulgación. El problema es que la divulgación vive donde su entorno de ejecución no lee. Todas las señales que un sistema en producción usaría para advertir que su modelo ha cambiado se mantuvieron constantes durante el cambio: la cadena del modelo en la petición, la arquitectura, el recuento de parámetros de 284.000 millones en total y 13.000 millones activados, la ventana de contexto y el precio.

DeepSeek dice explícitamente que se trata de un cambio de postentrenamiento y no de un modelo nuevo. Misma arquitectura, mismo tamaño, vuelto a postentrenar. Ese encuadre es exacto y es también la razón por la que resulta fácil subestimar el cambio. Un nuevo postentrenamiento suena a refinamiento. Lo que produjo aquí fue un conjunto distinto de capacidades detrás de un identificador invariable.

Las cifras que se movieron son las que hablan de actuar

Si se lee la tabla por categorías en vez de por filas, aparece un patrón. En Terminal Bench 2.1 la nueva compilación obtiene 82,7 frente a 61,8 de la vista previa. En NL2Repo obtiene 54,2 frente a 39,4. En Toolathlon-Verified llega a 70,3 desde 49,7. En DeepSWE pasa de 7,3 a 54,4, es decir más de siete veces. En Cybergym se mueve de 38,7 a 76,7, muy cerca del doble.

Cada una de esas medidas capta la capacidad del modelo para hacer algo y no para decir algo: ejecutar comandos de terminal, trabajar sobre un repositorio, encadenar herramientas, encontrar y explotar una debilidad. La API admite además de forma nativa el formato Responses y se ha adaptado para Codex, lo que es una declaración sobre hacia dónde espera DeepSeek que se apunte el modelo. Es una compilación afinada para recibir manos.

Por qué importa: capacidad y radio de daño son el mismo eje en cuanto un modelo tiene acceso a herramientas. La mayoría de las organizaciones decidieron a qué puede llegar un modelo observando lo que era capaz de hacer, y buena parte de esa observación se hizo contra una compilación que sacaba 7,3 en un banco de pruebas de agente de ingeniería de software. El permiso concedido sobre esa prueba no caducó cuando caducó la prueba. Si su política permite a este modelo acceso a shell, escritura en repositorios o cualquier cosa expuesta a la red, el razonamiento tras esa política se calibró con un modelo que ya no responde.

El nivel barato ya supera al caro

En la misma tabla se esconde una segunda consecuencia. V4-Pro-Preview, el modelo mayor y más caro de la familia, obtiene 72,1 en Terminal Bench 2.1. La nueva compilación Flash obtiene 82,7. El nivel barato supera ya al nivel premium de su propia familia en al menos un banco de pruebas de agente, y lo hizo de un día para otro, bajo un nombre que no cambió.

La lógica de enrutamiento es estática en la mayoría de las arquitecturas y se escribió una sola vez: el trabajo agéntico difícil al modelo capaz, el trabajo barato o de alto volumen al rápido. Esa regla codificaba un orden de capacidades que se sostenía cuando se escribió. Ya no se sostiene en todos los ejes, lo que significa que algunos equipos están pagando el nivel premium por trabajo que el nivel barato hace mejor, y sin ninguna señal de que el orden se haya invertido.

Para situarlo en el campo y no en la familia, la nueva compilación queda en 82,7 en ese banco de pruebas frente a 81,0 de GLM-5.2 de Z.AI y 85,0 de Claude Opus 4.8. La conclusión útil no es la clasificación, que volverá a moverse. Es que una distancia de ese tamaño se cerró solo mediante postentrenamiento, con requisitos de hardware invariables, en una única publicación.

Qué es el control de versiones cuando no se puede fijar

Empiece por aceptar la restricción. Los proveedores que exponen identificadores de instantánea fechados le permiten fijar una compilación y migrar de forma deliberada. La superficie de API documentada de DeepSeek ofrece los nombres simples, con la compilación fechada registrada como versión del modelo y no como algo que usted pueda llamar. La disciplina tiene que situarse, por tanto, en su lado de la frontera, porque no hay palanca contractual ni técnica que mantenga quieto al modelo.

En la práctica, eso significa tres cosas. Mantenga un pequeño conjunto de tareas propias, veinte o treinta casos que representen lo que de verdad le pide al modelo, con salidas registradas y fecha guardada. Ejecútelo de forma programada y no por rumores, porque un calendario detecta un cambio silencioso y un rumor no. Y registre el nombre de compilación que declara su proveedor junto a cada llamada de producción que le importe, para que, cuando el comportamiento se desplace, pueda distinguir un cambio de modelo de un cambio de instrucción.

Después vuelva a plantear la pregunta de la autorización, no solo la de la calidad. Las regresiones de calidad son visibles y molestas. Un aumento de capacidad es invisible y agradable, y es el que ensancha en silencio lo que puede alcanzar un agente comprometido o confundido. La versión oficial de V4-Pro está por llegar, y DeepSeek lo ha dicho. La evaluación que programe esta semana es la que estará esperando cuando aterrice.