Lo que se publicó el 13 de agosto
DeepSeek publicó Harness v0.1 en vista previa abierta para desarrolladores el 13 de agosto de 2026, difundiendo el código fuente completo bajo la permisiva licencia MIT, según el propio repositorio de GitHub de la empresa y confirmado por varios medios especializados que revisaron el lanzamiento. El proyecto está dirigido por Cui Tianyi, que se incorporó a DeepSeek en marzo de 2026 tras dejar la firma de trading cuantitativo Jane Street, y alcanzó la vista previa pública unos cinco meses después de que su equipo empezara a reclutar desarrolladores en mayo de 2026. Harness es un framework de ejecución de agentes: el andamiaje de bucles, herramientas y gestión de sesiones que convierte un modelo de lenguaje en bruto en algo capaz de leer una base de código, ejecutar comandos de terminal y completar tareas de ingeniería de varios pasos por su cuenta.
Lo llamativo del lanzamiento no son las funciones del framework, sino lo que DeepSeek afirma que realmente es: la misma herramienta interna que la empresa usó para evaluar sus propios modelos DeepSeek V4-Flash y V4-Pro antes de publicar sus puntuaciones, según las propias notas de la publicación de la empresa. Framework y modelo suelen mantenerse separados en las afirmaciones públicas de un laboratorio; aquí DeepSeek entrega ambos a la vez, permitiendo que desarrolladores externos repitan exactamente el andamiaje detrás de sus propias cifras publicadas en lugar de confiar en ellas por fe.
La misma herramienta, sin secretos: cómo funciona Harness
Harness funciona sobre lo que DeepSeek llama un metamarco 'Cordis', organizado en torno a una sola idea que la empresa repite en su propia documentación: 'todo es un complemento'. Modelos, herramientas, entornos aislados, bucles de ejecución e incluso la interfaz de usuario pueden sustituirse sin tocar el código fuente subyacente, y el sistema mantiene registros de sesión de solo añadido para que cualquier ejecución de un agente pueda reanudarse, bifurcarse en una nueva rama o repetirse paso a paso más tarde, según la propia descripción técnica de DeepSeek. La vista previa incluye cuatro modos: un modo Standard de agente completo, un modo Code orientado a la orquestación en TypeScript para desarrolladores que quieran programar su propia lógica de agente, un modo Minimal reducido pensado específicamente para evaluaciones comparativas, y un modo Creator para guardar configuraciones personalizadas.
Lo crucial es que Harness no está limitado a los propios modelos de DeepSeek. La lista de proveedores de modelos del propio framework incluye DeepSeek, Anthropic, OpenAI, Amazon Bedrock, Google Vertex, Microsoft Azure y cualquier endpoint compatible con OpenAI, según las opciones de configuración publicadas del proyecto, lo que significa que un desarrollador puede apuntar la herramienta exacta con la que DeepSeek se evalúa a sí misma hacia un modelo Claude o GPT y obtener una ejecución directamente comparable.
La apuesta silenciosa detrás de regalarlo
Todos los laboratorios de vanguardia tratan su metodología de evaluación como un secreto competitivo tácito. Las puntuaciones se publican; el andamiaje, las instrucciones y la lógica de reintentos que las produjeron casi nunca se publican, razón por la cual los laboratorios rivales se acusan habitualmente entre sí de medir en condiciones favorables que el mundo exterior no puede reproducir. El movimiento de DeepSeek rompe ese patrón de una manera concreta y calculada: en lugar de pedirle al sector que confíe en sus puntuaciones V4 publicadas, publicó la propia vara de medir, de forma gratuita, bajo una licencia lo bastante permisiva como para que cualquier empresa construya un producto comercial encima - los mismos términos de licencia que permitieron que React y Node.js se convirtieran en infraestructura por defecto para todo un sector.
Esa es la verdadera historia aquí, y no aparece en ningún titular que cubra el lanzamiento como 'un rival de código abierto de Claude Code'. Si suficientes desarrolladores adoptan Harness como su entorno de ejecución de agentes por defecto, DeepSeek no solo gana reputación por transparencia: se convierte silenciosamente en la herramienta con la que se miden por defecto los modelos de otros laboratorios. Poseer la regla es una forma de influencia de plataforma más barata y sutil que ganar la carrera de cómputo que libra el resto del sector, y no requiere que los propios modelos de DeepSeek sean los más rápidos ni los más inteligentes para dar resultado.
Lo que esto cambia para quien apuesta por los benchmarks de IA
Para una empresa que evalúa plataformas de agentes, el valor práctico inmediato es real: Harness permite a un equipo ejecutar sus propias cargas de trabajo a través del mismo andamiaje que DeepSeek usó para generar sus puntuaciones publicadas, contra los modelos de DeepSeek o los de un rival, en lugar de aceptar sin más las afirmaciones de referencia de cualquier laboratorio. Eso es una mejora genuina en un sector donde 'nuestro modelo obtuvo X' se ha vuelto casi imposible de refutar para cualquiera fuera del laboratorio que hizo la prueba.
También conlleva una cuestión de gobernanza que nada tiene que ver con la calidad del modelo. Una licencia MIT no exige que una entidad sea de confianza, solo que sea legalmente utilizable, y un equipo domiciliado en China se ofrece a convertirse en el instrumento de medida por defecto para las afirmaciones sobre IA agéntica en todo el sector - la misma cuestión de dependencia de segundo orden que ya ha condicionado las decisiones de adquisición en torno a los modelos de DeepSeek y Moonshot. Adoptar la herramienta no es la misma decisión que adoptar el modelo, y las empresas no deberían dejar que la buena voluntad de una difumine el perfil de riesgo de la otra.
Leer a continuación: El modelo cambió, el nombre de la API no | Claude Code dejará de pedir permiso el 14 de agosto



