Misma familia, mismas dos semanas, factura de hardware opuesta

El 3 de agosto, Alibaba anunció Qwen3.8-Max: 2,4 billones de parámetros en total, unos 95.000 millones activos por petición, y la promesa de que los pesos abiertos llegarían en una semana. Este medio cubrió ese anuncio en su momento y calculó lo que realmente costaría ejecutarlo por cuenta propia: unos 2,4 terabytes de memoria para alojar el modelo completo con precisión de 8 bits, más de lo que ofrece un solo nodo de ocho GPU H200, en plena escasez de memoria a escala de la industria que ya empujaba al alza los precios de los componentes.

Once días después de la promesa original de una semana, el 14 de agosto, llegaron los pesos abiertos de Qwen3.8-Max, junto con algo que el anuncio anterior no había mencionado: Qwen3.8-27B, un modelo denso de 27.780 millones de parámetros construido justo para el caso de uso que la variante Max descarta: una sola GPU de consumo.

Lo que muestran realmente los benchmarks

La propia ficha de modelo de Alibaba compara Qwen3.8-27B con Qwen3.6-27B, su predecesor directo con el mismo número de parámetros, que es la comparación honesta para juzgar el progreso generacional en lugar de comparar entre tamaños distintos. Terminal-Bench 2.1, que evalúa si un modelo puede completar tareas reales de línea de comandos, subió de 63,4 a 73,0. DeepSWE 1.1, un benchmark de ingeniería de software, se más que triplicó, de 13,3 a 42,2. OSWorld-Verified, que mide la finalización de tareas dentro de un entorno de escritorio real, subió de 63,9 a 84,3. JobBench, que mide la finalización de tareas profesionales en lugar de acertijos de programación, subió de 21,8 a 33,4, un salto de casi el 50 por ciento.

Ninguna de estas cifras hace que un modelo de 27.000 millones de parámetros sea equivalente a la variante Max de 2,4 billones lanzada el mismo día. Pero sí significan que un modelo lo bastante pequeño para funcionar en una sola GPU realiza hoy tareas para las que hace un año hacía falta un modelo mucho más grande, y esa es la historia real: el suelo de lo que cuenta como un modelo local genuinamente útil sigue bajando en requisitos de hardware mientras las puntuaciones de los benchmarks siguen subiendo.

Por qué esto divide en dos la decisión de autoalojamiento

Hace dos semanas, la respuesta honesta para una empresa de la UE o el Reino Unido que preguntara si debía autoalojar Qwen era un no rotundo, salvo que ya operara infraestructura de servidores con varias GPU, porque la huella de memoria del modelo insignia descartaba cualquier cosa más pequeña. Esa respuesta no ha cambiado para la variante Max. Ha cambiado por completo para la variante de 27.000 millones, que cabe con margen en una sola GPU de gama gaming, la misma clase de hardware que un equipo de ingeniería de tamaño medio quizá ya posea para otros fines.

La consecuencia práctica es que el autoalojamiento ya no es una decisión que una empresa toma una sola vez. Ahora es una decisión por carga de trabajo, por tamaño de modelo, dentro de la misma familia. Un equipo que necesita razonamiento de vanguardia sobre grandes volúmenes de documentos sigue necesitando la variante Max y el presupuesto multi-GPU que la acompaña. Un equipo que necesita un asistente capaz de programación o de finalización de tareas para herramientas internas quizá pueda ahora ejecutar la variante de 27.000 millones en hardware que ya posee, a una fracción del coste de una suscripción a una API a la misma escala de uso.

Qué revisar antes de descartar el autoalojamiento otra vez

Si su equipo aparcó una evaluación de autoalojamiento tras el anuncio del 3 de agosto porque las cuentas de memoria no salían, vale la pena repetirla específicamente con la variante de 27.000 millones, no con la variante Max. Revise tres cosas: si su carga de trabajo real necesita razonamiento de clase Max o quedaría bien cubierta por un modelo de 27.000 millones de parámetros, cuánto cuesta una sola GPU capaz frente a un año de gasto en API con el uso actual de su equipo, y si sus requisitos de residencia de datos son la razón real para autoalojar, en cuyo caso el coste de hardware queda en segundo plano frente al beneficio de cumplimiento normativo. Las dos cifras, 2,4 terabytes y una GPU, describen el mismo lanzamiento de Qwen. Cuál se aplica a usted depende por completo de qué tamaño necesita realmente.