Misma familia, mismas dos semanas, factura de hardware opuesta
El 3 de agosto, Alibaba anuncio Qwen3.8-Max: 2,4 billones de parámetros en total, unos 95000 millones activos por petición, y la promesa de que los pesos abiertos llegarian en una semana. Este medio cubrio ese anuncio en su momento y calculo lo que realmente costaría ejecutarlo por cuenta propia: unos 2,4 terabytes de memoria para alojar el modelo completo con precisión de 8 bits, más de lo que ofrece un solo nodo de ocho GPU H200, en plena escasez de memoria a escala de la industria que ya empujaba los precios de los componentes al alza.
Once días después de la promesa original de una semana, el 14 de agosto, llegaron los pesos abiertos de Qwen3.8-Max, junto con algo que el anuncio anterior no había mencionado: Qwen3.8-27B, un modelo denso de 27780 millones de parámetros construido justo para el caso de uso que la variante Max descarta, una sola GPU de consumo.
Lo que muestran realmente los benchmarks
La propia ficha de modelo de Alibaba compara Qwen3.8-27B con Qwen3.6-27B, su predecesor directo con el mismo número de parámetros, que es la comparación honesta para juzgar el progreso generacional en lugar de comparar entre tamaños distintos. Terminal-Bench 2.1, que evalua si un modelo puede completar tareas reales de linea de comandos, subio de 63,4 a 73,0. DeepSWE 1.1, un benchmark de ingeniería de software, se más que triplico de 13,3 a 42,2. OSWorld-Verified, que mide completar tareas dentro de un entorno de escritorio real, subio de 63,9 a 84,3. JobBench, que mide la finalización de tareas profesionales en lugar de acertijos de programación, subio de 21,8 a 33,4, un salto de casi el 50 por ciento.
Ninguna de estas cifras hace que un modelo de 27000 millones de parámetros sea equivalente a la variante Max de 2,4 billones lanzada el mismo día. Pero si significan que un modelo lo bastante pequeño para funcionar en una sola GPU hoy realiza tareas para las que hace un año se necesitaba un modelo mucho más grande, y esa es la historia real: el suelo de lo que cuenta como un modelo local genuinamente útil sigue bajando en requisitos de hardware mientras las puntuaciones de los benchmarks siguen subiendo.
Por que esto divide en dos la decisión de autoalojamiento
Hace dos semanas, la respuesta honesta para un dueño en la UE o el Reino Unido que preguntara si debia autoalojar Qwen era un no rotundo, salvo que la empresa ya operara infraestructura de servidores con varias GPU, porque la huella de memoria del modelo insignia descartaba cualquier cosa más pequena. Esa respuesta no ha cambiado para la variante Max. Ha cambiado por completo para la variante de 27000 millones, que cabe con margen en una sola GPU de gama gaming, la misma clase de hardware que un equipo de ingeniería de tamaño medio quizas ya posea para otros fines.
La consecuencia práctica es que el autoalojamiento ya no es una decisión que una empresa toma una sola vez. Ahora es una decisión por carga de trabajo, por tamaño de modelo, dentro de la misma familia. Un equipo que necesita razonamiento de vanguardia sobre grandes volumenes de documentos sigue necesitando la variante Max y el presupuesto multi-GPU que la acompana. Un equipo que necesita un asistente capaz de programación o finalización de tareas para herramientas internas quizás pueda ahora ejecutar la variante de 27000 millones en hardware que ya posee, a una fracción del coste de una suscripción API a la misma escala de uso.
Que revisar antes de descartar el autoalojamiento otra vez
Si su equipo aparco una evaluación de autoalojamiento tras el anuncio del 3 de agosto porque las cuentas de memoria no salian, vale la pena repetirla especificamente con la variante de 27000 millones, no con la variante Max. Revise tres cosas: si su carga de trabajo real necesita razonamiento de clase Max o quedaria bien cubierta por un modelo de 27000 millones de parámetros, cuanto cuesta una sola GPU capaz frente a un año de gasto en API con el uso actual de su equipo, y si sus requisitos de residencia de datos son la razón real para autoalojar, en cuyo caso el coste de hardware queda en segundo plano frente al beneficio de cumplimiento normativo. Las dos cifras, 2,4 terabytes y una GPU, describen el mismo lanzamiento de Qwen. Cuál se aplica a usted depende por completo de que tamaño necesita realmente.
Leer a continuación: Alibaba ocultó la cifra que fija su coste | Un teléfono, una IA distinta tras cada frontera



