Mesma família, mesmas duas semanas, conta de hardware oposta

A 3 de agosto, a Alibaba anunciou o Qwen3.8-Max: 2,4 biliões de parâmetros no total, cerca de 95 mil milhões ativos por pedido, e a promessa de que os pesos abertos chegariam numa semana. Este órgão de comunicação tinha noticiado esse anúncio na altura e calculado quanto custaria realmente correr o modelo por conta própria: cerca de 2,4 terabytes de memória para conter o modelo completo com precisão de 8 bits, mais do que oferece um único nó de oito GPU H200, em plena escassez de memória a nível da indústria, que já empurrava os preços dos componentes para cima.

Onze dias depois da promessa original de uma semana, a 14 de agosto, chegaram os pesos abertos do Qwen3.8-Max, junto com algo que o anúncio anterior não tinha mencionado: o Qwen3.8-27B, um modelo denso de 27,78 mil milhões de parâmetros construído precisamente para o caso de uso que a variante Max exclui: uma única GPU de consumo.

O que os benchmarks mostram realmente

A própria ficha de modelo da Alibaba compara o Qwen3.8-27B com o Qwen3.6-27B, o seu antecessor direto com o mesmo número de parâmetros, que é a comparação honesta para avaliar o progresso geracional em vez de comparar tamanhos diferentes. O Terminal-Bench 2.1, que testa se um modelo consegue completar tarefas reais de linha de comandos, subiu de 63,4 para 73,0. O DeepSWE 1.1, um benchmark de engenharia de software, mais do que triplicou, de 13,3 para 42,2. O OSWorld-Verified, que mede a conclusão de tarefas num ambiente de trabalho real, subiu de 63,9 para 84,3. O JobBench, que mede a conclusão de tarefas profissionais em vez de puzzles de código, subiu de 21,8 para 33,4, um salto de cerca de 50 por cento.

Nenhum destes números torna um modelo de 27 mil milhões de parâmetros equivalente à variante Max de 2,4 biliões lançada no mesmo dia. Significam, sim, que um modelo suficientemente pequeno para correr numa única GPU realiza hoje tarefas para as quais há um ano era preciso um modelo muito maior, e essa é a verdadeira história: o patamar mínimo do que conta como um modelo local genuinamente útil continua a descer em requisitos de hardware, enquanto as pontuações dos benchmarks continuam a subir.

Porque é que isto divide em dois a decisão de auto-hospedagem

Há duas semanas, a resposta honesta a uma empresa na UE ou no Reino Unido que perguntasse se devia auto-hospedar o Qwen era um não categórico, a menos que já operasse infraestrutura de servidores com várias GPU, porque a pegada de memória do modelo topo de gama excluía tudo o que fosse mais pequeno. Essa resposta não mudou para a variante Max. Mudou por completo para a variante de 27 mil milhões, que cabe com folga numa única GPU de gama gaming, a mesma classe de hardware que uma equipa de engenharia de dimensão média talvez já possua para outros fins.

A consequência prática é que a auto-hospedagem deixou de ser uma decisão que uma empresa toma uma única vez. É agora uma decisão por carga de trabalho, por tamanho de modelo, dentro da mesma família. Uma equipa que precisa de raciocínio de ponta sobre grandes volumes de documentos continua a precisar da variante Max e do orçamento multi-GPU que a acompanha. Uma equipa que precisa de um assistente capaz de programação ou de conclusão de tarefas para ferramentas internas pode agora eventualmente correr a variante de 27 mil milhões em hardware que já possui, por uma fração do custo de uma subscrição API à mesma escala de utilização.

O que verificar antes de descartar de novo a auto-hospedagem

Se a sua equipa pôs de lado uma avaliação de auto-hospedagem depois do anúncio de 3 de agosto porque as contas de memória não fechavam, vale a pena refazê-las especificamente com a variante de 27 mil milhões, não com a variante Max. Verifique três coisas: se a sua carga de trabalho real precisa de raciocínio de classe Max ou ficaria bem servida por um modelo de 27 mil milhões de parâmetros, quanto custa uma única GPU capaz face a um ano de despesa em API com a utilização atual da sua equipa, e se os seus requisitos de residência de dados são a verdadeira razão para a auto-hospedagem, caso em que o custo de hardware fica secundário face ao benefício de conformidade. Os dois números, 2,4 terabytes e uma GPU, descrevem o mesmo lançamento Qwen. Qual se aplica a si depende inteiramente do tamanho de que realmente precisa.