Ta sama rodzina, te same dwa tygodnie, odwrotny rachunek za sprzęt

3 sierpnia Alibaba zapowiedziała Qwen3.8-Max: 2,4 biliona parametrów łącznie, około 95 miliardów aktywnych na zapytanie, oraz obietnicę, że otwarte wagi pojawią się w ciągu tygodnia. Ten serwis opisał wtedy tę zapowiedź i policzył, ile naprawdę kosztowałoby samodzielne uruchomienie modelu: około 2,4 terabajta pamięci, by pomieścić cały model przy precyzji 8-bitowej, czyli więcej, niż oferuje pojedynczy węzeł z ośmioma GPU H200, w środku ogólnobranżowego niedoboru pamięci, który już wtedy podnosił ceny komponentów.

Jedenaście dni później niż pierwotna obietnica jednego tygodnia, 14 sierpnia, pojawiły się otwarte wagi Qwen3.8-Max, razem z czymś, czego wcześniejsza zapowiedź nie wspominała: Qwen3.8-27B, gęsty model z 27,78 miliarda parametrów, zbudowany dokładnie pod przypadek użycia, który wariant Max wyklucza, czyli pojedyncze GPU konsumenckie.

Co naprawdę pokazują testy

Własna karta modelu Alibaby porównuje Qwen3.8-27B z Qwen3.6-27B, jego bezpośrednim poprzednikiem o tej samej liczbie parametrów, co jest uczciwym porównaniem do oceny postępu generacyjnego, a nie porównywania różnych rozmiarów. Terminal-Bench 2.1, który sprawdza, czy model potrafi wykonać realne zadania w linii komend, wzrósł z 63,4 do 73,0. DeepSWE 1.1, test inżynierii oprogramowania, wzrósł ponad trzykrotnie, z 13,3 do 42,2. OSWorld-Verified, który mierzy wykonywanie zadań w prawdziwym środowisku pulpitu, wzrósł z 63,9 do 84,3. JobBench, który mierzy wykonywanie zadań zawodowych zamiast zagadek programistycznych, wzrósł z 21,8 do 33,4, czyli skok o około 50 procent.

Żadna z tych liczb nie czyni modelu o 27 miliardach parametrów równoważnym wariantowi Max o 2,4 biliona parametrów, wydanemu tego samego dnia. Oznaczają jednak, że model wystarczająco mały, by działać na pojedynczym GPU, wykonuje dziś zadania, do których rok temu potrzebny był znacznie większy model, i to jest prawdziwa historia: próg tego, co liczy się jako naprawdę użyteczny model lokalny, wciąż się obniża pod względem wymagań sprzętowych, podczas gdy wyniki testów wciąż rosną.

Dlaczego to dzieli decyzję o self-hostingu na dwie

Dwa tygodnie temu uczciwa odpowiedź dla firmy z UE lub Wielkiej Brytanii pytającej, czy hostować Qwen samodzielnie, brzmiała: jasne nie, chyba że firma już miała infrastrukturę serwerową z wieloma GPU, ponieważ zapotrzebowanie na pamięć modelu flagowego wykluczało wszystko mniejsze. Ta odpowiedź nie zmieniła się dla wariantu Max. Zmieniła się całkowicie dla wariantu 27B, który mieści się z zapasem na pojedynczym GPU klasy gamingowej, czyli tej samej klasie sprzętu, którą zespół inżynierski średniej wielkości może już posiadać do innych celów.

Praktyczna konsekwencja jest taka, że self-hosting nie jest już decyzją, którą firma podejmuje raz na zawsze. Jest teraz decyzją podejmowaną dla każdego obciążenia z osobna, dla każdego rozmiaru modelu, w ramach tej samej rodziny. Zespół, który potrzebuje rozumowania klasy najlepszych modeli na dużych zbiorach dokumentów, nadal potrzebuje wariantu Max i towarzyszącego mu budżetu na wiele GPU. Zespół, który potrzebuje sprawnego asystenta do programowania lub wykonywania zadań dla wewnętrznych narzędzi, może teraz uruchomić wariant 27B na sprzęcie, który już posiada, za ułamek kosztu subskrypcji API przy tym samym poziomie użycia.

Co sprawdzić, zanim ponownie odrzucicie self-hosting

Jeśli wasz zespół odłożył ocenę self-hostingu po zapowiedzi z 3 sierpnia, ponieważ rachunek pamięci się nie zgadzał, warto powtórzyć go konkretnie dla wariantu 27B, a nie dla wariantu Max. Sprawdźcie trzy rzeczy: czy wasze rzeczywiste obciążenie potrzebuje rozumowania klasy Max, czy byłoby dobrze obsłużone przez model o 27 miliardach parametrów, ile kosztuje jedno wydajne GPU w porównaniu do roku wydatków na API przy obecnym użyciu waszego zespołu, oraz czy wasze wymagania dotyczące rezydencji danych są prawdziwym powodem self-hostingu - w takim przypadku koszt sprzętu jest drugorzędny wobec korzyści zgodności z przepisami. Te dwie liczby, 2,4 terabajta i jedno GPU, opisują to samo wydanie Qwen. To, która z nich dotyczy was, zależy całkowicie od tego, jakiego rozmiaru naprawdę potrzebujecie.