Ta sama rodzina, tę same dwa tygodnie, odwrotny rachunek za sprzęt
3 sierpnia Alibaba zapowiedziała Qwen3.8-Max: 2,4 biliona parametrów łącznie, około 95 miliardów aktywnych na zapytanie, oraz obietnicę, że otwarte wagi pojawią sie w ciągu tygodnia. Ten serwis opisał wtedy tę zapowiedź i policzył, ile naprawdę kosztowałoby samodzielne uruchomienie modelu: około 2,4 terabajta pamięci, by pomiescic cały model przy precyzji 8-bitowej, więcej niż oferuje pojedynczy węzeł z ośmioma GPU H200, w środku ogólnobranżowego niedoboru pamięci, który już wtedy podnosił ceny komponentów.
Jedenaście dni później niż pierwotna obietnica jednego tygodnia, 14 sierpnia, pojawiły sie otwarte wagi Qwen3.8-Max, razem z czymś, czego wcześniejsza zapowiedź nie wspominała: Qwen3.8-27B, gęsty model z 27,78 miliarda parametrów, zbudowany dokładnie pod przypadek użycia, który wariant Max wyklucza, pojedyncze GPU konsumenckie.
Co naprawdę pokazują testy
Własną karta modelu Alibaby porównuje Qwen3.8-27B z Qwen3.6-27B, jego bezpośrednim poprzednikiem o tej samej liczbie parametrów, co jest uczciwym porownaniem do oceny postępu generacyjnego, a nie porownywania różnych rozmiarów. Terminal-Bench 2.1, który sprawdza, czy model potrafi wykonać realne zadania w linii komend, wzrósł z 63,4 do 73,0. DeepSWE 1.1, test inżynierii oprogramowania, więcej niż potroił sie z 13,3 do 42,2. OSWorld-Verified, który mierzy wykonywanie zadań w prawdziwym środowisku pulpitu, wzrósł z 63,9 do 84,3. JobBench, który mierzy wykonywanie zadań zawodowych zamiast zagadek programistycznych, wzrósł z 21,8 do 33,4, czyli skok o około 50 procent.
Żadna z tych liczb nie czyni modelu o 27 miliardach parametrów równoważnym wariantowi Max o 2,4 biliona parametrów wydanemu tego samego dnia. Oznaczają jednak, że model wystarczająco mały, by działać na pojedynczym GPU, wykonuje dziś zadania, do których rok temu potrzebny był znacznie większy model, i to jest prawdziwa historia: próg tego, co liczy sie jako naprawdę użyteczny model lokalny, wciąż spada pod względem wymagań sprzętowych, podczas gdy wyniki testów wciąż rosną.
Dlaczego to dzieli decyzje o self-hostingu na dwie
Dwa tygodnie temu uczciwa odpowiedź dla właściciela z UE lub Wielkiej Brytanii pytającego, czy hostować Qwen samodzielnie, brzmiała jasne nie, chyba że firma już posiadała infrastruktura serwerowa z wieloma GPU, ponieważ zapotrzebowanie na pamięć modelu flagowego wykluczało wszystko mniejsze. Ta odpowiedź nie zmieniła sie dla wariantu Max. Zmieniła sie całkowicie dla wariantu 27B, który mieści sie z zapasem na pojedynczym GPU klasy gamingowej, tej samej klasie sprzętu, który zespół inżynierski średniej wielkości może już posiadać do innych celów.
Praktyczna konsekwencja jest taka, że self-hosting nie jest już decyzja, która firma podejmuje raz na zawsze. Jest teraz decyzją podejmowana dla każdego obciążenia z osobna, dla każdego rozmiaru modelu, w ramach tej samej rodziny. Zespół, który potrzebuje rozumowania klasy najlepszych modeli na dużych zbiorach dokumentów, nadal potrzebuje wariantu Max i towarzyszącego mu budżetu na wiele GPU. Zespół, który potrzebuje sprawnego asystenta do programowania lub wykonywania zadań dla wewnętrznych narzędzi, może teraz uruchomić wariant 27B na sprzęcie, który już posiada, za ułamek kosztu subskrypcji API przy tym samym poziomie użycia.
Co sprawdzić, zanim ponownie odrzucicie self-hosting
Jeśli wasz zespół odłożył ocenę self-hostingu po zapowiedzi z 3 sierpnia, ponieważ rachunek pamięci sie nie zgadzał, warto powtórzyć go konkretnie dla wariantu 27B, a nie dla wariantu Max. Sprawdzcie trzy rzeczy: czy wasze rzeczywiste obciążenie potrzebuje rozumowania klasy Max, czy też byłby dobrze obsłużone przez model o 27 miliardach parametrów, ile kosztuje jedno wydajne GPU w porównaniu do roku wydatków na API przy obecnym użyciu waszego zespołu, oraz czy wasze wymagania dotyczące rezydencji danych są prawdziwym powodem self-hostingu, w takim przypadku koszt sprzętu staje sie drugorzędny wobec korzyści zgodności. Tę dwie liczby, 2,4 terabajta i jedno GPU, opisują to samo wydanie Qwen. To, która dotyczy was, zależy całkowicie od tego, jakiego rozmiaru naprawdę potrzebujecie.
Czytaj dalej: Alibaba przemilczała liczbę wyznaczającą wasz koszt | Jeden telefon, inna AI za każdą granicą



