Szanghaj odpowiedział na pytanie pominięte w lipcu

Trzeciego sierpnia Alibaba wypuściła Qwen3.8-Max, model pokazany 19 lipca na World AI Conference w Szanghaju bez liczb, które miały znaczenie. Specyfikacja jest już jawna: 2,4 biliona parametrów łącznie, z czego 95 miliardów aktywnych podczas wnioskowania, zbudowany na architekturze Qwen 3.5 i zdolny obsłużyć tekst, obrazy, wideo oraz dokumenty w jednym systemie. Notowane w Hongkongu akcje wzrosły we wczesnym handlu o około 6 procent, do 124,00 dolara hongkońskiego.

Firma zobowiązała się także w kwestii, której w lipcu nie chciała opatrzyć datą. Wagi mają zostać opublikowane otwarcie w przyszłym tygodniu, co uczyniłoby ten model pierwszym z rodziny Max, jaki każdy może pobrać i uruchomić na własnym sprzęcie. Dla europejskiej firmy, która śledzi chińskie modele czołowe właśnie dlatego, że otwarte wagi pozwalają hostować, badać i odejść, to jest ta część zapowiedzi, która niesie konsekwencje.

Te 95 miliardów aktywnych to prawdziwie dobra wiadomość

Dlaczego to ważne: współczynnik aktywacji zamienia liczbę parametrów w rachunek. Qwen3.8-Max angażuje przy każdym zapytaniu około 4 procent swojej sieci, więc moc obliczeniowa zużywana na żądanie bliższa jest modelowi o 95 miliardach parametrów niż temu o 2,4 biliona. Alibaba plasuje koszty wnioskowania poniżej poprzedniej generacji, a ujawniona architektura tym razem tę deklarację wspiera, zamiast ją zaciemniać.

To dokładnie ta liczba, której brakowało w lipcowej zapowiedzi, i wypadła po korzystnej stronie. Kto kupuje tokeny przez interfejs, powinien wyciągnąć praktyczny wniosek: model reklamowany liczbą 2,4 biliona parametrów nie powinien być tak wyceniany. Wersja zapoznawcza wciąż działa za 10 procent stawki standardowej w ramach Token Plan, Qoder i QoderWork, a poprzednik Qwen3.7-Max figuruje po 2,50 dolara za milion tokenów wejściowych i 7,50 za milion wyjściowych, około 2,30 i 6,90 euro. Oceniaj każdą ofertę względem cennika, nigdy względem ceny promocyjnej.

Potem policz pamięć, a nie parametry

Liczba, której nikt nie umieścił w nagłówku: pomieszczenie 2,4 biliona parametrów wymaga około 2,4 terabajta pamięci przy precyzji ośmiobitowej i mniej więcej 1,2 terabajta, jeśli skwantyzujesz do czterech bitów i przyjmiesz utratę jakości. Serwer z ośmioma procesorami graficznymi H200 daje łącznie około 1,1 terabajta szybkiej pamięci. Otwarte wagi tej wielkości nie oznaczają więc jednego serwera. Oznaczają co najmniej dwa pełne węzły przy ośmiu bitach albo ciasne dopasowanie na jednym węźle po agresywnej kwantyzacji, zanim jeszcze przydzielisz choćby jeden bajt na pamięć podręczną klucz-wartość, która faktycznie obsługuje równoczesnych użytkowników.

Trafia to w najgorszy możliwy miesiąc. Pamięć jest dziś najrzadszym surowcem branży: około 70 procent przyszłorocznej podaży jest już zakontraktowane, ceny kontraktowe DRAM i HBM rosły przez cały kwartał, a zacisk sięga tak głęboko, że Apple nie utrzymuje na stanie podstawowego laptopa i kieruje kupujących ku droższemu. Wolność, którą dają otwarte wagi, jest prawdziwa, a dla większości europejskich firm pozostaje na razie teoretyczna. Wręcza się wam klucze do budynku, którego powierzchni nie zdołacie wynająć.

Deklaracja wydajności to nadal Alibaba mierząca Alibabę

Alibaba utrzymuje, że model jest zasadniczo konkurencyjny wobec czołowych systemów amerykańskich, że pokonuje je w kilku testach programistycznych, multimodalnych i inżynieryjnych, a przegrywa w części ogólnych prób rozumowania, i ponownie stawia się tuż za modelem Fable 5 od Anthropic. Każde z tych miejsc pochodzi z własnych materiałów premierowych Alibaby. Żaden niezależny ranking nie ocenił dotąd Qwen3.8-Max, dokładnie tak jak przy lipcowej zapowiedzi.

Tak, ale: otwarcie wag zmienia ciężar tego zastrzeżenia, zamiast je znosić. Gdy wagi są publiczne, niezależna ocena przestaje zależeć od dobrej woli dostawcy czy dostępu do interfejsu, a twierdzenie o miejscu w rankingu staje się obalalne w ciągu kilku dni przez każdego, kto ma sprzęt zdolny je wczytać. Dostawca, który otwiera wagi tydzień po ogłoszeniu swojej pozycji, jest przynajmniej gotów poddać się kontroli. Właściwą reakcją jest zaczekać na tę kontrolę, oddaloną teraz o dni, a nie o czas nieokreślony.

Co to zmienia w tym miesiącu dla europejskiego nabywcy

W środowisku produkcyjnym na razie nic. Warta trzymania się kolejność jest wąska: pozwól wagom wylądować, poczekaj na niezależne wyniki, a potem przetestuj na własnym obciążeniu według pełnego cennika, a nie stawki zapoznawczej. To decyzja na wrzesień, nie na sierpień, i nic nie kosztuje bycie drugim przy modelu, który za sześć tygodni nadal będzie dostępny.

Sedno sprawy: strategiczne pytanie postawione przez tę premierę nie brzmi, czy chiński model jest wystarczająco dobry. Brzmi ono, czy otwarte wagi wciąż kupują niezależność, gdy sprzęt potrzebny do skorzystania z niej jest reglamentowany. Jeśli własny hosting w ogóle jest twoim powodem, by śledzić te premiery, wiążące ograniczenie przesunęło się po cichu z warunków licencji na zaopatrzenie w pamięć i to tam należy teraz skierować wysiłek planistyczny.