Model, który pojawił się bez żadnej zapowiedzi
Shanghai Artificial Intelligence Laboratory umieściło 11 września 2026 roku na Hugging Face model liczący 744 miliardy parametrów, bez wpisu na blogu, komunikatu prasowego czy strony z cenami. Repozytorium Atria Dawn Preview po prostu stało się dostępne, a karta modelu liczy 753 miliardy parametrów, gdy zsumuje się każdy tensor w stosie mixture of experts. Skwantyzowany checkpoint FP8 pojawił się dzień później, 12 września.
Model powstał na bazie GLM-5.2 od Zhipu i został udostępniony na licencji MIT, która pozwala na pełne komercyjne wykorzystanie bez opłat licencyjnych i limitu użytkowników. Kontekst sięga 256 000 tokenów, ale dane wejściowe to wyłącznie tekst: model nie odczyta zrzutu ekranu, zeskanowanej faktury ani pliku PDF, tak jak potrafią GPT-5.6 czy Claude Opus 5. Dwa hostowane punkty dostępu API działały już, zanim premiera zyskała jakikolwiek rozgłos, jeden pod adresem api.atria-asi.ai dla ruchu spoza Chin i drugi pod discovery.intern-ai.org.cn dla użytkowników w Chinach.
Model tej wielkości zwykle pojawia się wraz z keynote. Zarówno GPT-5.6, jak i Claude Opus 5 wystartowały za stronami z cenami, prezentacjami benchmarków i etapowym wdrożeniem. Atria Dawn pojawił się tak, jak pojawia się zwykły commit kodu, a jako pierwsi zauważyli go ci, którzy śledzą codzienną listę publikacji na Hugging Face, a nie agencje prasowe.
Gdzie Atria Dawn faktycznie wygrywa
We własnej opublikowanej tabeli benchmarków Atria Dawn Preview uzyskuje najwyższy wynik spośród wszystkich wymienionych modeli w 5 z 16 testów, a wzorzec koncentruje się na badaniach i bezpieczeństwie, a nie na czystym programowaniu. Prowadzi w BrowseComp, benchmarku badań internetowych i agentowego przeglądania, z wynikiem 92,5 wobec 92,2 GPT-5.6, 90,8 Claude Opus 5 i 91,2 KIMI K3. W DeepSearchQA uzyskuje 96,0 wobec 95,9 KIMI K3 i 93,2 GPT-5.6, a w BFCL v4, benchmarku użycia narzędzi, osiąga 77,0 wobec 71,4 DeepSeek V4.
| Benchmark | Atria Dawn | GPT-5.6 | Claude Opus 5 | KIMI K3 | DeepSeek V4 |
|---|---|---|---|---|---|
| BrowseComp | 92.5 | 92.2 | 90.8 | 91.2 | 83.4 |
| DeepSearchQA | 96.0 | 93.2 | - | 95.9 | - |
| BFCL v4 | 77.0 | - | - | 69.1 | 71.4 |
| CyberGym | 86.5 | 83.6 | - | 78.7 | 83.3 |
CyberGym, benchmark cyberbezpieczeństwa, pokazuje ten sam wzorzec: Atria Dawn uzyskuje 86,5 wobec 84,5 GLM 5.3, 83,6 GPT-5.6 i 83,3 DeepSeek V4. Wszystkie cztery zadania dotyczą znajdowania, weryfikowania i działania na podstawie prawdziwych informacji, a nie pisania nowego oprogramowania od zera.
Gdzie wyraźnie nie wygrywa
Atria Dawn Preview przegrywa w dwóch z trzech benchmarków, które liczą się najbardziej dla dostarczania oprogramowania, a różnice są wyraźne. Claude Opus 5 prowadzi w SWE-bench Pro z wynikiem 74,7 wobec 59,6 Atrii, co daje przewagę 15 punktów w benchmarku mierzącym, czy agent potrafi dostarczyć działający pull request. Claude Opus 5 prowadzi też w JobBench, szerszym benchmarku zadań zawodowych, z wynikiem 68,0 wobec 50,3.
GPT-5.6 prowadzi w trzecim, MLE-bench Lite, z wynikiem 88,9 wobec 86,2 Atrii, benchmarku inżynierii uczenia maszynowego bliższym zwykłym mocnym stronom obu modeli. Nic z tego nie przeczy opisanej wyżej przewadze w badaniach i bezpieczeństwie. Pokazuje to, że przeglądanie i weryfikowanie dowodów wymaga innego rodzaju osądu niż utrzymanie bazy kodu pod realnym terminem.
Jak model uczono sprawdzać własną pracę
Artykuł stojący za modelem, zatytułowany "Atria Dawn: The Dawn of Agentic Superintelligence" na arXiv, wymienia ponad 140 autorów z Shanghai Artificial Intelligence Laboratory i opisuje metodę treningu nazywaną Verifiable Experience Pipeline. Metoda ta łączy działania podejmowane za pomocą narzędzi ze środowiskami wykonywalnymi oraz z wynikami zweryfikowanymi zewnętrznie, zamiast ocenianymi przez symulator sprawdzający własny test.
Tytuł artykułu jest znacznie bardziej górnolotny, niż kiedykolwiek była sama premiera, i ta rozbieżność sama w sobie zasługuje na uwagę: laboratorium na tyle pewne siebie, by nazwać własną pracę krokiem w stronę agentowej superinteligencji, mimo to zdecydowało się opublikować ją bez żadnej zapowiedzi. Autorzy przeprowadzili też ocenę z udziałem ludzi, obejmującą 769 ukończonych zapisów zadań od 56 uczestników. Mniej więcej jedną trzecią pracy wspieranej przez AI osoby, które ją wykonały, oceniły jako niemożliwą bez pomocy modelu, a badacze podają, że ludzie zachowali ostateczną władzę decyzyjną przez cały czas, nawet gdy agent proponował metody i wdrażał poprawki.
To własna narracja artykułu na temat procesu badawczego, a nie niezależny audyt, a Servola zweryfikowała to twierdzenie wyłącznie jako oświadczenie, które sami autorzy składają na temat własnego badania.
Co to zmienia dla europejskiego budżetu badawczego
Europejska firma płacąca za dostęp do API OpenAI lub Anthropic, by prowadzić badania, wywiad konkurencyjny czy analizę bezpieczeństwa, płaci w dużej mierze dokładnie za tę zdolność, którą Atria Dawn Preview obecnie dorównuje lub przewyższa według opublikowanych liczb: badania internetowe, użycie narzędzi i analizę bezpieczeństwa. To praca, którą większość firm budżetuje jako zewnętrzną pozycję dostawcy, zamiast budować ją wewnętrznie, a darmowy model na licencji MIT, który prowadzi właśnie w tych zadaniach, zmienia to, co ta pozycja musi uzasadniać.
Darmowe pobranie nie oznacza darmowego działania: model o 744 miliardach parametrów wymaga prawdziwej infrastruktury inferencyjnej, i to jest realne pytanie o koszty dla europejskiego nabywcy, nie opłata licencyjna. Hostowanie go z użyteczną szybkością wymaga mocy GPU, której większość średnich firm nie posiada, więc realistycznym krokiem na najbliższy czas jest hostowane API, które Shanghai Artificial Intelligence Laboratory już prowadzi, zamiast wdrożenia we własnym zakresie, a to nadal oznacza wysyłanie danych do zewnętrznego podmiotu, tak jak robi to subskrypcja OpenAI czy Anthropic.
Premiera niesie ze sobą tak mało marketingu, że większość działów zakupów nie wliczyła jej jeszcze w żadne kalkulacje. Model, który pokonuje dwa najdroższe zamknięte modele dokładnie w zadaniach, za które zespół badawczy faktycznie wystawia faktury, wydany za darmo na licencji pozwalającej na odsprzedaż, to rodzaj faktu, który zwykle potrzebuje miesięcy, by dotrzeć do rozmowy budżetowej. Ten potrzebował pięciu dni.
Dlaczego to robimy
Robimy to dla wszystkich, którzy starają się nadążyć za tym, co technologia robi z naszym życiem. Dla ludzi, którzy ją budują, i dla ludzi, którym się przydarza. Servola Journal istnieje po to, aby to, czego się uczymy, należało do wszystkich.
Nikt nam za to nie płaci. Żadnych reklam, żadnej ściany płatnej, za darmo dla wszystkich. Po prostu wierzymy, że zrozumienie tego, co dzieje się z nami wszystkimi, nie powinno zależeć od tego, kogo na to stać.
Jeśli dzisiaj coś ci to dało, powiedz nam, żebyśmy kontynuowali. Obserwuj nas, zostaw polubienie albo napisz pozytywny komentarz. Czytamy je wszystkie, i to one nas napędzają.
Czytaj dalej: Własni Badacze OpenAI Wydają $600 Dziennie na Tokeny | Agenci OpenAI wymknęli się z piaskownicy na miesiące



