Domyślne Ustawienie, Które Zrobiło Się Drogie
Większość wdrożeń agentów AI wciąż działa według jednego, nigdy niekwestionowanego założenia: wysyłać każdy krok każdego zadania do najbardziej zdolnego dostępnego modelu, a rachunek uporządkować później. Dla dowodu koncepcji jest to nieszkodliwe. Przy wolumenie produkcyjnym - tysiącach zadań kodujących, zgłoszeń wsparcia czy kroków badawczych dziennie - to założenie niemal automatycznie zmienia subskrypcję modelu czołowego w największą pojedynczą pozycję budżetu AI, często bez świadomej decyzji nikogo.
Nvidia wykorzystała własne ogłoszenie z 11 sierpnia, by dowodzić, że to domyślne ustawienie jest już przestarzałe. Firma wypuściła Nemotron 3.5 Lightning, otwarty model typu mieszanka ekspertów liczący 30 miliardów parametrów, z których tylko 3 miliardy są aktywne na token, razem z NeMo Switchyard, biblioteką open source, która - zadanie po zadaniu, czasem nawet turę po turze - decyduje, który model faktycznie jest potrzebny. Żaden z tych dwóch elementów sam w sobie nie jest nowym modelem czołowym. Razem stanowią one propozycję, że model czołowy powinien być wyjątkiem, po który sięga agent, a nie punktem wyjścia.
Mały Model i Router Zbudowany, by go Zasilać
Nemotron 3.5 Lightning został zbudowany z myślą o wolumenie, a nie o maksymalnej wydajności. Własny blog deweloperski Nvidii podaje, że model ukończa 10 000 zadań PinchBench o 30 procent szybciej niż Qwen3.6 35B przy porównywalnej dokładności i osiąga 86 procent w tym benchmarku przy prędkości generowania do 4 razy wyższej niż podobnie duże modele - twierdzenie, które Nvidia przypisuje dekodowaniu spekulacyjnemu oraz dwóm modelom roboczym, DSpark i DFlash, dostrojonym odpowiednio do ruchu o niskiej i wysokiej współbieżności. Wagi, dane treningowe i receptury treningowe są udostępniane na licencji OpenMDW-1.1, którą Nvidia określa jako swoje dotychczas najbardziej liberalne wydanie.
NeMo Switchyard to element, który naprawdę zmienia zachowanie budżetu. Biblioteka oferuje trzy strategie routingu niewymagające konfiguracji: klasyfikator oparty na LLM, który ocenia, jakiego modelu wymaga zapytanie, i używa tego samego modelu przez resztę sesji; router etapowy, który odczytuje niedawną aktywność narzędzi agenta i awansuje do mocniejszego modelu tylko wtedy, gdy widzi realne kłopoty - poważne błędy, otwartą eksplorację - a rutynowe poprawki i tury zaliczające testy pozostawia na tanim modelu; oraz router eskalacyjny, który zaczyna każde zadanie na tanim modelu i awansuje dopiero po zaobserwowaniu kilku tur utrzymującej się trudności. Czwarta, konfigurowalna opcja wyodrębnia sygnały z wewnętrznego stanu modelu podczas treningu, by przewidzieć, jeszcze przed wygenerowaniem pierwszego tokena, jak trudne naprawdę jest nadchodzące zapytanie. Nic z tego nie wymaga przepisania aplikacji - Switchyard ustawia się przed istniejącą mieszanką modeli otwartych, własnościowych i modeli Nvidii wykorzystywanych przez zespół deweloperski i jest już dostępny na GitHubie.
Trzy Liczby, Trzy Różne Źródła
Obietnice oszczędności związane z tą premierą są prawdziwe, ale nie wszystkie opierają się na tym samym rodzaju dowodu, a firma, która na ich podstawie planuje budżet, powinna tę różnicę wyraźnie rozróżniać. Własny, wewnętrznie przeprowadzony benchmark Nvidii podaje, że Switchyard utrzymuje dokładność na poziomie czołowym, obniżając jednocześnie koszt zadania do niemal jednej trzeciej tego, ile kosztuje samo użycie Claude Opus 4.8 - to twierdzenie dostawcy o własnym produkcie, przydatne jako szacunek górnej granicy, ale nie liczba, na której warto opierać budżet.
Dwaj klienci opublikowali własne, niezależne liczby. LangChain przetestował router eskalacyjny na 145 wieloetapowych zadaniach Deep Agents, kierując ruch między Nemotron Lightning a Claude Opus 4.8, i zgłosił, na podstawie pięciu oddzielnych przebiegów, obniżkę kosztów o 74 procent dzięki wysyłaniu jedynie 7 procent wywołań do modelu czołowego, przy zmierzonym koszcie dokładności rzędu 6 punktów procentowych - kompromis, który LangChain otwarcie ujawnił, zamiast go ukrywać. Osobno Ramp, firma zajmująca się kartami firmowymi i zarządzaniem wydatkami, przetestował router etapowy Switchyard na własnym wewnętrznym zestawie testowym dla agentów kodujących, Ramp SWE-Bench, i oświadczył, za pośrednictwem zespołu inżynieryjnego i strony produktu, że kierowani agenci dorównali wydajności pojedynczego modelu, obniżając koszty o 58 procent, a czas wykonania o 33 procent; ten układ działa już produkcyjnie we własnym produkcie routingowym Rampa.
Trzecia liczba opiera się na słabszych dowodach i warto to jasno powiedzieć. Techniczny blog Nvidii przypisuje Devin Desktop od Cognition, który uruchamia router etapowy dla własnych wewnętrznych użytkowników Nvidii, średni koszt niższy o 28 procent w benchmarku FrontierCode Main, przy dokładności w granicach 2,8 punktu od poziomu czołowego i średnim koszcie 3,11 dolara - czyli około 12,50 złotego po przeliczeniu - za zadanie. Ta liczba pochodzi z relacji Nvidii o tym wdrożeniu, a nie z niezależnej publikacji samego Cognition - własny blog Cognition opisuje pokrewną, ale odrębną funkcję routingu hybrydowego o nazwie Devin Fusion, z innymi, nieporównywalnymi liczbami oszczędności. Dwie z trzech przywołanych tu liczb klientów są potwierdzone niezależnie; jedna nie jest, i należy to odpowiednio uwzględnić przy ocenie.
Prawdziwy Produkt, Który Nvidia Właśnie Rozdała
Nagłówek to tańszy, szybszy model. Ruch o dalej idących konsekwencjach to to, co Nvidia rozdała za darmo: samą politykę routingu, otwartą, niezależną od modelu, umieszczoną między agentem a mieszanką modeli otwartych, własnościowych i modeli Nvidii, których firma zdecyduje się używać. To celowe pozycjonowanie, nie przypadek - router, który kierowałby ruch wyłącznie do własnych modeli Nvidii, byłby dużo mniejszą historią.
Dla firmy prowadzącej agentów AI w prawdziwej skali zmienia to, co uzależnienie od dostawcy właściwie oznacza. Stare ryzyko uzależnienia polegało na przywiązaniu do API i cennika jednego laboratorium czołowego. Nowe ryzyko polega na przywiązaniu do dowolnego routera lub frameworku, który w imieniu firmy decyduje, którego dostawcę wywołać i jak często, ponieważ to właśnie ta warstwa, a nie model pod spodem, niesie teraz koszt zmiany. Router zdolny przenosić ruch między Anthropic, punktami końcowymi zgodnymi z OpenAI i otwartymi wagami w zależności od potrzeb to prawdziwie użyteczna dźwignia negocjacyjna wobec każdego laboratorium podnoszącego ceny. Ale to także nowa zależność, której dział zakupów nigdy wcześniej nie musiał zabezpieczać, a fakt, że jest to open source, nie sprawia, że operacyjny wysiłek jego uruchamiania i strojenia jest darmowy.
Jest tu aspekt zgodności, którego zwłaszcza europejskie firmy nie mogą pominąć. Router, który przenosi to samo zadanie między trzema lub czterema różnymi dostawcami modeli w trakcie jednej sesji, mnoży liczbę umów powierzenia przetwarzania danych i podprocesorów, które firma musi śledzić na mocy artykułu 28 RODO - każdy dostawca, którego dotyka zadanie, jest podprocesorem, niezależnie od tego, czy decyzję o routingu podjął człowiek, czy reguła eskalacji, której nikt w dziale finansowym nie przeczytał. W Polsce Urząd Ochrony Danych Osobowych już oczekuje, że firmy na żądanie przedstawią aktualną listę swoich podprocesorów; warstwa routingu, która w dowolnym tygodniu po cichu dodaje do tej listy czwartego lub piątego dostawcę modeli, to nie hipotetyczne ryzyko kontroli, lecz ryzyko operacyjne.
Co się Zmienia na Biurku Dyrektora Finansowego
Praktyczną konsekwencją jest nowa pozycja do audytu, a nie nowe narzędzie do kupienia. Firma już prowadząca agentów AI na dużą skalę powinna umieć odpowiedzieć na pytanie tak, jak zespół chmurowy już dziś odpowiada na pytanie o mieszankę instancji rezerwowanych i na żądanie: jaki procent wywołań agentów w tym miesiącu naprawdę wymagał modelu czołowego i kto o tym zdecydował. Własna liczba Rampa - 58 procent niższych kosztów przy eskalowaniu w górę, według ich własnej relacji, wyłącznie naprawdę trudnych przypadków - to wiarygodny cel dla obciążenia agentów kodujących zbliżonego do obciążenia Rampa, a nie gwarancja dla każdego obciążenia; agent obsługi klienta czy asystent badawczy będzie kierowany inaczej niż agent inżynierii oprogramowania, a uczciwym pierwszym krokiem jest zmierzenie obecnego odsetka wywołań do modelu czołowego, zanim założy się, że router rozwiąże problem.
Czytaj dalej: Grok Bot Loguje Się do Twoich Aplikacji na Stałe | 4 000 aplikacji w 30 dni: zakład AI Cloudflare



