De Standaardinstelling die Duur Werd

De meeste AI-agenten draaien nog altijd op een enkele, nooit bevraagde aanname: stuur elke stap van elke taak naar het meest capabele beschikbare model en sorteer de rekening later wel uit. Voor een proof of concept is dat onschuldig. Bij productievolume - duizenden codeertaken, supporttickets of onderzoeksstappen per dag - maakt die aanname bijna vanzelf van het abonnement op een topmodel de grootste post op het AI-budget, vaak zonder dat iemand dat bewust zo besloten heeft.

Nvidia gebruikte zijn eigen aankondiging van 11 augustus om te stellen dat die standaardinstelling nu achterhaald is. Het bedrijf bracht Nemotron 3.5 Lightning uit, een open mixture-of-experts-model met 30 miljard parameters, waarvan er slechts 3 miljard actief zijn per token, samen met NeMo Switchyard, een open-source-bibliotheek die - per taak, soms zelfs per beurt - beslist welk model daadwerkelijk nodig is. Geen van beide is op zichzelf een nieuw topmodel. Samen vormen ze het pleidooi dat het topmodel de uitzondering zou moeten zijn waarop een agent terugvalt, niet het startpunt.

Een Klein Model en de Router die Het Voedt

Nemotron 3.5 Lightning is gebouwd voor volume, niet voor maximale prestaties. Nvidia's eigen ontwikkelaarsblog meldt dat het model 10.000 PinchBench-taken 30 procent sneller voltooit dan Qwen3.6 35B bij vergelijkbare nauwkeurigheid, en op die benchmark 86 procent haalt bij een uitvoersnelheid tot 4 keer die van modellen van vergelijkbare omvang - een claim die Nvidia toeschrijft aan speculatieve decodering en twee conceptmodellen, DSpark en DFlash, afgestemd op respectievelijk lage en hoge gelijktijdigheid. De gewichten, trainingsdata en trainingsrecepten verschijnen onder de OpenMDW-1.1-licentie, die Nvidia omschrijft als zijn meest permissieve release tot nu toe.

NeMo Switchyard is het onderdeel dat het gedrag van een budget echt verandert. De bibliotheek levert drie kant-en-klare routeringsstrategieën: een LLM-classifier die beoordeelt welk model een verzoek nodig heeft en dat model voor de rest van de sessie blijft gebruiken; een stage router die de recente tool-activiteit van een agent uitleest en pas naar een sterker model opschaalt bij echte problemen - ernstige fouten, open-einde-verkenning - terwijl routinematige wijzigingen en beurten die tests doorstaan op het goedkope model blijven; en een escalation router die elke taak op het goedkope model begint en pas opschaalt na meerdere beurten aanhoudende moeite. Een vierde, instelbare optie haalt signalen uit de interne toestand van een model tijdens de training om, nog voor het eerste token wordt gegenereerd, te voorspellen hoe moeilijk de komende vraag werkelijk is. Niets hiervan vereist het herschrijven van een applicatie: Switchyard plaatst zich voor de bestaande mix van open, propriëtaire en Nvidia-modellen van een ontwikkelteam en is nu al beschikbaar op GitHub.

Drie Cijfers, Drie Verschillende Bronnen

De besparingsclaims rond deze release zijn echt, maar niet allemaal even goed onderbouwd, en een bedrijf dat er zijn budget op baseert moet dat verschil scherp houden. Nvidia's eigen, intern uitgevoerde benchmark meldt dat Switchyard de nauwkeurigheid op topniveau houdt terwijl de taakkosten dalen tot bijna een derde van wat alleen Claude Opus 4.8 draaien zou kosten - de claim van een leverancier over zijn eigen product, bruikbaar als bovengrens, maar geen cijfer om een budget op te bouwen.

Twee klanten publiceerden hun eigen, onafhankelijke cijfers. LangChain testte de escalation router op 145 Deep Agents-taken met meerdere beurten, geroute tussen Nemotron Lightning en Claude Opus 4.8, en meldde over vijf afzonderlijke runs een kostenverlaging van 74 procent door slechts 7 procent van de aanroepen naar het topmodel te sturen, tegen een gemeten nauwkeurigheidsverlies van ongeveer 6 procentpunt - een afweging die LangChain openlijk vermeldde in plaats van te verbergen. Los daarvan testte Ramp, het bedrijf voor zakelijke betaalkaarten en uitgavenbeheer, de stage router van Switchyard tegen zijn eigen interne benchmark voor codeeragenten, Ramp SWE-Bench, en verklaarde via zijn engineeringteam en productpagina dat gerouteerde agenten de prestaties van een enkel model evenaarden terwijl de kosten met 58 procent en de looptijd met 33 procent daalden; het geheel draait inmiddels in productie binnen Ramps eigen routerproduct.

Een derde cijfer steunt op zwakker bewijs, en dat verdient het om zo benoemd te worden. Nvidia's technische blog schrijft aan Cognitions Devin Desktop, dat de staged router draait voor Nvidia's eigen interne gebruikers, een 28 procent lagere gemiddelde kost toe op de FrontierCode Main-benchmark, bij een nauwkeurigheid binnen 2,8 punten van het topniveau en een gemiddelde kost van 3,11 dollar - omgerekend zo'n 2,90 euro - per taak. Dat cijfer komt uit Nvidia's eigen weergave van die inzet, niet uit een onafhankelijke publicatie van Cognition zelf - Cognitions eigen blog beschrijft een verwante maar aparte hybride-routeringsfunctie genaamd Devin Fusion, met andere, niet-vergelijkbare besparingscijfers. Twee van de drie hier genoemde klantcijfers zijn onafhankelijk bevestigd; een niet, en dat verschil moet meewegen.

Het Echte Product dat Nvidia Zojuist Weggaf

De krantenkop is een goedkoper, sneller model. De zet met meer gevolgen is wat Nvidia gratis weggaf: het routeringsbeleid zelf, open, modelonafhankelijk, geplaatst tussen een agent en de mix van open, propriëtaire en Nvidia-modellen die een bedrijf kiest te gebruiken. Dat is een bewuste positionering, geen toeval - een router die alleen ooit naar Nvidia's eigen modellen zou wijzen, zou een veel kleiner verhaal zijn.

Voor een bedrijf dat AI-agenten op echte schaal draait, verandert dat wat leveranciersafhankelijkheid eigenlijk betekent. Het oude lock-in-risico was gebonden zijn aan de API en prijsstelling van één toplaboratorium. Het nieuwe risico is gebonden zijn aan welke router of welk framework dan ook dat namens het bedrijf beslist welke leverancier hoe vaak wordt aangeroepen, want die laag, niet het onderliggende model, draagt nu de overstapkosten. Een router die verkeer naar believen kan verplaatsen tussen Anthropic, OpenAI-compatibele endpoints en open gewichten is een echt bruikbaar drukmiddel tegenover elk laboratorium dat de prijzen verhoogt. Het is ook een nieuwe afhankelijkheid die een inkoopafdeling nog nooit heeft moeten waarborgen, en dat het open source is maakt de operationele inspanning om het te draaien en af te stemmen niet gratis.

Er is een compliance-kant die vooral Europese bedrijven niet kunnen overslaan. Een router die dezelfde taak midden in een sessie over drie of vier verschillende modelleveranciers verdeelt, vermenigvuldigt het aantal verwerkersovereenkomsten en subverwerkers dat een bedrijf onder artikel 28 van de AVG moet bijhouden - elke leverancier die een taak raakt is een subverwerker, of de routeringsbeslissing nu door een mens of door een escalatieregel werd genomen die niemand op de financiële afdeling heeft gelezen. In Nederland vroeg de Autoriteit Persoonsgegevens, na de toeslagenaffaire, al scherper naar actuele lijsten van subverwerkers bij geautomatiseerde besluitvorming; een routeringslaag die in een willekeurige week stilletjes een vierde of vijfde modelleverancier aan die lijst toevoegt, is geen hypothetisch controlerisico, maar een operationeel risico.

Wat Dit Verandert op het Bureau van de Financieel Directeur

Het praktische gevolg is een nieuwe post om te controleren, geen nieuw hulpmiddel om te kopen. Een bedrijf dat al AI-agenten op volume draait, zou dezelfde vraag moeten kunnen beantwoorden als een cloudteam nu al beantwoordt over de mix tussen reserved instances en on-demand capaciteit: welk percentage van de agentaanroepen deze maand had echt het topmodel nodig, en wie besliste dat. Ramps eigen cijfer - 58 procent minder kosten door, volgens hun eigen relaas, alleen de echt moeilijke gevallen naar boven te escaleren - is een plausibel doel voor een codeeragent-workload die op die van Ramp lijkt, geen garantie voor elke workload; een klantenservice-agent of een onderzoeksassistent zal anders routeren dan een software-engineeringagent, en de eerlijke eerste stap is het huidige percentage aanroepen naar het topmodel meten voordat je aanneemt dat een router het probleem vanzelf oplost.