De twee regels in de prijslijst

De openbare prijspagina van xAI toont op dit moment beide versies van het spraak-naar-spraakmodel naast elkaar, en dat is de helderste manier om te zien wat eraan komt. Grok Voice Think Fast 1.0 staat vermeld op 0,05 dollar per minuut audio, oftewel 3,00 dollar per uur, plus 0,004 dollar voor tekstinvoer. Grok Voice Think Fast 2.0 staat op 0,08 dollar per minuut, oftewel 4,80 dollar per uur, met dezelfde tekstpost. Dezelfde productcategorie, dezelfde leverancier, dezelfde pagina, 60 procent verschil tussen twee regels.

De datum staat in de release-aantekening van 29 juli. xAI legt daar vast dat grok-voice-think-fast-2.0 nu beschikbaar is met Speech to Speech en dat grok-voice-latest vanaf 5 augustus 2026 naar dit model zal verwijzen. De eigen migratie-instructie van het bedrijf luidt dat er geen actie nodig is om te upgraden en dat wie op het oudere model wil blijven vooraf grok-voice-think-fast-1.0 moet vastzetten. Lees die twee zinnen samen en de vorm van de week wordt duidelijk: de goedkopere optie bestaat nog steeds, en het is niet degene die u krijgt door uw code met rust te laten.

Wat de upgrade werkelijk verbetert

Niets hiervan is een geval van meer vragen voor minder. In de onafhankelijke spraak-naar-spraaktest van Artificial Analysis scoorde Think Fast 2.0 82,9 procent tegen 75,7 procent voor versie 1.0. De tijd tot het eerste geluid, de stilte die een beller hoort voordat het model begint te praten, daalde van 1,25 naar 0,70 seconde. Het mediane relatieve gebruik van redeneertokens zakte tot 0,4 keer dat van de voorganger, omdat het nieuwe model parallel aan het spreken redeneert in plaats van eerst te denken en daarna te praten. Ook de transcriptienauwkeurigheid ging omhoog. Volgens elke gepubliceerde maatstaf is dit een beter model dat de maker minder kost om te draaien.

Juist die laatste zinsnede is interessant. Een model dat 60 procent minder redeneertokens verbrandt en in ongeveer de halve tijd antwoordt, is goedkoper te bedienen, en op de tekstmarkt bereikt dat feit de klant binnen weken. Het bereikte de klanten van OpenAI op 30 juli, toen het bedrijf GPT-5.6 Luna met 80 procent en Terra met 20 procent verlaagde en die stap toeschreef aan een daling van de eigen bedieningskosten. Hier kwam dezelfde klasse verbetering met een verhoging van 60 procent. Daar is niets oneerlijks aan. Het is het rechtstreekse gevolg van de eenheid die de meter telt.

Waarom een beter model hier meer kost

Tekst en spraak worden op verschillende klokken verkocht, en dat verschil bepaalt wie de efficiëntie houdt. Tekst wordt per token afgerekend, wat een maat is voor verricht werk. Heeft een model minder tokens nodig voor hetzelfde antwoord, dan daalt uw rekening zonder dat iemand dat hoeft te besluiten, want u koopt rekeneenheden en u hebt er nu minder nodig. Spraak wordt per minuut audio afgerekend, wat een maat is voor verstreken tijd. Een beller die een bezorgprobleem uitlegt doet er dezelfde negentig seconden over, of het model aan de lijn nu snel of traag is, dus het aantal factureerbare eenheden wordt bepaald door menselijke spraak en niet door modelefficiëntie.

Het gevolg is dat spraak de enige regel in een AI-budget is die structureel niet kan profiteren van de efficiëntierace, en tegelijk de regel die meeschaalt met uw klanten in plaats van met uw techniek. Elke verbetering die uw leverancier aanbrengt in een product per token verschijnt uiteindelijk als een lagere rekening. Elke verbetering in een product per minuut verschijnt als een beter product tegen de prijs die de leverancier vaststelt, en de besparing blijft waar zij verdiend is. Een ondernemer die het hele jaar modelprijzen ziet kelderen mag redelijkerwijs aannemen dat alle AI goedkoper wordt. De meter, niet het model, bepaalt of dat voor een bepaalde werklast klopt.

De rekensom op uw eigen belvolume

Zet er echte getallen naast, want het percentage onderschat hoe snel dit oploopt. Een gesprek van vier minuten kost 20 dollarcent op versie 1.0 en 32 op versie 2.0. Tienduizend van zulke gesprekken per maand zijn 40.000 minuten, dus 2.000 dollar tegen 3.200 dollar, een verschil van 1.200 dollar per maand of 14.400 dollar per jaar, ontstaan uit een routeringswijziging en niet uit een beslissing van uzelf. Voor een Europese exploitant staat het tarief in dollars terwijl de omzet achter die gesprekken in euro's of ponden binnenkomt, dus de verhoging landt op een kostenregel die toch al blootstaat aan een valuta waarin u niet factureert.

Het loont te toetsen of de snelheidswinst hier iets van betaalt, en zij komt er niet in de buurt. Stel dat de snellere start tien volle seconden van dat gesprek van vier minuten zou afhalen, veel meer dan de verbetering van 0,55 seconde in de tijd tot het eerste geluid aannemelijk kan opleveren. Tien seconden zijn tegen het nieuwe tarief ongeveer 1,3 cent waard, tegenover 12 cent extra kosten op datzelfde gesprek. De royale versie van het argument haalt ongeveer een negende van de verhoging terug. Het betere model kopen is verdedigbaar op kwaliteit en op de belervaring. Het is geen besparing, en elke businesscase die het zo brengt heeft een sneller model verward met een goedkoper model.

Vastzetten of inplannen

Voor woensdag bestaan er maar twee eerlijke standpunten en beide vragen deze week een handeling. Doet uw spraakagent routineus, scriptmatig werk waarvoor 75,7 procent in de test al volstond, zet dan grok-voice-think-fast-1.0 vast in uw configuratie en houd het uurtarief van 3,00 dollar. Lopen bellers geregeld tegen de grenzen van het oude model aan, neem dan bewust 2.0, herbegroot de spraakregel op 4,80 dollar per uur audio en leg in de begrotingstoelichting vast dat de verhoging latentie en nauwkeurigheid kocht en geen besparing. Wat achteraf niet te verdedigen valt, is de wijziging pas op een septemberfactuur ontdekken.

De bredere gewoonte die het waard is te vormen, is de eenheid vóór de prijs te lezen. Vraag van elke AI-dienst in uw stack wat de meter telt, want dat ene gegeven voorspelt of leveranciersefficiëntie u ooit bereikt: rekeningen per token en per verzoek dalen naarmate modellen beter worden, rekeningen per minuut, per werkplek en per gesprek niet. Spoor daarna de aliassen op. Elke aanduiding die eindigt op latest is een staande opdracht om te aanvaarden wat de leverancier hierna uitbrengt, prijs inbegrepen, en de enige werklasten waarvoor die instelling juist is, zijn die waarbij u vooraf hebt besloten dat de prijs van de volgende versie u niet uitmaakt.