Een vergadering op 28 juli en een getal dat niemand wilde
Op 28 juli lichtten senior ingenieurs van Amazon hun collega's in over wat er met een reeks interne AI-projecten was gebeurd. De Financial Times berichtte over de inhoud. Eén project gebruikte Claude Sonnet van Anthropic om auteursgegevens naast vermeldingen in de webwinkel te leggen. Het gaf 1,8 miljoen dollar uit. Het ging 860 procent boven budget. Het liep vijf maanden voordat iemand het opmerkte, en het ging nooit live. Een team omschreef het patroon als catastrofaal duur.
Er kwamen twee kleinere gevallen bij. Een instrument voor financiële controle schoot er ongeveer 541.000 dollar overheen. Een logistiek project kwam zo'n 134.000 dollar boven plan uit. Een senior medewerker van Amazon vatte het onderliggende probleem tegenover de FT in één zin samen: het is lastig te achterhalen wat iets rond AI kost. Amazon antwoordt dat het experimenteert, leert en het gebruik van de techniek verbetert, noemt de voorbeelden selectief gekozen, en voert verplichte toetsing door collega's en uitgavenplafonds voor AI-projecten in.
Begin bij de rekensom, want niemand publiceerde die. Als 1,8 miljoen dollar een overschrijding van 860 procent is, lag het goedgekeurde budget rond de 190.000 dollar. Dat is het getal dat een controle had moeten verdedigen.
Twee maanden eerder droeg dezelfde fout een ander kostuum
Op 29 mei sloot Amazon KiroRank, een interne ranglijst op zijn ontwikkelplatform Kiro die personeel ordende naar verbruikte AI-tokens. Hij was opgezet om het gebruik aan te jagen. Wat hij aanjoeg was een praktijk die medewerkers tokenmaxxing noemden: agenten richten op werk dat niemand nodig had, zodat de positie bewoog. Dave Treadwell, senior vice president, schreef het personeel in een memo dat de ranglijst met goede bedoelingen was gebouwd, en vroeg AI niet te gebruiken enkel om AI te gebruiken.
Lees beide episodes als één. In mei beloonde Amazon verbruik en kreeg verbruik. In juli ontdekte het verbruik dat niemand had goedgekeurd en niemand had gelezen. De ranglijst en de ontsnapte taak zijn geen aparte falende disciplines; het is dezelfde leemte, namelijk dat er een meter liep en er geen gewoonte bestond om die af te lezen.
De instructie zit in de vervanging, niet in de sluiting. Amazon wiste de ranglijst niet alleen. Het verving de maatstaf door genormaliseerde uitrollen, die AI-ondersteunde code tellen die daadwerkelijk live gaat.
Waarom een afgerekend falen onzichtbaar blijft
Gewone software kondigt haar eigen falen aan. Een verkeerde lus put het geheugen uit en het proces sterft, een pagina loopt in een time-out, een alarm gaat af en iemand wordt om drie uur 's nachts gebeld. Een verkeerd geconfigureerde modelaanroep doet niets daarvan. Hij slaagt. Hij geeft een antwoord terug, rekent de tokens af en gaat opnieuw rond. Er valt geen crash te ontdekken, want vanuit het platform gezien ging er niets mis, en dat is precies de toestand waarin vijf maanden kunnen verstrijken.
Drie dingen rekken het detectievenster vervolgens op. De facturatie is maandelijks, dus de financiële functie ziet de vorm van een probleem weken na de uitgave, en ziet die opgeteld. De prijs is per token, dus de kosten schalen met volume in plaats van met het aantal instanties, en dat laatste is de as waarvoor de meeste infrastructuurbewaking is gebouwd. En agenten vermenigvuldigen tokens, want een agentische lus doet veel modelaanroepen waar een chatvenster er één doet.
Voor een Europese exploitant is het gevolg hetzelfde, ongeacht de regio: de meter loopt in het cloudaccount, de factuur komt op maandritme, en niets daartussenin vertelt u dat de taak in maart ophield nuttig te zijn.
De controles bestonden en stonden niet aan
Dit is het ongemakkelijke deel van het verhaal, en de reden dat het in een rubriek over beslissingen thuishoort en niet in een over techniek. De maatregelen lagen de hele tijd klaar op het platform. AWS publiceert batchinferentie tegen de helft van de tokenprijs bij gebruik op afroep, voor werk dat geen onmiddellijk antwoord nodig heeft, en dat is precies het profiel van een vijf maanden durende koppeling op de achtergrond. Het biedt promptcaching zodat een herhaalde context niet bij elke aanroep tegen het volle tarief wordt betaald. Het biedt goedkopere modelklassen en routering ertussen. Niets daarvan is exotisch en niets vereiste onderhandeling.
Een taak die vijf maanden liep zonder dat er dringend een antwoord nodig was, is de leerboekbatchlast. Die op afroep draaien is geen technisch falen, het is een beslissing die niemand gevraagd is te nemen, omdat degene die de taak instelde niet degene was die de factuur zag.
Ontwerp tegen die scheiding in. Wie een afgerekende taak kan starten, hoort de lopende kosten ervan te zien in dezelfde interface waarin hij hem start.
Vier controles voordat uw volgende agent live gaat
Stel een hard plafond per taak in, niet per account. Een budgetalarm op accountniveau vertelt u dat het totaal bewoog; het vertelt u niet welke taak het bewoog, en tegen de tijd dat een accountbudget afgaat zijn de vijf maanden al verstreken. Ten tweede, eis bij goedkeuring een expliciet antwoord op één vraag: moet dit nu beantwoord worden? Is het antwoord nee, dan is het een batchlast en hoort die zo geprijsd te worden.
Ten derde, zet een vervaldatum op elke langlopende taak. Een koppeltaak die sinds maart draait, had in april een mens nodig gehad om hem te verlengen. Ten vierde, meet de opbrengst. Als de score van een project het AI-ondersteunde werk is dat live ging, dan scoort een uitrol die nooit live ging nul, hoeveel tokens die ook verbruikte, en hij zou bij de eerste maandelijkse doorlichting zijn opgevallen in plaats van bij de vijfde.
Lees hierna: Amazon schrapt zijn AGI-team in een jaar van 200 mld | Uw door mensen gecontroleerde data was al half machine



