Twee rivalen bouwden een machine
Op 23 juli kondigden AMD en Cerebras aan dat ze een enkele AI-inferentiestroom over de chips van beide bedrijven zouden draaien, het soort koppeling dat concurrenten meestal vermijden. AMD Helios, het rack van EPYC-processoren en Instinct-GPU's, verwerkt de prompt en het grote contextvenster. Daarna genereert de Cerebras Wafer-Scale Engine de tokens, het deel dat gebruikers als snelheid ervaren.
AMD-topvrouw Lisa Su noemde inferentie een van de grootste infrastructuurkansen van AI, waarvan de groeiende diversiteit een flexibelere aanpak vergt. Cerebras-topman Andrew Feldman verkocht dezelfde deal op pure latentie. Wat beide leiders onuitgesproken lieten is scherp: geen enkele chip wint de hele taak nog alleen.
Prefill en decode willen ander silicium
Moderne inferentie heeft twee fasen met tegengestelde behoeften. Prefill, het lezen van de prompt en zijn context, is rekenintensief en beloont doorvoer, precies wat een GPU-rack als Helios goed doet. Decode, het schrijven van elk nieuw token, is intensief in geheugenbandbreedte en beloont zeer lage latentie, en daar schittert een enkele reusachtige Cerebras-wafer. Een chip beide laten doen betekent capaciteit betalen die de andere fase verspilt.
Het scheiden van de twee, een aanpak die de sector gedisaggregeerde inferentie noemt, laat elke fase draaien op de hardware die ervoor is gebouwd. Dat is hier het echte nieuws, meer dan het logo van welke leverancier dan ook: de aanname dat een versneller een heel model bedient, valt uiteen.
Lees de voetnoot bij de 5x
De bedrijven beloven tot vijf keer meer tokens per seconde per watt. Lees de voorwaarden: het cijfer werd door AMD en Cerebras in juli 2026 gemodelleerd met het model Kimi 2.6 1T, en de vergelijking is tegen een configuratie met alleen Cerebras op een vergelijkbaar interactiviteitspunt, niet tegen Nvidia en geen gemeten productiebenchmark. Het persmateriaal zelf merkt op dat verschillende configuraties verschillende resultaten geven.
De uitrol is ook smal. Het gezamenlijke systeem wordt verwacht op Cerebras Cloud in de tweede helft van 2026, een gehoste dienst voordat het iets is dat u installeert. De markten lazen het als incrementeel, en het AMD-aandeel zakte die dag ongeveer 3 procent. Behandel de 5x als een gemodelleerd plafond, niet als een bonnetje.
Wat het verandert voor uw rekenbudget
Voor een Europese operator die een AI-functie dimensioneert, is de les: prijs inferentie per fase, niet per chip. Een klantenservice-chatbot leeft in de decode-fase, waar latentie en watts per token de rekening bepalen; een pijplijn voor contractanalyse die lange documenten inleest, leunt op prefill-doorvoer. Dezelfde euro aan hardware koopt zeer verschillende economie, afhankelijk van op welke helft u leunt.
Het bredere signaal weegt zwaarder dan een product: buiten Nvidia vormt zich een tweede geloofwaardige inferentiestack op rackschaal, en die wordt verkocht als cloudcapaciteit die u dit jaar kunt huren. Dat onttroont niemand, maar het geeft kopers een tweede offerte, en een tweede offerte is hoe prijzen ophouden gedicteerd te worden.
Lees hierna: Claudes storingen worden pas in 2027 verholpen | Een tweede AI-chipbron is ontwaakt



