To rivaler byggede en maskine

Den 23. juli meddelte AMD og Cerebras, at de ville køre et enkelt AI-inferensflow på tværs af begge virksomheders chip, den slags parring, konkurrenter normalt undgår. AMD Helios, racket bygget af EPYC-processorer og Instinct-GPU'er, behandler prompten og det store kontekstvindue. Derefter genererer Cerebras Wafer-Scale Engine tokens, den del brugerne mærker som hastighed.

AMD's administrerende direktør, Lisa Su, kaldte inferens en af de største infrastrukturmuligheder i AI, hvis voksende mangfoldighed kræver en mere fleksibel tilgang. Cerebras' administrerende direktør, Andrew Feldman, solgte samme aftale på ren latens. Det, begge ledere lod være usagt, er skarpt: ingen chip vinder længere hele jobbet alene.

Prefill og decode vil have forskelligt silicium

Moderne inferens har to faser med modsatte behov. Prefill, at læse prompten og dens kontekst, er beregningstungt og belønner gennemløb, præcis hvad et GPU-rack som Helios gør godt. Decode, at skrive hvert nyt token, er tungt på hukommelsesbåndbredde og belønner meget lav latens, og der stråler en enkelt kæmpe Cerebras-wafer. At tvinge en chip til at gøre begge dele betyder at betale for kapacitet, som den anden fase spilder.

At adskille de to, en tilgang branchen kalder disaggregeret inferens, lader hver fase køre på den hardware, der er bygget til den. Det er den egentlige nyhed her, mere end nogen leverandørs logo: antagelsen om, at en accelerator betjener en hel model, går i stykker.

Læs fodnoten til de 5x

Virksomhederne lover op til fem gange flere tokens per sekund per watt. Læs betingelserne: tallet blev modelleret af AMD og Cerebras i juli 2026 med modellen Kimi 2.6 1T, og sammenligningen er mod en konfiguration med kun Cerebras på et sammenligneligt interaktivitetspunkt, ikke mod Nvidia og ikke en målt produktionsbenchmark. Pressematerialet selv bemærker, at forskellige konfigurationer giver forskellige resultater.

Udrulningen er også snæver. Det fælles system ventes på Cerebras Cloud i anden halvdel af 2026, en hostet tjeneste, før det er noget, du installerer. Markederne læste det som trinvist, og AMD-aktien faldt omkring 3 procent samme dag. Behandl de 5x som et modelleret loft, ikke en kvittering.

Hvad det ændrer for dit computebudget

For en europæisk operatør, der dimensionerer en AI-funktion, er læren at prissætte inferens per fase, ikke per chip. En kundeservice-chatbot lever i decode-fasen, hvor latens og watt per token afgør regningen; en pipeline til kontraktanalyse, der indtager lange dokumenter, læner sig op ad prefill-gennemløb. Den samme euro hardware køber meget forskellig økonomi alt efter, hvilken halvdel du læner dig op ad.

Det bredere signal vejer tungere end et produkt: uden for Nvidia dannes en anden troværdig inferens-stack i rack-skala, og den sælges som cloud-kapacitet, du kan leje i år. Det afsætter ingen fra tronen, men det giver købere et andet tilbud, og et andet tilbud er måden, priser holder op med at blive dikteret.