Två rivaler byggde en maskin
Den 23 juli meddelade AMD och Cerebras att de skulle köra ett enda AI-inferensflöde över båda företagens chip, den sortens parning som konkurrenter vanligtvis undviker. AMD Helios, racket byggt av EPYC-processorer och Instinct-GPU:er, behandlar prompten och det stora kontextfönstret. Därefter genererar Cerebras Wafer-Scale Engine tokens, den del som användare märker som hastighet.
AMD:s verkställande direktör, Lisa Su, kallade inferens en av de största infrastrukturmöjligheterna inom AI, vars växande mångfald kräver ett mer flexibelt sätt. Cerebras verkställande direktör, Andrew Feldman, sålde samma affär på ren latens. Det båda ledarna lämnade osagt är skarpt: inget chip vinner längre hela jobbet ensamt.
Prefill och decode vill ha olika kisel
Modern inferens har två faser med motsatta behov. Prefill, att läsa prompten och dess kontext, är beräkningstungt och belönar genomströmning, precis vad ett GPU-rack som Helios gör bra. Decode, att skriva varje nytt token, är tungt på minnesbandbredd och belönar mycket låg latens, och där lyser en enda gigantisk Cerebras-wafer. Att tvinga ett chip att göra båda delarna innebär att betala för kapacitet som den andra fasen slösar.
Att skilja de två åt, ett sätt branschen kallar disaggregerad inferens, låter varje fas köra på den hårdvara som byggts för den. Det är den verkliga nyheten här, mer än någon leverantörs logotyp: antagandet att en accelerator betjänar en hel modell håller på att brista.
Läs fotnoten till de 5x
Företagen lovar upp till fem gånger fler tokens per sekund per watt. Läs villkoren: siffran modellerades av AMD och Cerebras i juli 2026 med modellen Kimi 2.6 1T, och jämförelsen är mot en konfiguration med enbart Cerebras vid en jämförbar interaktivitetspunkt, inte mot Nvidia och inte en mätt produktionsbenchmark. Pressmaterialet självt noterar att olika konfigurationer ger olika resultat.
Lanseringen är också smal. Det gemensamma systemet väntas på Cerebras Cloud under andra halvan av 2026, en värdtjänst innan det är något du installerar. Marknaderna läste det som stegvist, och AMD-aktien föll omkring 3 procent samma dag. Behandla de 5x som ett modellerat tak, inte ett kvitto.
Vad det ändrar för din beräkningsbudget
För en europeisk operator som dimensionerar en AI-funktion är läxan att prissätta inferens per fas, inte per chip. En kundtjänst-chatbot lever i decode-fasen, där latens och watt per token avgör räkningen; en pipeline för kontraktsanalys som läser in långa dokument lutar sig mot prefill-genomströmning. Samma euro hårdvara köper mycket olika ekonomi beroende på vilken halva du lutar dig mot.
Den bredare signalen väger tyngre än en produkt: utanför Nvidia formas en andra trovärdig inferens-stack i rack-skala, och den säljs som molnkapacitet du kan hyra i år. Det avsätter ingen från tronen, men det ger köpare en andra offert, och en andra offert är hur priser slutar att dikteras.
Läs vidare: Claudes avbrott åtgärdas först 2027 | En andra AI-chipkälla har vaknat



