750 token i sekunden, i begränsad förhandsversion
OpenAI och Cerebras tillkännagav Ultrafast-läget för GPT-5.6 Sol den 13 augusti 2026, med upp till 750 utdatatoken per sekund, upp till 14 gånger snabbare än modellens standardbearbetning, enligt OpenAIs eget tillkännagivande av förhandsversionen. Nivån är just nu bara tillgänglig för en utvald grupp kunder medan OpenAI utvärderar hur den extra hastigheten förändrar verkliga produkter; andra företag kan skriva upp sig på en väntelista genom att skicka in uppgifter om sin arbetsbelastning. OpenAI-forskaren Jeffrey Wang beskrev den praktiska effekten i företagets eget material: 'Det är nu klart innan jag ens hinner byta kontext. Det gör mig mycket mer produktiv.'
OpenAI pekar ut röstgränssnitt, kundsupport, handel, utvecklaragenter, finansiell research och hantering av säkerhetsincidenter som avsedda användningsområden, och säger att de egna utvecklarna har använt förhandsversionen för att analysera loggar och spår under incidenter och för att komprimera forskningscykler som tidigare tog en hel natt till flera iterationer under en enda arbetsdag. GPT-5.6 Sol självt lanserades i juni 2026 tillsammans med de balanserade Terra- och hastighetsfokuserade Luna-varianterna, och blev brett tillgängligt i ChatGPT, Codex och API:et i juli.
Chippet som gör jobbet är inte Nvidias
Hastighetsvinsten kommer från Cerebras Wafer-Scale Engine, som håller en modells fullständiga vikter direkt på chippet, fördelade över 44 gigabyte SRAM inbyggt i varje waferstor processor, enligt Cerebras eget blogginlägg om samarbetet. Det tar bort de upprepade överföringarna mellan minne och beräkning som skapar fördröjning i konventionella GPU-kluster, och låter token flöda obrutet genom modellskikt organiserade i pipeline och fördelade över flera wafer - en design byggd för att skala i takt med att modeller växer, enligt Cerebras egen tekniska beskrivning.
Cerebras har i åratal positionerat denna arkitektur som ett snabbare, om än mindre flexibelt, alternativ till Nvidias GPU-kluster för inferensarbete, men företagets hittills mest uppmärksammade offentliga samarbeten har lutat mot mindre eller medelstora labb snarare än branschens största enskilda köpare av Nvidia-kapacitet. OpenAIs egna infrastrukturåtaganden gentemot Nvidia uppgår till hundratals miljarder dollar, en relation som denna publikation tidigare har täckt i detalj, vilket gör valet att låta även en begränsad förhandsnivå gå via en konkurrerande chiparkitektur till en anmärkningsvärd datapunkt snarare än rutinmässig leverantörsspridning.
Vad hastigheten faktiskt köper
På GDP-Val, en benchmark byggd kring ekonomiskt värdefulla arbetsuppgifter, rapporterar OpenAI en helhetsacceleration på 5,6 gånger utan uppmätt kvalitetsförlust. På Humanity's Last Exam, ett test med 2 500 frågor på doktorandnivå, klarade GPT-5.6 Sol Ultrafast hela uppsättningen på 11 timmar och 11 minuter mot 78 timmar och 27 minuter för Claude Fable 5, enligt Cerebras egen publicerade jämförelse - ungefär sju gånger snabbare på just den benchmarken, tillsammans med Cerebras separata genomströmningspåståenden om 11 gånger jämfört med Claude Fable 5 och 5 gånger jämfört med det snabba läget i Claude Opus 4.8.
Inget av detta gör GPT-5.6 Sol till en klokare modell. Det är samma modell, som svarar på samma sätt, bara snabbare - vilket spelar roll specifikt för arbetsuppgifter där själva fördröjningen är flaskhalsen snarare än resonemangets kvalitet: en supportagent som en kund inte vill vänta på, en säkerhetsåtgärd som måste ske mitt i en pågående incident, eller en finansiell modell som måste köra flera scenarier innan marknaden stänger.
En säkring mot Nvidia, även för OpenAI
Den praktiska lärdomen här är inte att Cerebras slog Nvidia på en benchmark. Det är att företaget som är mest finansiellt sammanflätat med Nvidias AI-satsning ändå hade en affärsmässig anledning att köra sin mest fördröjningskritiska produktnivå på en annan chiparkitektur, eftersom fysiken i att hålla vikter på chippet slår fysiken i att flytta dem genom ett GPU-kluster för just den här uppgiften. Varje europeiskt företag som bygger en långsiktig AI-infrastrukturstrategi kring en enda beräkningsleverantör, hur dominerande den leverantören än ser ut i dag, bör se detta som bevis på att även de största kunderna säkrar sig när en specifik arbetsuppgift kräver det.
Detta är en begränsad förhandsversion utan publicerade priser, inte ett generellt produktbeslut som företag måste agera på omedelbart. Det nyttiga draget är inte att byta leverantör på grund av ett enda tillkännagivande, utan att notera det som en datapunkt att följa: ta reda på vilka av era egna arbetsuppgifter som verkligen är fördröjningsbegränsade snarare än resonemangsbegränsade, för det är dessa där en andra infrastrukturoption, inte bara ett andra molnavtal, med tiden kan vara den extra komplexiteten värd.
Läs vidare: AMD gav halva inferensen till ett rival-chip | Att hyra frontier-AI är nu ett val, inte ett måste



