750 tokens i sekundet, i begrænset preview

OpenAI og Cerebras annoncerede Ultrafast-tilstanden til GPT-5.6 Sol den 13. august 2026, med op til 750 outputtokens per sekund, op til 14 gange hurtigere end modellens standardbehandling, ifølge OpenAIs egen annoncering af previewet. Niveauet er nu kun tilgængeligt for en udvalgt gruppe kunder, mens OpenAI evaluerer, hvordan den ekstra hastighed ændrer virkelige produkter; andre virksomheder kan skrive sig på en venteliste ved at indsende oplysninger om deres arbejdsbelastning. OpenAI-forsker Jeffrey Wang beskrev den praktiske effekt i selskabets eget materiale: 'Det er nu færdigt, før jeg overhovedet når at skifte kontekst. Det gør mig langt mere produktiv.'

OpenAI peger på stemmegrænseflader, kundesupport, handel, udvikleragenter, finansiel research og reaktion på sikkerhedshændelser som de tilsigtede anvendelser, og siger, at egne udviklere har brugt previewet til at analysere logs og spor under hændelser og til at komprimere forskningscyklusser, der tidligere kørte natten over, til flere iterationer inden for en enkelt arbejdsdag. GPT-5.6 Sol selv blev lanceret i juni 2026 sammen med de balancerede Terra- og hastighedsfokuserede Luna-varianter, og blev bredt tilgængelig på tværs af ChatGPT, Codex og API'en i juli.

Chippen, der gør arbejdet, er ikke Nvidias

Hastighedsgevinsten stammer fra Cerebras' Wafer-Scale Engine, som holder en models fulde vægte direkte på chippen, fordelt over 44 gigabyte SRAM indbygget i hver waferstor processor, ifølge Cerebras' eget blogindlæg om samarbejdet. Det fjerner de gentagne overførsler mellem hukommelse og beregning, der skaber ventetid på konventionelle GPU-klynger, og lader tokens flyde uafbrudt gennem modellag organiseret i pipeline og fordelt over flere wafere - et design bygget til at skalere, efterhånden som modeller vokser, ifølge Cerebras' egen tekniske beskrivelse.

Cerebras har i årevis positioneret denne arkitektur som et hurtigere, om end mindre fleksibelt, alternativ til Nvidias GPU-klynger til inferens-arbejdsopgaver, men selskabets hidtil mest fremtrædende offentlige samarbejder har hældt mod mindre eller mellemstore laboratorier snarere end branchens største enkeltkøber af Nvidia-kapacitet. OpenAIs egne infrastrukturforpligtelser over for Nvidia lyder på hundreder af milliarder dollar, et forhold dette medie tidligere har dækket i detaljer, hvilket gør valget om at lede selv et begrænset previewniveau gennem en konkurrerende chiparkitektur til et bemærkelsesværdigt datapunkt snarere end rutinemæssig leverandørspredning.

Hvad hastigheden faktisk køber

På GDP-Val, en benchmark bygget omkring økonomisk værdifulde arbejdsopgaver, rapporterer OpenAI en ende-til-ende-fremskyndelse på 5,6 gange uden målt kvalitetstab. På Humanity's Last Exam, en test med 2.500 spørgsmål på ph.d.-niveau, gennemførte GPT-5.6 Sol Ultrafast hele sættet på 11 timer og 11 minutter mod 78 timer og 27 minutter for Claude Fable 5, ifølge Cerebras' egen offentliggjorte sammenligning - omtrent syv gange hurtigere på netop den benchmark, sammen med Cerebras' separate gennemstrømningspåstande om 11 gange over Claude Fable 5 og 5 gange over den hurtige tilstand i Claude Opus 4.8.

Intet af dette gør GPT-5.6 Sol til en klogere model. Det er den samme model, der svarer på samme måde, blot hurtigere - hvilket især betyder noget for arbejdsopgaver, hvor selve ventetiden er flaskehalsen frem for kvaliteten af ræsonnementet: en supportagent, som en kunde ikke vil vente på, en sikkerhedsreaktion, der skal ske midt i en aktiv hændelse, eller en finansiel model, der skal køre flere scenarier igennem, før markedet lukker.

En afdækning mod Nvidia, selv for OpenAI

Den praktiske lære her er ikke, at Cerebras slog Nvidia på en benchmark. Det er, at selskabet, der er mest finansielt sammenflettet med Nvidias AI-opbygning, alligevel havde en forretningsmæssig grund til at køre sit mest ventetidskritiske produktniveau på en anden chiparkitektur, fordi fysikken i at holde vægte på chippen slår fysikken i at flytte dem gennem en GPU-klynge til netop denne opgave. Enhver europæisk virksomhed, der bygger en langsigtet AI-infrastrukturstrategi omkring en enkelt beregningsleverandør, uanset hvor dominerende den leverandør fremstår i dag, bør se dette som bevis på, at selv de største kunder afdækker sig, når en bestemt arbejdsopgave kræver det.

Dette er et begrænset preview uden offentliggjorte priser, ikke en generel produktbeslutning, virksomheder skal reagere på med det samme. Det nyttige træk er ikke at skifte leverandør på baggrund af én annoncering, men at notere det som et datapunkt: find ud af, hvilke af dine egne arbejdsopgaver der reelt er ventetidsbundne frem for ræsonnementsbundne, for det er dem, hvor en anden infrastrukturmulighed - ikke blot en anden skykontrakt - på sigt kan være den ekstra kompleksitet værd.