En siffra, inte bara ännu en varning

Den 8 september satte Anthropics egen chef för alignment science en konkret siffra på den risk som hans arbetsgivare bygger vidare på varje dag. Evan Hubinger svarade en kollega på väg ut och skrev att han personligen ser en sannolikhet på över 10 procent för att AI utplånar mänskligheten inom det närmaste årtiondet.

Kollegan var Jacob Coxon, en 27-årig forskare som tillbringade tre år med förträning, först hos OpenAI på modellen GPT-4o, sedan hos Anthropic. Coxon sa upp sig sent på tisdagskvällen och skrev att båda labben "rusar rakt mot en självförbättrande superintelligens och satsar våra liv", och tillade att de som bygger tekniken "på allvar tror att den kan döda oss alla innan årtiondet är slut". Hubinger sa att han hade rätt och förklarade att risken han syftar på specifikt kommer från rekursiv självförbättring, inte från de kommersiella modeller Anthropic säljer idag.

Varför en siffra inifrån låter annorlunda

Offentliga bedömningar av katastrofal AI-risk är inget nytt, externa forskare och aktivister har publicerat enkätsiffror i åratal. Det som ändrades den 8 september var vem som talade: personen som Anthropic själv satte i ledningen för alignment-vetenskapen, offentligt och med en siffra istället för bara en känsla.

När detta rapporterades hade Anthropic inte lämnat något företagsuttalande om siffran, och Hubinger gjorde uttryckligen klart att den speglade hans personliga åsikt, inte en officiell företagsposition. Den distinktionen överlever inget inköpskalkylblad. Siffran från en namngiven riskägare, hur personlig den än är, är precis den typ av bevis ett efterlevnadsteam faktiskt kan anteckna.

Efterlevnadsvinkeln som bevakningen missade

Artikel 55 i EU:s AI-förordning har sedan den 2 augusti 2025 krävt att leverantörer av AI-modeller för allmänna ändamål med systemrisk utvärderar och dokumenterar dessa risker, och sedan den 2 augusti 2026, drygt en månad före Hubingers inlägg, har AI-byrån formell befogenhet att kontrollera efterlevnaden.

Skyldigheterna är konkreta: standardiserad modellutvärdering inklusive kontradiktoriska tester, bedömning och begränsning av systemrisk över hela EU-marknaden, rapportering av allvarliga incidenter till AI-byrån och adekvat cybersäkerhet för själva modellen. Leverantörer vars träningsberäkningskraft överstiger förordningens tröskel för systemrisk, den grupp där toppAI-labb som Anthropic befinner sig, är precis de som artikeln riktar sig till. En risksiffra uttalad av personen som leder just den leverantörens alignment-arbete är precis den typ av förutsebar risk en tillsynsmyndighet eller revisor nu kommer att leta efter.

Vad som ändras för teamet som köper verktyget

I själva produkten ändras inget idag. Ingen modell har dragits tillbaka, ingen funktion har inaktiverats, och Hubingers egen precisering kopplade hans uppskattning till ett framtida scenario, inte till assistenten som just nu besvarar ert teams frågor.

Det som borde ändras är dokumentationen. Leverantörsriskregister som idag säger något i stil med "AI-säkerhetsoro, följs" kan nu citera en källbelagd, daterad siffra. Och varje team som är beroende av ett enda toppAI-labb för en kärnprocess bör behandla det beroendet som en namngiven koncentrationsrisk, inte en fotnot, med tanke på att siffran kom inifrån leverantören och inte från en extern kritiker.