Et tal, ikke bare endnu en advarsel
Den 8. september satte Anthropics egen leder af alignment-videnskab et konkret tal på den risiko, hans arbejdsgiver bygger videre på hver dag. Evan Hubinger svarede en kollega på vej ud og skrev, at han personligt ser en sandsynlighed på over 10 procent for, at AI udsletter menneskeheden inden for det næste årti.
Kollegaen var Jacob Coxon, en 27-årig forsker, der brugte tre år på prætræning, først hos OpenAI på modellen GPT-4o, derefter hos Anthropic. Coxon sagde op sent tirsdag aften og skrev, at begge laboratorier "racer lige mod selvforbedrende superintelligens og satser vores liv", og tilføjede, at dem der bygger teknologien "oprigtigt tror, den kan slå os alle ihjel inden årtiets udgang". Hubinger sagde, han havde ret, og præciserede, at den risiko han tænker på, kommer specifikt fra rekursiv selvforbedring, ikke fra de kommercielle modeller, Anthropic sælger i dag.
Hvorfor et tal indefra lyder anderledes
Offentlige skøn over katastrofal AI-risiko er ikke nyt, eksterne forskere og aktivister har publiceret spørgeskematal i årevis. Det, der ændrede sig den 8. september, var hvem der talte: personen som Anthropic selv satte i spidsen for alignment-videnskaben, offentligt og med et tal frem for blot en stemning.
Da dette blev rapporteret, havde Anthropic ikke udsendt en virksomhedsudtalelse om tallet, og Hubinger gjorde eksplicit klart, at det afspejlede hans personlige holdning, ikke en officiel virksomhedsposition. Den skelnen overlever ikke et indkøbsregneark. Tallet fra en navngiven risikoejer, nok så personligt, er præcis den slags bevis, et compliance-team faktisk kan notere.
Compliance-vinklen som dækningen sprang over
Artikel 55 i EU's AI-forordning har siden den 2. august 2025 forpligtet udbydere af generelle AI-modeller med systemisk risiko til at vurdere og dokumentere disse risici, og siden den 2. august 2026, lidt over en måned før Hubingers indlæg, har AI-kontoret haft formel bemyndigelse til at kontrollere overholdelsen.
Forpligtelserne er konkrete: standardiseret modelevaluering inklusive modstridende test, vurdering og afbødning af systemisk risiko på tværs af hele EU-markedet, indberetning af alvorlige hændelser til AI-kontoret og tilstrækkelig cybersikkerhed for selve modellen. Udbydere hvis træningsregnekraft overstiger lovens tærskel for systemisk risiko, den gruppe hvor topAI-laboratorier som Anthropic befinder sig, er præcis dem, denne artikel er skrevet til. Et risikotal udtalt af den person, der leder netop denne udbyders alignment-arbejde, er præcis den slags forudsigelig risiko, en tilsynsmyndighed eller revisor nu vil lede efter.
Hvad der ændrer sig for teamet, der køber værktøjet
I selve produktet ændrer der sig intet i dag. Ingen model er trukket tilbage, ingen funktion er deaktiveret, og Hubingers egen præcisering knyttede hans skøn til et fremtidigt scenarie, ikke til den assistent, der lige nu besvarer jeres teams spørgsmål.
Det, der bør ændre sig, er dokumentationen. Leverandørrisikoregistre, der i dag siger noget i retning af "AI-sikkerhedsbekymringer, følges", kan nu citere et kildebelagt, dateret tal. Og ethvert team, der er afhængigt af et enkelt topAI-laboratorium for en kerneproces, bør behandle den afhængighed som en navngiven koncentrationsrisiko, ikke en fodnote, i betragtning af at tallet kom indefra leverandøren og ikke fra en ekstern kritiker.
Læs videre: Din AI-Leverandør Har Lige Fået Post Fra Bruxelles | Anthropics Sikkerhedsrapport Lister Egne Fejl



