Hvad Claude Faktisk Gjorde
Anthropic meddelte den 4. september, at Claude leverede det første fuldstændige, computertjekkede bevis for Fermats sidste sætning ved at arbejde med bevisassistenten Lean 4 i 11 dage med kun overordnet vejledning fra en menneskelig forsker. Systemet genererede 13 millioner linjer Lean-kode og beviste over 30.000 hjælpesætninger, hvoraf 29.500 endte i det endelige, verificerede bevis, ved brug af en intern forskningsmodel, der brugte omkring seks milliarder output-tokens fordelt på snesevis af agenter, der kørte parallelt på platformen Prove2Me.
Den underliggende matematik er ikke ny. Andrew Wiles beviste Fermats sidste sætning i 1995, og Claude formaliserede en senere forenkling af det bevis fra Darmon, Diamond og Taylor, og omdannede et argument på 129 sider, som det tog det matematiske miljø måneder at tjekke i hånden, til en form en computer kan verificere linje for linje. Matematikeren Kevin Buzzard, som gennemgik resultatet, fortalte Anthropic, at det var et stort skridt mod automatisk formalisering af den moderne matematiske litteratur, opnået på langt kortere tid, end han havde ventet.
Hvorfor Dette Er en Omkostningshistorie, Ikke en Matematikhistorie
Det tal, der tæller her, er ikke 13 millioner linjer, det er 11 dage. Formel verifikation, altså at bevise, at et stykke matematik eller software er korrekt i stedet for blot at teste det og håbe, har altid været langsomt og dyrt at gøre i hånden, og at formalisere et resultat af denne størrelse har tidligere krævet specialistteams flere års arbejde. Netop den omkostning er grunden til, at så lidt sikkerhedskritisk software i verden overhovedet bærer et formelt korrekthedsbevis, og et automatiseret system, der kan udføre sammenligneligt arbejde på under to uger, ændrer regnestykket for enhver europæisk ingeniørvirksomhed, der certificerer systemer efter standarder som ISO 26262 til biler eller DO-178C til flyvemaskiner, hvor formelle metoder allerede bruges, men rationeres på grund af prisen.
Anthropics egen redegørelse er åben om fejlraten bag det iøjnefaldende tal: omkring 7 procent af den ikke-standardiserede kode stammede fra mislykkede forsøg, som blev kasseret på vejen til det endelige bevis. Det er en normal del af, hvordan formel verifikation altid har udviklet sig, maskine eller menneske, men det fortjener at blive sagt klart, fordi en succes på 13 millioner linjer giver det modsatte indtryk.
Grænsen Ingen Bør Springe Over
Claude formaliserede et eksisterende bevis, det opdagede ikke et nyt, og den forskel betyder mere end selve præstationen, så snart nogen forsøger at lægge teknisk vægt på den. Fermats sidste sætning fungerede som demonstration netop fordi matematikere allerede i tre årtier havde været enige om, hvordan det korrekte bevis så ud, hvilket betød, at Claudes opgave var at oversætte et kendt argument til et sprog, en maskine kan tjekke, ikke at afgøre, om argumentet overhovedet var rigtigt.
Et sikkerhedscase for et bremsesystem eller en kryptografisk protokol starter med et sværere spørgsmål: hvad betyder korrekt her egentlig, og har nogen specificeret det præcist nok til, at en formel metode kan tjekke det. Automatiseret formalisering kan nu skære drastisk ned på den anden halvdel af det problem. Den ændrer intet ved den første halvdel, og enhver organisation, der læser dette resultat som en frihed til at springe specifikationsarbejde over i stedet for verifikationsarbejde, har misforstået det.
Læs videre: 87 år faldt for et svar, alle kan efterprøve | Anthropic flytter dine sikkerhedslogs til din egen sky



