Co Claude Naprawdę Zrobił
Anthropic ogłosił 4 września, że Claude stworzył pierwszy pełny, sprawdzony komputerowo dowód wielkiego twierdzenia Fermata, pracując z asystentem dowodzenia Lean 4 przez 11 dni, przy jedynie ogólnych wskazówkach ludzkiego badacza. System wygenerował 13 milionów linii kodu w Lean i udowodnił ponad 30 tysięcy twierdzeń pomocniczych, z których 29500 trafiło do ostatecznego, zweryfikowanego dowodu, korzystając z wewnętrznego modelu badawczego, który zużył około sześciu miliardów tokenów wyjściowych dzięki dziesiątkom agentów działających równolegle na platformie Prove2Me.
Leżąca u podstaw matematyka nie jest nowa. Andrew Wiles udowodnił wielkie twierdzenie Fermata w 1995 roku, a Claude sformalizował późniejsze uproszczenie tego dowodu autorstwa Darmona, Diamonda i Taylora, przekształcając liczący 129 stron argument, którego sprawdzenie ręcznie zajęło środowisku matematycznemu miesiące, w formę, którą komputer może zweryfikować linia po linii. Matematyk Kevin Buzzard, który ocenił wynik, powiedział Anthropic, że to wielki krok w stronę automatycznej formalizacji współczesnej literatury matematycznej, osiągnięty w znacznie krótszym czasie, niż się spodziewał.
Dlaczego To Historia o Kosztach, a Nie o Matematyce
Liczba, która naprawdę się tu liczy, to nie 13 milionów linii, lecz 11 dni. Weryfikacja formalna, czyli dowodzenie, że fragment matematyki lub oprogramowania jest poprawny, zamiast po prostu go testować i mieć nadzieję, zawsze była powolna i kosztowna, gdy robiono ją ręcznie, a sformalizowanie wyniku tej wielkości wymagało dotychczas lat pracy wyspecjalizowanych zespołów. Właśnie ten koszt tłumaczy, dlaczego tak mało oprogramowania krytycznego dla bezpieczeństwa na świecie w ogóle posiada formalny dowód poprawności, a zautomatyzowany system zdolny do porównywalnej pracy w niecałe dwa tygodnie zmienia rachunek dla każdej europejskiej firmy inżynieryjnej certyfikującej systemy według norm takich jak ISO 26262 dla samochodów lub DO-178C dla samolotów, gdzie metody formalne są już stosowane, ale racjonowane ze względu na koszt.
Własny raport Anthropic jest szczery co do wskaźnika niepowodzeń kryjącego się za tą głośną liczbą: około 7 procent niestandardowego kodu pochodziło z nieudanych prób, odrzuconych po drodze do ostatecznego dowodu. To normalna część tego, jak zawsze postępowała weryfikacja formalna, czy to maszyna, czy człowiek, ale zasługuje na jasne powiedzenie, bo sukces liczący 13 milionów linii sugeruje wrażenie odwrotne.
Granica, Której Nikt Nie Powinien Pomijać
Claude sformalizował istniejący dowód, nie odkrył nowego, a ta różnica liczy się bardziej niż samo osiągnięcie, gdy tylko ktoś próbuje oprzeć na nim inżynierski ciężar. Wielkie twierdzenie Fermata sprawdziło się jako demonstracja właśnie dlatego, że matematycy od trzech dekad byli już zgodni co do tego, jak wygląda poprawny dowód, co oznaczało, że zadaniem Claude'a było przetłumaczenie znanego argumentu na język, który maszyna może sprawdzić, a nie ocena, czy argument w ogóle był poprawny.
Uzasadnienie bezpieczeństwa dla układu hamulcowego lub protokołu kryptograficznego zaczyna się od trudniejszego pytania: co w ogóle oznacza tu poprawność i czy ktoś określił ją wystarczająco precyzyjnie, by metoda formalna mogła to sprawdzić. Zautomatyzowana formalizacja może teraz drastycznie skrócić drugą połowę tego problemu. Nie zmienia niczego w pierwszej połowie, a każda organizacja, która odczyta ten wynik jako przyzwolenie na pominięcie pracy specyfikacyjnej zamiast weryfikacyjnej, źle go zrozumiała.
Czytaj dalej: 87 lat runęło przed odpowiedzią, którą każdy może sprawdzić | Anthropic przenosi logi klienta do jego chmury



