En lille agent mod to AI-giganter
Inherent, et AI-laboratorium i London grundlagt af tidligere DeepMind-forskere, oplyste, at dets agent Faraday slog både Anthropics Claude Opus 4.8 og OpenAIs GPT-5.5 i selvstændigt at genskabe resultaterne fra offentliggjorte videnskabelige artikler.
Faraday er bygget på Qwen 3.6, en åben basismodel med 27 milliarder parametre, langt mindre end de topmodeller, den blev testet mod. Opgaven var ikke et simpelt spørgsmål-svar: forskerne gav Faraday opsætningen fra en offentliggjort artikel og bad den genskabe resultatet uden at kende svaret på forhånd, og sammenlignede derefter dens output med de to langt større modellers på de samme artikler. Inherent offentliggjorde metode og resultater på sin egen forskningsside, og sammenligningen blev bekræftet uafhængigt af TechCrunch.
Resultatet kommer kun få uger efter, at Inherent forlod stealth-fasen med en seed-runde på 50 millioner dollar, usædvanligt stor for et europæisk AI-laboratorium, og et væddemål på, at en lille, målrettet trænet agent kan konkurrere med systemer fra virksomheder, der bruger langt mere på regnekraft.
Hvorfor den vandt: fornemmelse, ikke kun størrelse
Mekanismen: ifølge Inherent blev Faraday trænet til at udvikle en "forskningsfornemmelse", en instinktiv fornemmelse for hvilke eksperimenter der er umagen værd, og hvordan man designer dem godt, gennem forstærket læring, der belønner gode resultater i stedet for at følge en manual med korrekte trin.
Den tilgang sigter mod en snævrere færdighed end generel ræsonnering: at vide, hvordan man genskaber resultatet af en bestemt artikel, er en afgrænset opgave, og en mindre model trænet specifikt til det kan plausibelt slå en generel topmodel, der aldrig blev optimeret til netop den opgave. Det sker på baggrund af stigende omkostninger til topskala-regnekraft: Nvidia har fortalt store cloud-kunder, at priserne på AI-servere til levering i 2027 stiger med over 15 procent, drevet af hukommelsesomkostninger, hvilket gør det dyrere som standard at vælge den størst tilgængelige model til enhver opgave.
Hvad det betyder for AI-købere
Konklusionen: en specialiseret agent, en brøkdel af størrelsen af en topmodel, der slår den på en veldefineret opgave, er bevis for, at modelstørrelse ikke er det eneste håndtag, europæiske og britiske virksomheder bør bruge, når de budgetterer AI-kapacitet.
Indkøbs- og teknikteams, der evaluerer AI-leverandører til en specifik, veldefineret opgave, fra dokumentgennemgang til kodemigrering til forskningsstøtte, har nu en konkret grund til at teste mindre, målrettet trænede modeller mod generelle topmodeller, før de forpligter sig til den større og dyrere løsning. Topmodellerne er stadig foran på bred, generel ræsonnering; påstanden her er snævrere og opgavespecifik, ikke en påstand om, at Faraday erstatter Claude eller GPT-5.5 generelt.
Konklusionen
At et britisk laboratorium seks måneder efter grundlæggelsen slår to velfinansierede amerikanske topmodeller på en konkret videnskabelig opgave, er et reelt datapunkt for europæisk AI-konkurrenceevne og en påmindelse om, at regnekraftskapløbet ikke er det eneste løb, der tæller.
Læs videre: Qwens downloadrekord skjuler et EU-efterlevelseshul | Alibaba fortav tallet der fastsætter jeres pris



