En humanoid som äntligen använder benen
Den 30 juli publicerade Google DeepMind Gemini Robotics 2, och demonstrationen som bär releasen visar en Apptronik Apollo 2 som går, huksitter, sträcker sig och röjer ett stökigt rum. Det tekniska påståendet under är smalare och mer intressant än filmen: för första gången styr systemet en hel humanoid, ben och bål och armar och händer med flera fingrar, genom en enda policy i stället för en gångstyrning fastskruvad på en separat manipulationsstack.
Där ligger ingenjörsarbetet. En robot som måste avgöra om den ska ta ett steg närmare eller sträcka sig längre löser ett problem och inte två, och den föregående generationen kunde inte göra den avvägningen eftersom dess halvor styrdes var för sig. Gemini Robotics 2 kan dessutom köra uppgifter över flera minuter med hundratals beslutspunkter medan den samordnar sig med ytterligare en robot.
Tre modeller, tre olika dörrar
Releasen är inte en sak. Den består av Gemini Robotics 2, en vision-language-action-modell som styr hela humanoider och tvåarmade robotar; Gemini Robotics ER 2, en förkroppsligad resonemangsmodell som fungerar som planeringshjärna, ordnar arbete i flera steg och dirigerar flera maskiner; och Gemini Robotics On-Device 2, en version optimerad för lokal drift utan nätverksanslutning.
Åtkomstnivåerna följer inte annonseringen. Gemini Robotics ER 2 är tillgänglig nu via Google AI Studio för vilken utvecklare som helst, med en privat förhandsvisning på Gemini Enterprise Agent Platform. Båda modellerna som faktiskt producerar robothandlingar är begränsade till registrerade partner med tidig tillgång. Modellen du kan anropa i dag resonerar om en fysisk scen och lämnar tillbaka en plan. Modellerna som flyttar en maskin ligger bakom en grind.
Läs hela tabellen, inte den bästa raden
Google publicerade lyckandegrader per uppgift, vilket är mer öppenhet än dessa releaser brukar bära, och siffrorna förtjänar att läsas i sin helhet. På en Apollo med Inspire-händer nådde allmän helkroppsmanipulation 76,3 procent vid grepp från en hylla, 68,4 procent från ett bord och 45,7 procent från golvet. På en Franka Duo med gripdon är resultaten starkare: 74,2 procent vid allmän plockning och placering, 78,9 procent vid iordningställande av olika verktyg och 89,6 procent vid precis insättning.
Ärligheten finns i flerfingerresultaten. Att skruva ur en glödlampa nådde 92 procent. De övriga flerfingeruppgifterna hamnade mellan 32 och 44 procent. Sextio punkters spann inom en och samma förmåga är ingen avrundning, det är signalen om att fingerfärdighet förblir ett forskningsproblem med några lösta hörn. Den som citerar dig 92 utan 32 säljer demonstrationen.
Siffran som ändrar ekonomin är 200
Under humanoidbilderna finns uppgiften med kommersiella följder. DeepMind uppger att en ny tvåarmad robotutformning kan anpassas på några timmar med färre än 200 exempel, trots skillnader i form, sensorer och frihetsgrader, och nämner plattformarna Dexmate, SO101 och Trossen vid sidan av Apollo- och Franka-hårdvaran.
Datainsamling per robot har varit den strukturella kostnaden i industriell robotik. Varje ny arm, gripdon eller chassi har historiskt krävt sin egen teleoperationskampanj, och den utgiften är det som höll kapabla modeller fastlåsta vid den hårdvara de tränats på. Om några hundra exempel verkligen flyttar en policy mellan utformningar förskjuts barriären från datainsamling till integration, och integration är något ett medelstort svenskt industriföretag redan vet hur man säljer.
Vad en europeisk verksamhet faktiskt kan göra med detta 2026
Den användbara produkten detta kvartal är resonemangsmodellen, och det är inte lite. ER 2 tar emot video, förstår en fysisk scen, ordnar uppgifter i flera steg och samordnar mer än en maskin, vilket passar inspektionsrundor, sekvensering av lageruppgifter och planeringslager ovanpå robotar du redan äger. Den går att nå från Europa i dag via Google AI Studio och är rätt plats för ett litet, avgränsat pilotprojekt.
Vad den inte bär är en investeringsplan. Google ramar in arbetet som tidig forskning utan konsumentutrullning på kort sikt, varje demonstrerad handling krävde egen träning via teleoperation, video och simulering, och Engadget påminde om branschens historia av humanoida demonstrationer som tyst lutade sig mot dolda operatörer. DeepMind presenterade dessutom ASIMOV-Agentic, ett mått på om en beordrad handling kan sluta skadligt, och robotikchefen Carolina Parada uttryckte läget rakt: "Det kommer att dyka upp mycket osäkerhet, och därför vill man kunna förstå säkerhetsfrågan djupare." Budgetera för ett pilotprojekt med planeraren, inte för en humanoid vid din linje.
Läs vidare: 87 år föll för ett svar som vem som helst kan kontrollera | Googles flaggskeppsmodell är sen och saknar nytt datum



