Évekig úgy tűnt, a segítőkész humanoid robotok ígérete egy örökös demókörön futó, 30 másodpercig lenyűgöző, de aztán a labor falai közé szorult, előre beprogramozott feladatokat végző jelenség. Egy kockát persze fel tudtak venni, de egy zsúfolt szobában már úgy botorkáltak, mint egy túlpörgött kisgyerek. Most a Google DeepMind gyökeres megoldással állt elő a Gemini Robotics 2 nevű AI platformjával, ami nem egyszerű szoftverfrissítés, sokkal inkább egy komplett agytranszplantáció a legkülönfélébb robotok számára.
A koncepció megtévesztően egyszerű: egy egységes “intelligencia réteget” hoznak létre, amely bármely robotnak képessé teszi, hogy érzékeljen, gondolkodjon és cselekedjen a kusza, kiszámíthatatlan emberi világban. Ez nem csupán egyetlen kar finomabb motoros vezérléséről szól; a Google ezt “teljes test intelligenciának” (full body intelligence) nevezi. Most először egyetlen AI modell úgy irányít egy humanoidot a lábujjától az ujjbegyéig, hogy az összehangolja az egyensúlyt, a mozgást és a manipulációt egyetlen, gördülékeny folyamatba. Ez a különbség aközött, hogy beprogramozzuk egy robot ízületeit, vagy saját elmével ruházzuk fel.
A Háromfejű AI Cerberus
A Gemini Robotics 2 szívében nem egy, hanem három specializált modell dolgozik összehangoltan. Képzeljük el úgy, mint egy parancsnoki struktúrát arra, hogy a fizikai világban is elvégezze a feladatokat.
Elsőként ott van maga a Gemini Robotics 2, a mester VLA (vision-language-action – látás-nyelv-cselekvés) modell. Ez az igásló, amely egy magas szintű parancsot, mint például “tedd a locsolókannát az alsó polcra”, a motoros vezérlések komplex sorozatává fordít le, ami a járáshoz, hajlításhoz, egyensúlyozáshoz és a tárgy elhelyezéséhez szükséges.
Másodikként jön a Gemini Robotics ER 2, az “Embodied Reasoning” (megtestesült érvelés) modell. Ez a stratéga. Folyamatos videó streamet figyel a valós világból, hogy megértse a kontextust, több lépéses feladatokat tervezzen, és még korrigáljon is, ha valami balul sül el. Ha a fő modell a test, akkor az ER 2 a magas szintű agy, amely kitalálja a mit, mielőtt a VLA kitalálná a hogyan-t. Akár külső eszközöket is bevethet, mint például a Google Keresőt, hogy informálja a terveit.
Végül pedig ott van az On-Device 2, a gyors átalakuló művész. Ez a könnyűsúlyú VLA arra van optimalizálva, hogy helyben fusson egy robot hardverén, de a nagy dobása az adaptáció. A Google állítása szerint mindössze néhány óra alatt, kevesebb mint 200 demonstráció felhasználásával, teljesen új robottesthez – különböző érzékelőkkel, ízületekkel és mechanikával – is adaptálható. Ez egy monumentális lépés elfelé attól a hagyományos, hardverspecifikus AI fejlesztéstől, ami évtizedekig sújtotta az iparágat.
A Műhelyasztaltól a Nagybetűs Világba
Bármely robotikai AI igazi próbája az, hogy mennyire képes olyan feladatokat kezelni, amelyek nagyobb finomságot igényelnek, mint egy gyári összeszerelő sor. A Gemini Robotics 2 kifejezetten arra készült, hogy túllépjen az asztali feladatokon és komplex, valós szcenáriókba is bevethető legyen. A demók az ügyesség új szintjét mutatják be, a villanykörte kicsavarásától (92%-os sikerességi rátával) egy ötujjas, 22 szabadságfokú kézzel, egészen a csomó kötéséig egy szemeteszsákon (egy szerényebb, 44%-os sikerességi rátával).
Ez a képességbeli ugrás annak köszönhető, hogy az egész testet bevonják a döntéshozatali folyamatba. Az Apptronik Apollo 2 humanoidjával végzett teszteken a robot 76,3%-os sikerességi rátával emelt le tárgyakat a polcról – egy olyan feladat, ami összehangolt járást, egyensúlyozást, nyúlást és megfogást igényel.
De talán a leginkább előremutató funkció a többrobotos együttműködés. A Gemini Robotics ER 2 központi koordinátorként működhet, felosztva a feladatokat teljesen különböző típusú robotok között. Képzeljünk el egy Apollóhoz hasonló humanoidot, amint átad egy tárgyat egy kerekes mobil robotnak szállításhoz, és mindegyik megérti a szerepét egy nagyobb munkafolyamatban. Itt válik világossá a platform ambíciója: egy közös nyelvet teremteni a gépek számára az együttműködéshez.
A Robotok Androidja?
A Gemini Robotics 2-vel a Google stratégiai lépést tesz, hogy a hardverek következő generációjának alapvető operációs rendszerévé váljon. Azzal, hogy egy erőteljes, adaptálható AI-t hoznak létre, amely elméletileg bármilyen gépen futhat, az “agy” szállítójaként pozicionálják magukat egy virágzó robot “testek” ökoszisztémájához.
A fejlesztők és kutatók számára jó hír, hogy ennek az erőteljes új eszköznek egyes részei már elérhetők. A Gemini Robotics ER 2 mostantól elérhető a fejlesztők számára a Gemini API-n és a Google AI Studio-n keresztül, lehetővé téve számukra, hogy olyan alkalmazásokat építsenek, amelyek kihasználják annak fejlett érvelési képességeit. Ez kinyitja az ajtót a szélesebb közösség előtt a kísérletezésre a többlépéses tervezéssel és a valós idejű videóértelmezéssel saját robotikai projektjeikhez.
Persze a lélegzetelállító demók és egy valóban hasznos, megbízható robot között továbbra is szakadék tátong. A valós világ végtelenül kaotikusabb, mint egy kontrollált labor. De azáltal, hogy egy olyan általánosított intelligenciára összpontosítanak, amely képes tanulni, alkalmazkodni és együttműködni, a Google DeepMind hidat épít. Nem csupán egy okosabb robotot készítenek; egy tervrajzot próbálnak létrehozni ahhoz, hogy minden robot okosabbá váljon. És ezúttal úgy tűnik, a demók végre felnőnek a valósághoz.
