A Google DeepMind bemutatta legújabb mesterségesintelligencia-modelljét, a Gemini Roboticsot, amely a jövő robotjainak fejlesztésében nyithat új korszakot. A tavaly év végén megjelent Gemini 2.0 technológiája eddig többek között a Google új MI-chatbotját is működtette, most viszont ennél is izgalmasabb alkalmazási területre léptek vele. A vállalat szerint a Gemini Robotics lefekteti az alapokat egy olyan új generációs robotikai platform számára, amely valóban hasznos segítséget jelenthet az embereknek.
A Google DeepMind csapata az elmúlt időszakban látványos előrelépéseket ért el a Gemini-modellek fejlesztésében, amelyek összetett problémákat képesek megoldani a szöveg, kép, hang és videó multimodális értelmezésével. Ezek a képességek eddig jellemzően a digitális világban maradtak, azonban ahhoz, hogy a mesterséges intelligencia a való életben is segítséget nyújtson, képesnek kell lennie fizikai, vagyis „testet öltött” gondolkodásra is. Ez azt jelenti, hogy emberi módon értelmezze, reagálja le környezetét, és biztonságosan hajtson végre feladatokat.
Két új modell
A Google ennek érdekében két új modellt vezetett be, amelyek a Gemini 2.0 technológiára épülnek, és egy új generációs robotok fejlesztését alapozzák meg. Az első, Gemini Robotics nevű modell a vizuális, nyelvi és cselekvési (VLA) képességeket ötvözi, kifejezetten robotok irányítására. A második modell a Gemini Robotics-ER („embodied reasoning”), amely fejlett térbeli megértést kínál, lehetővé téve a robotikai szakemberek számára, hogy saját programjaikat futtassák a Gemini térérzékelő és problémamegoldó képességeire építve.
Mindkét modell jelentősen kibővíti a robotok feladatköreit, így képesek olyan feladatokat is elvégezni, amelyeket korábban nem tudtak volna. A Gemini Robotics fejlesztése során a Google együttműködik az Apptronik vállalattal, amely a következő generációs humanoid robotokat készíti majd el.
Új képességek
A Gemini Robotics három fő tulajdonságban mutat komoly előrelépést.
- Sokoldalúság: a modell képes gyorsan alkalmazkodni új körülményekhez, tárgyakhoz, helyzetekhez, akár olyan feladatok megoldásához is, amelyeket korábban nem látott a tanulási fázis során. A tesztek szerint ez a modell a hasonló fejlesztéseket átlagosan több mint kétszeres teljesítménnyel haladja meg.
- Interaktivitás. A Gemini Robotics képes megérteni és reagálni a mindennapi, természetes nyelven adott parancsokra, sőt, különböző nyelveken is képes kommunikálni. A környezet folyamatos megfigyelésével és az utasítások változásának követésével képes azonnal újratervezni tevékenységeit, így ideális asszisztens lehet otthon és a munkahelyeken is.
- Kézügyesség: a Gemini Robotics a korábbi robotoknál lényegesen precízebben képes olyan bonyolult feladatokra, mint például origamihajtogatás vagy apróbb tárgyak becsomagolása.
A Gemini Robotics modellt ráadásul úgy tervezték, hogy könnyen adaptálható legyen különböző típusú robotokhoz, a kétkarú robotoktól egészen a komplex humanoid robotokig. Ezt a képességet az ALOHA 2 robotplatformon fejlesztették ki, de sikeresen tesztelték más típusú robotokon is, például az Apptronik által készített Apollo humanoid roboton.
A Gemini Robotics-ER modellt ezzel párhuzamosan arra tervezték, hogy tovább erősítse a Gemini-modellek térbeli értelmező képességét. Ez a modell nemcsak felismeri, hanem rögtön tervezi is a fizikai objektumok megfelelő megragadását, biztonságos mozgatását. A Gemini Robotics-ER tehát a robotok teljes irányítási folyamatát képes elvégezni, a percepciótól kezdve egészen a kódgenerálásig, 2-3-szoros sikeraránnyal a Gemini 2.0 előző verziójához képest. Ezt a modellt a cég egyelőre zárt körben teszteli, többek között a korábban a Google-höz tartozó Boston Dynamics részvételével.







