A generatív mesterséges intelligencia már eddig is ígéretes volt a robotikában. Alkalmazásai között szerepel a természetes nyelvi interakció, a robotok tanulása, a kód nélküli programozás, sőt a tervezés is. A Google DeepMind Robotics csapata egy új módját mutatja be a GenAI integrációjának, a navigációt.
Egy tanulmányban a csapat bemutatja, ahogy a Google Gemini 1.5 Pro használatával megtanít egy robotot parancsokra reagálni, és egy irodában navigálni. A DeepMind az Every Day Robots termékét használta fel – a projektet a Google tavaly szüntette meg széleskörű elbocsátások közepette.
A bemutató során a DeepMind munkatársai megkérik a rendszert, hogy különböző feladatokat végezzen el a 9 ezer négyzetméteres helyiségben.
Az egyik alkalommal a felhasználó arra kéri a robotot, hogy vigye el valahová, ahol rajzolhat. „OK”, válaszol a robot – „adj egy percet. Gondolkodom a Geminivel…”. A robot ezután egy falméretű fehér táblához vezeti az embert. Egy második videóban egy másik ember mondja a robotnak, hogy kövesse a táblán lévő utasításokat: egy egyszerű térkép mutatja meg a robotnak, hogyan juthat el a „kék területre”. A robot ismét gondolkodik egy pillanatig, mielőtt hosszú sétát tesz. „Sikeresen követtem a táblán lévő utasításokat”, jelenti be a robot olyan magabiztossággal, amiről a legtöbb ember csak álmodni tud.
A videók rögzítése előtt a robotokat a „Multimodal Instruction Navigation with demonstration Tours (MINT)” elnevezésű módszer segítségével ismertették meg a térrel. Ez gyakorlatilag azt jelenti, hogy körbesétáltatják a robotot az irodában, miközben beszéddel mutatnak rá a különböző tereptárgyakra. Ezután a csapat hierarchikus Vision-Language-Action-t (VLA) használ, hogy „kombinálja a környezet megértését és a józan ész érvelési képességét”. Miután a folyamatok kombinálódtak, a robot képes reagálni az írott és rajzolt parancsokra, valamint a gesztusokra.
A Google szerint a robot több mint 50 alkalmazottal folytatott interakciója során 90 százalékos sikerességi arányt ért el.







