Beköltözött a robotba az MI: cipőt köt, feladatot tanul, és nincs szüksége felhőre

[Forrás: Dave Lin]
A Google új fejlesztése, a Gemini Robotics On-Device modell egy új korszakot nyit a robotikában: olyan mesterséges intelligenciát hoz a fizikai robotokba, amely nem szorul internetkapcsolatra. A DeepMind által bemutatott új VLA-modell (vision-language-action) képes helyben futni, felhőalapú számítások nélkül – mégis elegendő ahhoz, hogy a robot akár cipőt kössön vagy új mozdulatsorokat tanuljon néhány példából.

 

A fejlesztés egyik vezetője, Carolina Parada szerint az önálló működés sokkal megbízhatóbbá teheti a robotokat olyan környezetekben, ahol a hálózati kapcsolat nem garantált – például kórházakban vagy ipari telephelyeken. A Google célja az, hogy a robotok valódi, mindennapi segítőtársakká váljanak, amelyek gyorsan alkalmazkodnak az új helyzetekhez, és nem szorulnak folyamatos külső irányításra.

Gépi reflexek, felhő nélkül

A robotikában régóta probléma, hogy az MI-alapú rendszerek gyakran túl lassan reagálnak, ha minden lépéshez a felhőben futó modellekhez kell fordulniuk. Az új, helyben működő Gemini Robotics modell ezzel szemben az eszközön belül értelmezi a környezetet, hoz döntéseket és hajt végre mozdulatokat – méghozzá meglepően gyorsan. A fejlesztők szerint már az alapverzió is képes sok feladatot önállóan elvégezni, és akár 50–100 bemutatás elegendő ahhoz, hogy egy új műveletet megtanuljon.

A „bemutatás” ebben az esetben azt jelenti, hogy az operátor kézzel vezérli a robotot, miközben az MI figyel és tanul. Bár a szimuláció is hasznos eszköz, a Google szerint az igazán finom mozdulatokhoz – például egy cipő bekötéséhez – elengedhetetlen a valós, fizikai környezetben rögzített adat.

Adatvédelem és autonómia

A helyi feldolgozás nemcsak a reakcióidőt rövidíti, de adatvédelmi szempontból is előnyös: érzékeny környezetekben, például egészségügyben, elkerülhető, hogy képfelvételek vagy hangadatok elhagyják a helyszínt.

Ugyanakkor a felhő nélküli működés biztonsági kihívásokat is rejt. Míg a teljes Gemini Robotics rendszer több biztonsági réteggel ellenőrzi a robot döntéseit – a veszélyes mozdulatokat már előre kiszűrve –, az önálló VLA modell fejlesztőinek maguknak kell beépíteniük ezeket a védelmi funkciókat. A Google azt javasolja, hogy a tesztelők kössék össze az új rendszert a Gemini Live API-val, amely tartalmaz biztonsági rétegeket, és implementáljanak alacsony szintű szabályozókat a kritikus műveletekhez.

Tovább tanulnak – emberi módra

A Gemini Robotics egyik különlegessége, hogy generatív MI-t használ a robotikus viselkedés létrehozásához – hasonlóan ahhoz, ahogy a szöveg- vagy képgenerátorok működnek. A rendszer multimodális megértéssel rendelkezik, vagyis egyszerre tud képi információkból, szöveges utasításokból és kontextusból értelmezni és cselekedni. Ahogy egy chatbot verset ír vagy cikket foglal össze, úgy tud egy robot mozdulatsorokat végrehajtani – például pólót hajtogatni, vagy egy új tárgyat felemelni.

A jelenlegi fejlesztés még a Gemini 2.0 modellre épül, de Parada szerint hamarosan megjelenhet a 2.5-ös változatra épülő robotika is – amely a csevegőmodellek világában már hatalmas előrelépést hozott. Ha hasonló előrelépést hoz a fizikai robotoknál is, az új korszak valóban elkezdődhet: önálló, megbízható és tanulékony robotokkal a mindennapjainkban.

 

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top