A csapat megerősített tanulással programozott fel robotokat 1-1 ellen focizásra 4×5 m-es pályán. A 11-11 ellen és 90 m-es verzióra még egy „kicsit” várni kell.
Egy kis magyarázat: két kis robot focizik egymással. Hasonló robotokat már láttunk, ezeknek 20 ízületük van, különlegességük, hogy a karjaik aktívan részt vesznek az egyensúlyozásban – és hanyatt- vagy hasraesésből felállásban. Az energiaellátásuk autonóm, az „intelligenciájukat” viszont külső, az eseményeket valós időben megfigyelő és elemző, majd a játékosokat vezérlő számítógép adja. (A tudományos publikáció itt olvasható [PDF])
Érdemes megnézni a négy meccset a 7 perces videóban annak ellenére, hogy a játékosok mozgása első pillantásra meglehetősen ormótlan. (Sokadik megpillantásra is, de:) A robotok célirányosan a labda felé futnak, mindkét lábukkal tudnak rúgni. Mellbevágóan emberi, hogy nem a rúgás az első céljuk, amikor a labdához érnek, hanem az ellenfél kapuja felé fordulás. Számtalanszor elesnek, de azonnal ügyesen felállnak.
Van még mit programozni: amikor a labda megáll egy játékos és a rézsű között, akkor … hát, nincs mit csinálni, mert megszűnt a motiváció, a robotok mozdulatlanná dermednek. Ilyenkor a külső szemlélő egy bottal meglöki a labdát, és a játékosok folytatják a küzdelmet.
| A Robotis OP3 játékosok egy alacsony költségű, elemmel működő, miniatűr, humanoid platform tagjai. 51 cm magasak, súlyuk 3,5 kg, és 20 Robotis Dynamixel XM430-350-R szervomotor hajtja „őket”. A szervomotorok visszajelzik a pillanatnyi szöghelyzetüket a szoftvernek, amely a megkapott adatok alapján vezérli a következő mozdulatot: nyilvánvalóan egy több (sok) rétegű szoftverrendszerről van szó. |
A DeepMind csapatának célja az volt, hogy egy szoftvert betanítson focizni, ami számos készséget igényel, beleértve a járást, a rúgást, a felállást, a góllövést és a védekezést, amelyeket mind össze kell hangolni a gólszerzéshez és a győzelemhez.
Az ágens – jelen esetben a robotot irányító szoftver – kiképzéséhez nem volt elegendő a gólokért járó jutalom, ami nem hozná létre az összes szükséges készséget. Ehelyett a kutatók külön-külön közelítették meg a készségeket, és az általuk tanító politikának nevezett irányelvek kidolgozására összpontosítottak. Ezek a szabályok olyan dolgokat szabályoznak, mint például a földről való felkelés és a gólszerzés egy edzetlen ellenféllel szemben – „aki” azonnal a földre esik, ami nem különbözik a tényleges futballbukdácsolástól.
Két fő tanítási területet különítettek el, a felállást és a játékot, ezekben kellett először jeleskedni a játékosoknak az ellenfél nélküli megerősített mélytanulás során. Ezek után egyesítették a két tudásterületet, és tovább folytatták az ellenfél nélküli edzést. Ezzel a módszerrel gyorsabban és jobb eredmény értek el, mintha az alapoktól az 1-1 ellen játékot építették volna fel.
A felkelés tanítása 14, a futballozás képzése 158 órát vett igénybe, amit 68 óra egyszemélyes edzés követett. A megerősítéses tanulási politika jobban teljesített, mint a speciális, kézzel tervezett készségek: 156 százalékkal gyorsabban sétált, és 63 százalékkal kevesebb időbe telt felállni a robotnak, áll a tanulmányban. A labdaközelség súlyozásával a rúgássebesség 2 m/s körüli volt, viszont a labdához való felfutásos közelítéssel az átlagos rúgási sebesség 2,6 m/s lett, , a maximális rúgási sebesség az epizódok során 3,4 m/s is volt. A DeepMind bebizonyította, hogy a megerősített mélytanulás hatékonyan és alacsony költséggel alkalmazható humanoid robotok tanítására.







