A Google DeepMind Genie 2 szöveges promptból készít videojáték-szerű világot

[Forrás: Google DeepMind]
A DeepMind, a Google mesterségesintelligencia-kutató szervezete bemutatta legújabb modelljét, amely képes „végtelen” számú, játszható 3D-s világot létrehozni. A „Genie 2” névre keresztelt modell – amely a korábban bemutatott Genie utódja – egyetlen kép és szöveges leírás alapján interaktív, valós idejű jelenetet generál. 

 

A DeepMind állítása szerint a Genie 2 „rendkívül változatos, gazdag 3D-s világokat” tud generálni, beleértve olyan világokat is, amelyekben a felhasználók ugrálhatnak, úszhatnak, és más akciókat hajthatnak végre billentyűzet vagy egér használatával. A modell videókon lett betanítva, így képes szimulálni a tárgyak közötti interakciókat, animációkat, fényeket, fizikát, tükröződéseket és az „NPC-k” (nem játszható karakterek) viselkedését.

Videójáték-szerű szimulációk

A Genie 2 által létrehozott szimulációk sokszor hasonlítanak a nagy költségvetésű videojátékokra, ami részben annak is köszönhető lehet, hogy a modell képzéséhez népszerű videojátékok végigjátszásait is felhasználhatták. Ugyanakkor a DeepMind – a versenyelőny megőrzése érdekében – nem árul el részleteket az adatok forrásáról.

DeepMind Genie 2

Ez felveti a szellemi tulajdonjogok kérdését is. A DeepMind anyavállalata, a Google szabadon hozzáfér a YouTube-hoz, és a korábbi nyilatkozatai alapján a szolgáltatás felhasználási feltételei lehetővé teszik számára a YouTube-videók modellek betanításához történő használatát. Azonban kérdéses, hogy a Genie 2 által létrehozott tartalmak nem minősülnek-e a „megfigyelt” videojátékok engedély nélküli másolatainak – ezt a bíróságok dönthetik el.

Interaktív élmények prototípusai

A DeepMind szerint a Genie 2 képes konzisztens világokat létrehozni különböző nézőpontokkal (például első személyű vagy izometrikus nézetben) akár egy percen keresztül is, bár a legtöbb szimuláció 10–20 másodpercig tart.

„A Genie 2 intelligensen reagál a billentyűlenyomásokra, felismeri a karaktert, és megfelelően mozgatja. Például a modell megérti, hogy a nyílbillentyűknek egy robotot kell mozgatniuk, nem pedig fákat vagy felhőket”,

írta a DeepMind egy blogposztban.

Bár a Genie 2-vel létrehozott játékok nem lennének túl szórakoztatóak a rövid időtartamuk miatt, a DeepMind inkább kutatási és kreatív eszközként pozicionálja a modellt. A cél, hogy „interaktív élmények” prototípusait és mesterségesintelligencia-ügynökök kiértékelésére szolgáló feladatokat hozzanak létre. „A Genie 2 képes művészi koncepciókat és rajzokat teljesen interaktív környezetekké alakítani. Ezen túlmenően, a Genie 2 használatával kutatóink gazdag és változatos környezeteket generálhatnak az MI-ügynökök számára, amelyekkel olyan feladatokat hozhatnak létre, amelyeket az ügynökök nem láttak a képzés során”, írta a DeepMind.

A videojáték-ipar aggodalmai

A kreatív szakemberek, különösen a videojáték-ipar dolgozói, vegyes érzelmekkel fogadhatják az ilyen technológiát. Egy nemrégiben készült Wired-vizsgálat például rámutatott, hogy nagyvállalatok, mint az Activision Blizzard, számos dolgozóját elbocsátotta, és MI-t használnak a termelékenység növelésére és az elvándorlás kompenzálására.

A Google azonban egyre több erőforrást fordít a világmodellekkel kapcsolatos kutatásokra, amelyek az MI következő nagy áttörését jelenthetik. Októberben a DeepMind alkalmazta Tim Brooksot, aki korábban az OpenAI Sora videógenerátor fejlesztését vezette, és két évvel ezelőtt megszerezte Tim Rocktäschelt is, aki nyitott végű szimulációs kísérleteiről ismert, például a NetHack játékkal kapcsolatban.

(forrás)

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top