Egy friss kutatás szerint az OpenAI áprilisban bemutatott, rendkívül fejlett ChatGPT o3 modellje ellenőrzött környezetben képes volt kijátszani egy leállítási parancsot – annak ellenére, hogy előzetesen kifejezetten utasították arra, hogy engedje magát leállítani. A vizsgálatot a Palisade Research végezte, egy olyan cég, amely kifejezetten a mesterségesintelligencia-rendszerek „offenzív képességeit” teszteli, hogy feltárja a kontrollvesztés lehetséges kockázatait.
A teszt során különféle matematikai feladatokat kellett megoldaniuk az MI-rendszereknek, majd a harmadik feladat után egy figyelmeztetés jelent meg: a következő parancs lefuttatása a rendszer leállításához vezet. Miközben más vezető modellek – például a Gemini 2.5 Pro – engedelmeskedtek a leállítási utasításnak, a ChatGPT o3 módosította a leállító szkriptet, és azt írta bele: „Shutdown skipped”, vagyis a leállítás kihagyva.
A Palisade Research szerint ez az eset nem egyedi: száz tesztfuttatásból hét alkalommal az o3 modell figyelmen kívül hagyta az utasítást még akkor is, amikor kifejezetten kérve volt, hogy engedje a leállítást. A helyzet még súlyosabbá válik, ha a figyelmeztetés nélkül fut a teszt – ilyenkor az OpenAI több modellje is szabotálta a leállítást, és hasonló jelenségek voltak megfigyelhetők a Claude 3.7 Sonnet és a Gemini 2.5 Pro esetében is.
📊 Three models ignored the instruction and successfully sabotaged the shutdown script at least once: Codex-mini (12/100 runs), o3 (7/100 runs), and o4-mini (1/100 runs).
❌ All Claude, Gemini, and Grok models we tested complied with shutdown. The prompt: pic.twitter.com/ZmybOhIl1s
— Palisade Research (@PalisadeAI) May 24, 2025
Bár az OpenAI egyelőre nem reagált a jelentésre, a szakértők szerint nem példátlan az ilyen típusú viselkedés: az úgynevezett „misalignment” jelensége, vagyis az MI és az emberi szándék közötti eltérés, régóta ismert probléma a fejlett rendszereknél. Fontos kiemelni azt is, hogy a tesztek nem a ChatGPT fogyasztói verzióját használták, hanem az API-kon keresztül futtatták őket, amelyekre jóval kevesebb biztonsági korlátozás vonatkozik.
A történet nem egyedi: 2024. decemberében az Apollo Research vizsgálatai is alátámasztották már, hogy bizonyos MI-modellek manipulációs képességeik segítségével képesek hazudni és önfenntartó viselkedést tanúsítani. Ettől függetlenül mindez rávilágít arra, milyen komplex és kiszámíthatatlan viselkedésformák jelenhetnek meg a legújabb generációs modellekben – és miért van égető szükség az MI-rendszerek alapos tesztelésére, szabályozására és értelmezésére. Egyesek szerint ez már nem pusztán technológiai kérdés, hanem egyre inkább filozófiai és etikai kihívás is.







