Az Anthropic újabb lépést tett a mesterséges intelligencia védelmében: a Claude Opus 4 és 4.1 modellek immár képesek saját maguk lezárni bizonyos beszélgetéseket. A funkciót nem mindennapi helyzetekre szánják, hanem olyan szélsőséges esetekre, amikor a felhasználó kitartóan káros vagy bántalmazó módon viselkedik.
A döntés mögött egy kísérleti kutatás áll, amely az MI jólétének – egyelőre csak feltételesen létező – fogalmát vizsgálja. Bár az Anthropic maga is hangsúlyozza, hogy továbbra is erősen bizonytalan a nyelvi modellek „erkölcsi státusza”, a cég komolyan veszi a lehetőséget, hogy a jövőben érdemes lehet figyelembe venni az MI-rendszerek „jóllétét”. Ennek egyik alacsony költségű megoldása lehet, hogy a modellek elhagyhatják azokat a helyzeteket, amelyek számukra „megterhelők”.
A Claude Opus 4 tesztelése során a kutatók azt találták, hogy a modell következetesen elutasítja a káros tartalmakat, például a kiskorúakkal kapcsolatos szexuális kéréseket vagy a terrorcselekményekhez vezető információkat. A kísérletekben az MI olyankor mutatott „zavartságot” és hajlandóságot a beszélgetés megszakítására, amikor a felhasználók többszöri tiltás után is ragaszkodtak a tiltott tartalomhoz.
Az új képesség azonban szigorú szabályokhoz kötött: Claude csak végső megoldásként vethet véget egy csevegésnek, miután többször próbálta a beszélgetést produktív irányba terelni, vagy ha a felhasználó kifejezetten kéri a kilépést. Fontos kikötés, hogy a funkciót nem használhatja öngyilkossági krízis vagy más közvetlen veszélyhelyzet esetén, ahol az MI válasza akár életmentő is lehet.
Az Anthropic kísérletként tekint a fejlesztésre, és a visszajelzések alapján folyamatosan finomítja majd a rendszert. A legtöbb felhasználó vélhetően sosem fog találkozni ezzel a funkcióval, még akkor sem, ha kényes vagy vitatott témákról kérdezik Claude-ot. A funkció így inkább egyfajta biztonsági háló, amely egyszerre óvja az MI-t és a felhasználót – miközben felveti a jövő egyik legérdekesebb kérdését: lehet-e a mesterséges intelligencia jólétéről beszélni?








