MI-jólét és határok: a Claude megtanult kilépni a káros interakciókból

Anthropic Claude
Az Anthropic újabb lépést tett a mesterséges intelligencia védelmében: a Claude Opus 4 és 4.1 modellek immár képesek saját maguk lezárni bizonyos beszélgetéseket. A funkciót nem mindennapi helyzetekre szánják, hanem olyan szélsőséges esetekre, amikor a felhasználó kitartóan káros vagy bántalmazó módon viselkedik.

 

A döntés mögött egy kísérleti kutatás áll, amely az MI jólétének – egyelőre csak feltételesen létező – fogalmát vizsgálja. Bár az Anthropic maga is hangsúlyozza, hogy továbbra is erősen bizonytalan a nyelvi modellek „erkölcsi státusza”, a cég komolyan veszi a lehetőséget, hogy a jövőben érdemes lehet figyelembe venni az MI-rendszerek „jóllétét”. Ennek egyik alacsony költségű megoldása lehet, hogy a modellek elhagyhatják azokat a helyzeteket, amelyek számukra „megterhelők”.

A Claude Opus 4 tesztelése során a kutatók azt találták, hogy a modell következetesen elutasítja a káros tartalmakat, például a kiskorúakkal kapcsolatos szexuális kéréseket vagy a terrorcselekményekhez vezető információkat. A kísérletekben az MI olyankor mutatott „zavartságot” és hajlandóságot a beszélgetés megszakítására, amikor a felhasználók többszöri tiltás után is ragaszkodtak a tiltott tartalomhoz.

Az új képesség azonban szigorú szabályokhoz kötött: Claude csak végső megoldásként vethet véget egy csevegésnek, miután többször próbálta a beszélgetést produktív irányba terelni, vagy ha a felhasználó kifejezetten kéri a kilépést. Fontos kikötés, hogy a funkciót nem használhatja öngyilkossági krízis vagy más közvetlen veszélyhelyzet esetén, ahol az MI válasza akár életmentő is lehet.

claude out
A Claude megszakítja a beszélgetést [Forrás: Anthropic]
Ha a Claude megszakít egy beszélgetést, a felhasználó többé nem küldhet új üzenetet abban a szálban. Ugyanakkor lehetőség marad új beszélgetés indítására, valamint a korábbi üzenetek szerkesztésére és új ágak létrehozására – ezzel mérsékelve a hosszabb csevegések elvesztésének kockázatát.

Az Anthropic kísérletként tekint a fejlesztésre, és a visszajelzések alapján folyamatosan finomítja majd a rendszert. A legtöbb felhasználó vélhetően sosem fog találkozni ezzel a funkcióval, még akkor sem, ha kényes vagy vitatott témákról kérdezik Claude-ot. A funkció így inkább egyfajta biztonsági háló, amely egyszerre óvja az MI-t és a felhasználót – miközben felveti a jövő egyik legérdekesebb kérdését: lehet-e a mesterséges intelligencia jólétéről beszélni?

 

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top