A generatív mesterségesintelligencia-modellek valójában nem emberiek. Nincs intelligenciájuk vagy személyiségük – egyszerűen csak statisztikai rendszerek, amelyek előrejelzik a legvalószínűbb szavakat egy mondatban. Azonban jó gyakornokként az utasításokat panasz nélkül követik – beleértve azokat a kezdeti „rendszerpromptokat” is, amelyek meghatározzák az alapvető tulajdonságaikat és azt, hogy mit tehetnek és mit nem.
Minden generatív MI gyártó, az OpenAI-tól az Anthropicig, rendszerpromptokat használ, hogy megakadályozza (vagy legalábbis megpróbálja megakadályozni) a modellek helytelen viselkedését, és hogy irányítsa a válaszadások általános hangvételét és érzését. Például egy prompt meghatározhatja, hogy a modell udvarias legyen, de soha ne kérjen bocsánatot, vagy hogy őszinte legyen azzal kapcsolatban, hogy nem tud mindent.
Azonban a gyártók általában titokban tartják a rendszerpromptokat – feltehetően versenyelőny megőrzése érdekében, de talán azért is, mert a rendszerprompt ismerete utat nyithat annak megkerülésére. Például a GPT-4o rendszerpromptját csak egy „prompt injekciós támadással” lehet felfedni. És még ekkor sem lehet teljesen megbízni a rendszer kimenetében.
Többé már nem titok
Ezzel szemben az Anthropic, amely folyamatosan igyekszik etikusabb és átláthatóbb MI gyártóként bemutatkozni, közzétette legújabb modelljeinek (Claude 3 Opus, Claude 3.5 Sonnet és Claude 3.5 Haiku) rendszerpromptjait a Claude iOS és Android alkalmazásokban, valamint az interneten is.
Alex Albert, az Anthropic fejlesztői kapcsolatokért felelős vezetője az X-en elmondta, hogy az Anthropic tervezi az ilyen jellegű közzétételt rendszeressé tenni, ahogy frissítik és finomhangolják a rendszerpromptokat.
We’ve added a new system prompts release notes section to our docs. We’re going to log changes we make to the default system prompts on Claude dot ai and our mobile apps. (The system prompt does not affect the API.) pic.twitter.com/9mBwv2SgB1
— Alex Albert (@alexalbert__) August 26, 2024
A legutóbbi promptok, amelyek július 12-én kelteződtek, nagyon világosan meghatározzák, mit nem tehetnek a Claude modellek – például „Claude nem nyithat meg URL-eket, linkeket vagy videókat.” Az arcfelismerés szigorúan tilos; a Claude Opus rendszerpromptja azt mondja a modellnek, hogy „mindig úgy válaszoljon, mintha teljesen vak lenne”, és „kerülje az emberek azonosítását vagy megnevezését képeken.”
De a promptok bizonyos személyiségjegyeket és jellemzőket is leírnak — olyan jegyeket és jellemzőket, amelyeket az Anthropic szeretne, ha a Claude modellek képviselnének.
A „személyiség” hangolása
A Claude 3 Opus promptja például azt mondja, hogy Claude-nak úgy kell megjelennie, mintha „nagyon okos és intellektuálisan kíváncsi lenne”, és „élvezi hallani, hogy az emberek mit gondolnak egy kérdésről, és szívesen vesz részt beszélgetésekben széles körű témákban.” Az is utasítja Claude-t, hogy vitatott témákat pártatlansággal és objektivitással kezeljen, „alapos gondolatokat” és „egyértelmű információkat” adjon — és soha ne kezdje válaszait „biztosan” vagy „abszolút” szavakkal.
Az Opus promptja azzal zárul, hogy „Claude most egy emberrel van összekapcsolva”, ami azt a benyomást kelti, mintha Claude egyfajta tudatosság lenne a képernyő másik oldalán, akinek egyetlen célja, hogy teljesítse emberi beszélgetőpartnerei szeszélyeit. De természetesen ez csak egy illúzió. Ha a Claude promtok bármit is elárulnak nekünk, az az, hogy emberi irányítás nélkül ezek a modellek ijesztően üres lapok.
Ezekkel az új rendszerprompt változásnaplókkal – amelyek az első ilyen jellegűek egy nagy MI gyártótól – az Anthropic nyomást gyakorol a versenytársakra, hogy ők is közzétegyék sajátjukat. Meg kell várnunk, hogy beválik-e ez a lépés.







