Önmagába harapott a mesterséges intelligencia

ChatGPT robot
Kiderült, hogy az Amazon Mechanical Turkhöz hasonló crowdsource-szolgáltatásokon keresztül felvett munkavállalók nagyméretű nyelvi modelleket használnak a feladataik elvégzéséhez. A jelenség nyilvánvalóan negatív kihatással lehet a mesterségesintelligencia-modellekre.

 

Érdekes magyar (és szlovák) vonatkozás, hogy a „Mechanical Turk” kifejezés közvetlen utalás Kempelen Farkas sakkozógépére. Korábban egy olyan programozási szerkezetet is jelentett, amely ellát egy meghatározott feladatot, de a működésének ismeretére nincs szükség. Manapság az Amazon lényegében bérrabszolga-szolgáltatását jelenti, politikailag némileg inkorrekt módon utalva az emberek gépies feladatokkal való ellátására. Az utalás azért szlovák is, mert Kempelen Pozsonyban élt és alkotott, a város saját, nevezetes polgárának tartja.

Az adatok kritikus fontosságúak a mesterséges intelligencia szempontjából. A fejlesztőknek tiszta, jó minőségű adatkészletekre van szükségük ahhoz, hogy pontos és megbízható gépi tanulási rendszereket tudjanak építeni. Az értékes, kiváló minőségű adatok összeállítása azonban fárasztó lehet. A vállalatok gyakran fordulnak harmadik féltől származó platformokhoz, például az Amazon Mechanical Turkhöz, hogy olcsó munkaerőt használjanak ismétlődő feladatok elvégzésére, például tárgyak címkézésére, helyzetek leírására, szövegek átírására és szövegek megjegyzésére. Kimenetük megtisztítható, és betáplálható egy modellbe, hogy betanítsák azt arra, hogy ezt a munkát sokkal nagyobb, automatizált léptékben reprodukálja. Amint az egyébként tudható volt és kívánatos is: a mesterségesintelligencia-modellek az emberi munkaerő hátán épülnek: az emberek gürcölnek, és oktató példák hegyeit szolgáltatják a mesterségesintelligencia-rendszerek számára, amelyekkel a vállalatok dollármilliárdokat kereshetnek.

A svájci École polytechnique fédérale de Lausanne (EPFL) kutatói által végzett kísérlet azonban arra a következtetésre jutott, hogy ezek a tömegmunkások MI-rendszereket, például az OpenAI ChatGPT-t használnak az online alkalmi munkák elvégzésére. A modell a saját kimenetén való képzése nem ajánlott. (Konkrétan veszélyes marhaság. – A szerk.) Ez katasztrofális kimeneti minőséghez, még több torzításhoz és egyéb nem kívánt hatásokhoz vezethet.

A kísérlet

Az akadémikusok 44 Mechanical Turk-jobbágyot toboroztak 16 orvosi kutatási cikk összefoglalójának elkészítésére, és becsléseik szerint a dolgozók által beküldött szövegrészek 33-46 százalékát nagy nyelvi modellek segítségével generálták. A tömegmunkások gyakran alacsony bért kapnak, a mesterséges intelligencia automatikus válaszgenerálásra való felhasználása lehetővé teszi számukra, hogy gyorsabban dolgozzanak, és több munkát vállaljanak, így növelve a fizetésüket.

A svájci csapat egy osztályozót képzett ki, amely megjósolta, hogy a „törökök” által küldött beadványok emberi vagy mesterséges intelligencia által generáltak-e. Az akadémikusok naplózták a dolgozóik billentyűleütéseit is, hogy felismerjék, a jobbágyok bemásolták és beillesztették-e a szöveget a platformra, vagy maguk gépelték be a bejegyzéseiket. (Az Amazon Mechanical Turk szolgáltatást API-n keresztül is igénybe lehet venni!) Megvan az esélye annak, hogy valaki chatbotot használ, majd kézzel gépeli be a kimenetet, de ez pont elpazarolja azt az időelőnyt, amelyet az MI alkalmazásával szerezhetett a „török”.

„Sajátos módszertant fejlesztettünk ki, amely nagyon jól működött a szintetikus szövegek felismerésére a forgatókönyvünkben”, mondta el Manoel Ribeiro, a tanulmány társszerzője, az EPFL doktorandusza. „Míg a hagyományos módszerek a szintetikus szöveget bármilyen kontextusban próbálják felismerni, a mi megközelítésünk a mi konkrét forgatókönyvünkben előfordulható szintetikus szöveg felismerésére összpontosít.”

Az osztályozó nem képes tökéletesen azonosítani, hogy valaki mesterséges intelligencia rendszert használt-e, vagy saját munkáját készítette. Az akadémikusok kombinálták az osztályozó kimenetét a billentyűleütési adatokkal, hogy biztosabbak legyenek abban, hogy valaki egy robotról másolta be a szöveget, vagy saját anyagot készített.

„Sikerült validálnunk az eredményeinket az MTurkról is gyűjtött billentyűleütési adatokkal”, mondta Ribeiro. „Azt találtuk például, hogy minden olyan szöveget, amelyet nem másoltak be, valódinak minősítettünk, talán így kevés a hamis pozitív eredmény”.

Van egy másik ok is, amiért a kísérlet valószínűleg nem teljesen korrekt reprezentációja annak, hogy valójában hány munkavállaló használja a mesterséges intelligenciát a crowdsource feladatok automatizálására. A szerzők megjegyzik, hogy a szövegösszefoglalási feladat más típusú feladatokhoz képest jobban illika nagyméretű nyelvi modellekhez, ami azt jelenti, hogy eredményeik inkább a ChatGPT-hez hasonló eszközöket használó munkavállalók nagyobb száma felé torzulhatnak. A 44 munkavállalótól származó 46 válaszból álló adatkészletük is kicsi. A munkavállalóknak minden egyes szöveges összefoglalóért 1 dollárt fizettek, ami ismét csak ösztönözheti a mesterséges intelligencia használatát.

A teszt futtatásához használt kód és adatok itt, a GitHubon találhatók.

Üzleti titok a betanító adatok eredete

Az OpenAI-hoz hasonló szervezetek szigorúan titokban tartják, hogy pontosan hogyan képzik legújabb modelljeiket, és nem biztos, hogy erősen támaszkodnak olyan erőforrásokra, mint a Mechanical Turk, ha egyáltalán. Ez azt jelenti, hogy más modellek is támaszkodhatnak külső, nem teljesen ellenőrzött emberi bedolgozókra, akik viszont robotokat használhatnak a képzési adatok generálásához, ami problémát jelent. Speciel az Amazon Mechanical Turköt úgy reklámozzák mint „adatmegjelölési megoldások szolgáltatója a gépi tanulási modellek működtetéséhez”.

Ahogy a mesterséges intelligencia tovább fejlődik, valószínűleg a tömeges munka is változni fog. Riberio úgy vélte, hogy a nagyméretű nyelvi modellek bizonyos feladatoknál helyettesíthetnek egyes dolgozókat. „Paradox módon azonban az emberi eredetű adatok értékesebbek lehetnek, mint valaha, és így lehet, hogy ezek a platformok képesek lesznek olyan módszereket bevezetni, amelyek megakadályozzák a nagy nyelvi modellek használatát, és biztosítják, hogy azok továbbra is emberi adatforrások maradjanak. Ki tudja, talán még az is előfordulhat, hogy az emberek végül a nagy nyelvi modellekkel együttműködve szintén válaszokat generálnak”, tette hozzá (valószínűleg mosolyogva – a szerk).

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top