A az Openai legújabb modellje, a GPT-4o sokkal jobban teljesít a sakkban, mint más modellek, de az esetek 13 százalékában mégis szabálytalanul lép. A nagy nyelvi modellek (LLM-ek) új benchmarkja azt mutatja, hogy még a legújabbak sem a legjobb sakkozók.
Az „LLM Chess Puzzles” nevet viselő, a GitHubon futó projekt létrehozója Vladimir Prelovac szoftvermérnök, úgy teszteli az LLM-eket, hogy 1000 sakkrejtvényt ad nekik, amelyeket ki kell tölteniük. A normál sakkjátszmával ellentétben a rejtvények lényegében olyan logikai feladatok, ahol a sakktábla állapota meghatározott módon van beállítva. A sakkrejtvény célja a legjobb lépés vagy lépéslánc kijátszása a lehető leggyorsabb sakk-matt elérése érdekében.
Míg a sakkjátszma a döntéshozatalt teszteli egy másik játékos ellen, a sakkrejtvény a logikai gondolkodást és a sakk mechanikájának megértését teszi próbára, és ez nagyobb kihívást jelent a mesterséges intelligenciának.
„Bár a nagyméretű nyelvi modellek szolgáltatói megosztják a saját teljesítményükre vonatkozó benchmarkjaikat, ezek az eredmények a túlillesztés miatt félrevezetők lehetnek. Ez azt jelenti, hogy a modellt úgy alakíthatják ki, hogy az adott teszteken jól teljesítsen, de nem mindig tükrözi a valós hatékonyságot”,
mondta Prelovac a The Register című lapnak.
Egy kivétellel gyenge készségek
A benchmark GitHubján a ma legnépszerűbb LLM-ek közül számos OpenAI (köztük a GPT-4o), az Anthropic és a Mistral teljesítményadatai láthatók. A legtöbb modell lesújtó Élő-pontszámot ért el, amely egy olyan szám, amely a készségszintet jelzi. (A továbbiakban „Elo”.)A 100 és 500 közötti tartomány a sakkozásban nagyon kevés tapasztalattal rendelkező játékosok területe. Ezek közé tartoztak a Claude 3 változatok, a GPT-3.5 Turbo és a Mistral modellek. A Gemini 1.5 Pro teljesen megbukott, mert nem tudta úgy formázni a válaszait, hogy csak a lépést mondja ki, függetlenül attól, hogy a kéréseket hogyan fogalmazták meg.
Egy mesterségesintelligencia-család azonban a többi fölé emelkedett. A GPT-4 és GPT-4 Turbo Preview modellek 1,047, illetve 1,144 Elo-t értek el, amely átlagon felüli. Különösen ügyes volt a GPT-4o 1 790-es Elo-val, ami tiszteletreméltó amatőr minősítés, de még mindig a 2 000-nél kezdődő szakértői szint alatt van. Az Elo kiszámítása nem volt éppen egyszerű Prelovac számára, aki elmondta, hogy az LLM-ek hajlamosak voltak illegális vagy nem engedélyezett lépéseket tenni – például egy bástyát átlósan mozgatni vagy a saját bábuját ütni. A GPT-4o az esetek 12,7 százalékában lépett szabálytalanul. Az 1000 feladványból 501-ben a GPT-4o képes volt megtalálni a legjobb lépést.
Az LLM-ek a valódi intelligencia hiánya miatt küzdenek a sakkban?
Paradox, hogy a GPT-4o tisztességesen magas szinten tud játszani, mégis elbukik néhány rejtvényt egy szabálytalan lépés miatt. Ha a szabálytalan lépéseket nem számolnánk, Prelovac szerint a GPT-4o Elo-értéke meghaladná a 2000-et, ami a nemzeti mester küszöbét jelenti.
„Kissé kiábrándító, de várható volt, hogy ezek a modellek nem mutatnak valódi általánosítást az intelligencia vagy az érvelés terén. Miközben bizonyos feladatokat jól el tudnak végezni, még nem mutatnak olyan széleskörű, alkalmazkodó megértést vagy problémamegoldó képességet, mint az emberi intelligencia”,
mondta.
Statisztikai modellek
Alapjában véve az LLM-ek még mindig statisztikai modellek nagy halmazai, amelyek csak azt próbálják leírni, aminek értelme van. Ennek illusztrálására Prelovac az LLM-eket a „Connect Four” játékban (az Amőba egyik változatában) is tesztelte, egy olyan játékban, amelyet általában sokkal könnyebbnek tartanak, mint a sakkot. Azonban még a GPT-4o sem tudta megérteni, mikor kell megakadályozni, hogy az ellenfele négy bábut összekapcsoljon. Prelovac úgy jellemezte a teljesítményét, hogy az egy négyéves gyermekével volt egyenértékű.
„A kudarc annak köszönhető, hogy a tréningadatokban nincsenek meg a lejátszott játszmák történeti feljegyzései. Ez azt jelenti, hogy nem lehet azt állítani, hogy ezek a modellek a szó bármelyik értelmében képesek ‘érvelni’, hanem csupán a képzés során látottak variációját adják ki”,
mondta.
Egyelőre egyetlen LLM sem lesz képes úgy sakkozni, mint sakkmotor, például a Stockfish. Azonban a több gyakorló adat potenciálisan profibbá teheti az LLM-eket, különösen a nyitólépések és az olyan játszmák esetében, ahol olyan kevés bábu van a táblán, hogy a matt már néhány lépésről látható. A játszma középső részében valóban hatalmas mennyiségű adatra lehet szükség ahhoz, hogy az LLM ne tegyen szabálytalan lépéseket.







