A mesterséges intelligencia és a nyelvtechnológia legújabb kutatási eredményeit ötvözi a Szegedi Tudományegyetem kutatói által elkészített HuSpaCy, a nyílt forráskódú magyar nyelvi elemzőrendszer, amely a SZTAKI által koordinált Mesterséges Intelligencia Nemzeti Laboratórium (MILAB) projekt keretében jött létre.
Nemcsak a kutatásokban, hanem a nyelvtechnológiában is áttörést hozott az elmúlt évtized. Az akadémiai eredmények eljutottak arra az érettségi szintre, hogy akár ipari forgalomban is használhatóak legyenek, mivel olyan integrálhatósággal dolgoznak, amelyeknek használatával egyszerűbbé válik a magyar nyelvű szövegek jelentéstani és nyelvtani értelmezése. Ma már akár kisebb, MI-szakértelemmel nem rendelkező cégek is képesek szövegelemzési problémák megoldására. A mesterséges intelligencia kutatásában is nagy előrelépés történt az utóbbi években, hiszen a neurális hálók már képesek megtanulni, hogy mit kell értelmezniük, így a gépi tanulásos módszerben élvonalra tört az úgynevezett mélytanulás.
„Természetes nyelvi szövegeken működő algoritmusok emberek által is értelmezhető nyelvtani szimbólumokra építenek, így a HuSpaCy megfelelő alapul szolgálhat chatbotokhoz vagy akár email-értelmező rendszerekhez is”, idézi a SZTAKI közleményében Farkas Richárdot, a Szegedi Tudományegyetem kutatóját.
A ma használatos természetes nyelveket feldolgozó rendszerek jellemzően tanuló algoritmusok alapján sajátítanak el összefüggéseket, predikciókat, és már nem nyelvészek írnak nyelvhasználati szabályokat. Ennek viszont az a hátránya, hogy működésük nem figyelhető meg, nem derül ki, hogy az adott eredményt miből kapták. Ebből következik, hogy csak korlátozottan használhatóak ipari alkalmazásokban, hiszen nem jól kontrollálhatók.
A közleményben arra is kitérnek, hogy a magyar szövegelemző szoftverek fejlesztése már korábban elkezdődött, ugyanis a magyar kutatói közösség már a kétezres években kezdte kiépíteni az ehhez szükséges nyelvi adatbázisokat. Ezt használták a HuSpaCy fejlesztői is. A rendszer képes mondatok teljes nyelvi elemzésére, mint például szótő, szófaj; de személyneveket, helységeket is tud a folyó szövegben azonosítani. A HuSpaCy a mai mesterséges intelligencia eszközökből építkezik, így alapja lehet hangalapú vagy írásos chatbotoknak, de szövegkategorizálásra, információ kinyerésére, szövegek automatikus generálására is alkalmas lehet.







