Európa digitális szuverenitásának új fejezete kezdődött az OpenEuroLLM projekttel, amelynek célja nyílt forráskódú nagy nyelvi modellek (LLM) fejlesztése az Európai Unió összes hivatalos nyelvén. A kezdeményezés az EU 24 hivatalos nyelve mellett olyan országok nyelveit is lefedi, amelyek jelenleg csatlakozási tárgyalásokat folytatnak, mint például Albánia.
Az OpenEuroLLM projektben mintegy 20 szervezet vesz részt, a vezető szerepet Jan Hajič, a prágai Károly Egyetem nyelvészeti informatikusa, valamint Peter Sarlin, a finn Silo MI cég vezérigazgatója tölti be. A program az Európa digitális szuverenitását erősítő intézkedések sorába illeszkedik, amelynek része az adatok lokális tárolását szorgalmazó szabályozások, valamint az MI-infrastruktúra európai kézben tartása. Ezt támasztja alá az a 11 milliárd dolláros megállapodás is, amelynek keretében az EU egy saját műhold-konstellációt hoz létre a Starlink alternatívájaként.
Szilárd alapokra építve
A projekt költségvetése 37,4 millió euró, amelyből 20 millió eurót az EU Digitális Európa Programja biztosít. Az OpenEuroLLM számítási kapacitását a EuroHPC szuperszámítógép-központok (Spanyolország, Olaszország, Finnország, Hollandia) biztosítják, melyek teljes költségvetése 7 milliárd euró.
Bár a projekt ígéretes, a szakmai közösség körében akadnak kétségek a sikerességét illetően. Anastasia Stasenko, a Pleias MI-vállalat társalapítója szerint a kis, fókuszált csapatok, mint a francia Mistral AI vagy a LightOn, sokkal hatékonyabban tudják irányítani a fejlesztéseket. A nagy konzorciumok, mint az OpenEuroLLM, lassabb döntéshozatali folyamattal kénytelenek szembenézni.
A projekt azonban nem teljesen nulláról indul: az elmúlt években már zajlott a High Performance Language Technologies (HPLT) program, amely jelentős mértékben hozzájárult az MI adatkészletek és nyelvi modellek fejlesztéséhez. Az OpenEuroLLM erre építve gyorsabban haladhat a célja felé. A tervek szerint az első nyelvi modellek 2026 közepére, a végleges verziók pedig 2028-ra várhatók.
Nem unikornis
A projekt egyik legfontosabb kihívása az adatok kezelése. Az OpenEuroLLM a nyílt forráskódú MI-modellfejlesztés módszertanát követi, azonban az adathasználatot szigorú jogszabályok szabályozzák, külső források (pl. Common Crawl) igénybevételével. Az EU AI-törvényének megfelelésen a nem teljesen nyilvános adathalmazokat ellenőrzés céljából elérhetővé kell tenni.
A kezdeményezés egy másik hasonló európai projekttel, az EuroLLM-mel is versenyez, amely 2023 óta fejleszt nyelvi modelleket az EU 24 hivatalos nyelvén. A két projekt hasonló célokat követ, ami felveti az összehangolás lehetőségét.
Az OpenEuroLLM egy általános célú nyelvi modellt kínál a piac számára, amely az EU digitális szuverenitásának megerősítése szempontjából kulcsfontosságú kezdeményezés lehet. A projekt nem csupán egy technológiai fejlesztés, hanem egy hosszútávú stratégiai befektetés Európa digitális függetlenségébe.







