Ha valaki úgy érezte, hogy 2024-ben a csapból is a mesterséges intelligencia folyt, jól érezte. Zajlott az élet a technológia körül: a generatív MI-rendszerek forradalmasították a kreatív iparágakat, miközben etikai és biztonsági kérdéseket vetettek fel. Hatásai alól nem vonhatta ki magát az energiaszektor, az egészségügy, a gyógyszeripar vagy az oktatás sem. Szigorodott a szabályozás, és a munkaerőpiac is aggódva figyeli a fejleményeket. Alábbi cikkünkben megpróbáltuk összefoglalni mindazon jelentős eseményeket, amelyek az idei évben meghatározták a technológiát.
◼︎ Mozgalmas év a mesterséges intelligencia világában
Kezdjük is egy olyan kérdéssel, amely nem kimondottan a technológiával kapcsolatos, de mindenképpen nagy hatással lesz rá: ez pedig az Európai Unió mesterséges intelligenciáról szóló rendelete, az AI Act, amely idén lépett hatályba. Ez a világ első, az MI-rendszerekre vonatkozó átfogó szabályozása. Célja az MI biztonságos és megbízható fejlesztésének előmozdítása az EU egységes piacán az uniós polgárok alapvető jogainak tiszteletben tartásával.
Ehhez kockázatalapú megközelítést alkalmaz. A magas kockázatú rendszereknek szigorú követelményeknek kell megfelelniük, míg az elfogadhatatlan kockázatú alkalmazások, például a társadalmi pontozás és bizonyos biometrikus rendszerek, kimondottan tiltottak. A rendelet kiterjed az általános célú MI-modellekre is, különbséget téve a rendszerszintű kockázatot jelentő és kevésbé kockázatos modellek között. Az előbbi kategóriába esők szigorú szabályozás alá esnek, míg az utóbbiakra kevésbé korlátozó követelmények vonatkoznak.
A végrehajtás érdekében új irányítási struktúrát hoztak létre, beleértve egy MI-hivatalt, egy tudományos testületet és a tagállamokat képviselő, mesterséges intelligenciával foglalkozó európai testületet. A jogsértések esetén kiszabható szankciók az érintett vállalat globális árbevételén alapulnak. A rendelet a megalkotói szerint innovációbarát keretet biztosít, lehetővé téve az MI-rendszerek tesztelését valós környezetben, valamint ösztönözve a szabályozói tanulást és a technológiai fejlődést. Számos iparági szereplő ugyanakkor annak a véleményének adott hangot, hogy a szabályozás tovább hátráltatja az európai innovációt az MI terén, növelve a kontinens amúgy sem csekély lemaradását az Egyesült Államok és Kína mögött.
Modellek csatája
A 2024-es LLM-ek új mércét állítottak fel a természetes nyelvfeldolgozás és az MI általános képességeit tekintve. Ezek a modellek nemcsak nagyobb teljesítményt és rugalmasságot kínálnak, hanem új alkalmazási területeket is megnyitottak, például a multimodális tartalomgenerálásban és a valós idejű adatfeldolgozásban. Ugyanakkor az etikai és biztonsági szempontok kiemelt figyelmet kapnak, biztosítva, hogy ezek az innovációk felelősen kerüljenek alkalmazásra.
Gemini 1.5 Pro (Google)
A Google 2024. februárjában mutatta be a Gemini 1.5 Pro modellt, amely multimodális képességeivel (szöveg, kép, hang, videó feldolgozásával) és akár 2 millió tokenes kontextusablakkal emelkedik ki. Architektúrája különösen fordításban, kódolásban és érvelésben nyújt kiemelkedőt. A modell integrálható a Google-szolgáltatásokba (a Gmailbe és YouTube Musicba), valamint fejlesztők számára elérhető a Google AI Studio-n és API-kon keresztül. Ideális nagy mennyiségű adat feldolgozására és sokrétű alkalmazásokra.
Claude 3 (Anthropic)
Idén márciusban jelent meg az Anthropic Claude 3 modellje. Ennek különböző változatai (Opus, Sonnet, Haiku) kimagasló képességeket mutatnak a természetes nyelvfeldolgozásban, a többnyelv-támogatásban és a vizuális adatok értelmezésében. A 200 ezer tokenes kontextusablak lehetővé teszi a hosszabb és komplexebb inputok kezelését, és a méréseken is kiemelkedő teljesítményt nyújtott. Fejlesztője külön figyelmet fordított a biztonságra és az etikára.
GPT-4o (OpenAI)
A ChatGPT-vel az egész generatív MI-őrületet elindító OpenAI májusban jelentette be, hogy „GPT-4o” („o”, mint „omni”) néven új MI-modellt ad ki. Képes valósághű hangalapú beszélgetésre, valamint szöveges és képi interakcióra, tud képeket tartalmazó szöveggel, képekkel, hanggal és videóval dolgozni. Gyors válaszidő és nagy kontextusablak (128,000 token) jellemzi, amelyet különösen költséghatékony API-hozzáféréssel kombináltak.
Llama 3.1 (Meta)
A Meta 2024. júliusában mutatta be a Llama 3.1 modellcsaládot, amely három méretben (8, 70 és 405 milliárd paraméterrel) érhető el. A modellek kiemelkednek a hosszú szövegek kezelésében, és akár 128,000 tokenes kontextusablakkal is elérhetők. Többnyelvű támogatást nyújtanak, nyílt forráskódú jellegük révén pedig könnyen integrálhatók különböző alkalmazásokba. A 405 milliárd paraméteres változat különösen erős versenytársa a zárt forráskódú modelleknek.
Grok-2 (xAI)
Elon Musk cége, az xAI augusztusban tette elérhetővé a Grok-2 modellt, amely valós idejű információfeldolgozásra, képfeldolgozásra és képgenerálásra is képes. A Grok-2 teljesítménye több benchmarkban is felülmúlta a versenytársakat, például a Claude 3.5 Sonnet és a GPT-4-Turbo modelleket. Szakértők szerint a modell sokoldalú, intuitív és hatékony megoldás olyan feladatokhoz, mint a szöveggenerálás, kódolás és kreatív tartalomkészítés.
GPT o1-mini és GPT o1-preview (OpenAI)
Az OpenAI 2024. szeptemberében mutatta be az o1-mini modellt, amelyet kifejezetten a STEM területekre, például matematikai és kódolási feladatokra optimalizáltak. A modell 80 százalékkal olcsóbb és gyorsabb az o1-preview-nél, továbbá kiemelkedő eredményeket ért el teszteken. Az o1-mini elsősorban specifikus feladatokra alkalmas, korlátozott világismerettel. Vele egy időben jelent meg az o1-preview, amelyet a bonyolult problémák megoldására terveztek, lehetővé téve, hogy a válaszadás előtt alaposabban átgondolja a feladatokat. Ez a megközelítés különösen hatékony a tudományos, programozási és matematikai feladatokban.
QwQ-32B-Preview (Alibaba)
Az Alibaba Qwen csapata novemberben állt elő a QwQ-32B-Preview modellel, amely 32,5 milliárd paraméterrel rendelkezik, és akár 32 ezer szavas bemeneteket is képes kezelni. A modell célja a mesterséges intelligencia érvelési képességeinek fejlesztése, különösen a matematikai és programozási feladatok terén. A QwQ-32B-Preview nyílt forráskódú, Apache 2.0 licenc alatt szabadon elérhető a kutatók és fejlesztők számára.
Pixtral Large (Mistral)
A 2023-ban alapított francia mesterséges intelligencia vállalat, a Mistral AI, novemberben mutatta be a Mistral Large 2-re épített Pixtral Large-t. A 124 milliárd paraméteres, nyílt forráskódú multimodális modell kiemelkedő szöveg- és képfeldolgozási képességekkel rendelkezik. Dokumentumok, grafikonok és természetes képek értelmezésében vezető teljesítményt nyújt, meghaladva például a GPT-4o és a Gemini-1.5 Pro eredményeit. 128 ezer karakteres kontextusablakával akár 30 nagy felbontású kép feldolgozására is képes egyidejűleg.
MI a zsebekben
Az idei év egyik komoly fejleménye volt, hogy a generatív mesterséges intelligencia és az azzal támogatott intelligens asszisztensek a számítógépek után megjelentek a mobil eszközökben is. Gyakorlatilag az összes nagy gyártó előállt saját mobilos MI-fejlesztéseivel.
A Samsung nemcsak a friss, Galaxy S24 szériában, hanem szoftverfrissítéssel más (Galaxy S23, Z Fold 5, Z Flip 5, Tab S9) modelljeiben is elérhetővé tett számos MI-funkciót. Közvetlenül a készüléken van lehetőség képek generálására és szerkesztésére, de az alkalmazások között szerepelt szövegek írása, hosszabb szövegek összegzése és a hívás közbeni valós idejű fordítás is. Saját nagy nyelvi modell került a Bixby digitális asszisztensbe is.
Nem maradhatott ki a versenyből az Apple sem. Az iPhone 16 modellekben az új A18 és A18 Pro chipek 16 magos neurális motorja jelentősen javítja az MI-funkciók teljesítményét. Az Apple Intelligence platform további funkciói között van a képek valós idejű elemzése és objektumok azonosítása. Az MI támogatja a képek hatékonyabb keresését és szerkesztését, illetve szöveges jegyzetek és üzenetek írását is.
Chipgyártók a hullámvasúton
Miközben a világ eleinte az újabb és újabb nagy nyelvi modellek képességeinek fejlődésére figyelt, szép lassan kiderült, hogy a szűk keresztmetszetet a hardver, elsősorban az MI-modellek tanításához és futtatásához szükséges chipek jelentik. A hiány egyértelmű győztese az Nvidia lett, amelynek értéke a grafikus lapkák iránti csillapíthatatlan kereslet hatására soha nem látott magasságokba szárnyalt. Piaci kapitalizációja egy időre elérte a 3,3 ezermilliárd dollárt, a világ legértékesebb tőzsdei vállalatává téve az Nvidiát, de bevétele és nyeresége is rekordokat döntöget. Csak a Meta egyedül 340 ezer H100 GPU-t vásárolt idén, de már a 2025-ös gyártási kapacitást is teljesen lekötötték.
A mobilpiacon a Qualcomm tűnik a befutónak. Snapdragon 8 Elite nevű processzora a saját ítélete szerint a világ leggyorsabb mobil rendszerchipje, amely kifejezetten az MI-alkalmazások hatékony futtatására készült. A Snapdragon 8 Elite 3 nanométeres gyártási technológiával készült, hasonlóan az Apple A18 Pro chipjéhez.
Nem sikerült viszont felkapaszkodnia a száguldó MI-vonatra az Intelnek. A vállalat az év elején mutatta be a Gaudi3 MI-chipet, amelyet az Nvidia és az AMD hasonló termékei vetélytársának szántak, félmilliárd dolláros értékesítési volumennel. Ez azonban messze nem sikerült, és csak részben gyógyír a vállalat számára, hogy egyedi MI-chipeket gyártanak az Amazon Web Services számára. Az Intel új Lunar Lake processzorai integrált neurális feldolgozóegységgel (NPU) rendelkeznek, elősegítve az MI-alkalmazások hatékonyabb futtatását a helyi eszközökön.
Az LLM-ek összehasonlítása
Forrás: mistral.ai |








