2025-ben a mesterséges intelligencia látni fog, okosabb és pontosabb lesz, és elkezd számunkra megtenni különféle dolgokat. Ezt prognosztizálta 2024 végén a DeepMind-társalapító, jelenleg a Microsoft AI-t vezető Mustafa Suleyman. Előrejelzése az idei év három legnagyobb trendjével vált valóra: a modellek multimodálissá fejlődtek, a gondolatláncokkal megjelentek az érvelő modellek, és agentek végeznek helyettünk (és a nevünkben) összetett feladatokat.
◼︎ A mesterséges intelligencia elmúlt egy éve
Az év elején Sam Altman az általános AI egy-két éven belüli megjelenéséről beszélt, Mark Zuckerberg pedig az AGI-t (artificial general intelligence) követő fejlődési szintjének, a szuperintelligenciának a közeljövőben várható eljövetelét vetette fel. Egyelőre egyiknél sem tartunk, ezek a megnyilatkozások marketingfogások, és nem valós helyzetfelmérések voltak. Az AI elmúlt tizenkét hónapja prózaibbnak, de mégis eseménydúsnak bizonyult.
Multi- és omnimodalitás
Alig telt el hét úgy, hogy valamelyik nagy fejlesztő ne állt volna elő újabb AI-termékkel, vagy legalábbis annak tervével. A multimodalitás, mint hívószó szinte az összes bejelentésben elhangzott, és még Latin-Amerika is elkészítette első LLM-jét (Latam-GPT).
Az Nvidia még 2024 decemberében mutatta be a Fugattót, amely szöveges promptból zenét és audióanyagokat, új hangokat generál; célközönségként a zenekészítőket, a film- és videójáték-producereket nevezték meg. Elon Musk xAI-ja márciusban mutatta be a később a republikánus szavazókat kvázi lehülyéző Grok 3 családot. Eleinte szöveg inputra csak szöveg outputtal válaszolt, később audió ki- és bemeneti opcióval bővítették.
A ChatGPT az 5.0-s változatban képgenerátorral gyarapodott. Az új funkció fontos változás a korábbi modellekhez képest, a fejlesztők a GPT-4o-t „omnimodálisnak”, bármilyen fajta adatot, például szöveget, képet, hangot és videót generáló modellnek nevezik. A deep fake-ek elleni biztonságát megerősítették: megakadályozza a vízjelek eltávolítását, blokkolja a szexuális témájú kamuképeket.
A Google DeepMind Genie 3-ja sokak szerint újabb szintlépést jelentett: a modellel videójáték-szerű háromdimenziós interaktív világok generálhatók.
Érvelő modellek diadalmenete
Az USA-val az AI-elsőbbségért Donald Trump beiktatása óta a korábbinál is kíméletlenebbül versengő Kína legnagyobb dobása a januárban az amerikai csúcsmodelleket több teszten is maga mögé utasító, érvelő modell, a DeepSeek nyílt forráskódú R1 chatbotja volt – amelyet a hírek szerint az amerikai fejlesztések költségeinek töredékéből hoztak létre. A kelet-ázsiai szuperhatalom az érvelő modellel szemléltette, hogy a fejlődésnek nem a méretnövelés, irdatlan forráskapacitások igénybevétele az egyetlen útja. Más kínai AI-modellek szintén megközelítik, egyes területeken, például videógenerálásban meg is előzik már az amerikaiakat.
A Baidu márciusban jelentette be legújabb alapmodelljeit, a termék-ökoszisztémájukba fokozatosan integrálandó ERNIE 4.5-öt és a „mélygondolkodó” érvelő ERNIE XI-et. A 4.5 kivételes multimodális képességekkel és feljavított nyelvi készségekkel – megértéssel, szöveggenerálással, következtetéssel és memóriával rendelkezik. Az XI a megértésben, a tervezésben és a gondolkodásban kiemelkedően fejlett.
| Energiahasználat, szabályozás és szerzői jogok
Az AI egyre „energiaéhesebb”, olyannyira, hogy már az atomenergia is opció. És szükség is lehet rá, mert a nagyok gigantikus adatközpont-terveket jelentettek be. Donald Trumppal megengedőbb lett az amerikai szabályozás, miközben Hollywood is beleállt a szerzői jogi polémiákba, az amerikai bírák pedig egyre dühösebbek a hallucináló AI-modellek miatt. |
Az Alibaba májusban mutatta be a DeepSeek-modellek uralmát veszélyeztető Qwen3 család hosszú gondolatláncokon gyakoroltatott új tagjait. A termékcsalád a felhasználási területek széles skáláját célozza meg: kódolás, mérnöki tervezés, logikai következtetés, matematika, tudomány és technológia.
Közben a Csendes-óceán jobb partján sem tétlenkedtek: az AI-jal végzett érvelés és következtetés határait folyamatosan feszegető OpenAI nyár elején mutatta be o3-pro nevű érvelőmodelljét. Bár kicsit lassú, a modell különösen vonzó a többlépéses tudományos problémák megoldásán dolgozó fejlesztők számára. Az o4-mini gyorsabb, az o3-pro viszont jobban teljesít a komplex feladatokban.
Agentek az AGI felé vezető úton
A Kínából Szingapúrba költözött Butterfly Effect márciusban indult termékéről, a Manusról megjelenésekor az AI-fejlesztések fordulópontjaként beszélt a szakmai közvélemény. A modell közvetlen és folyamatos emberi irányítás nélkül, agent módjára hajt végre komplex, a valós világban elvégzendő feladatokat, de ezen kívül kódot ír és honlapokat is készít. Már csak az a kérdés, beváltja-e a hozzá fűzött reményeket.
| Kódoló gépek
A generatív modellek egyik legsikeresebb alkalmazási terület a kódolás. A természetes nyelvi promptokból kódot, webes szolgáltatásokat fejlesztő rendszereket kínáló startupok a befektetők kedvencei, de a befutott játékosok is egyre nagyobb figyelmet fordítanak erre a területre. A funkciók folyamatosan fejlődnek, a kódolás mellett a tesztelés és az architektúraépítés is megjelenik a palettán. |
A Tsinghua Egyetem és a ByteDance UI-TARS modellje érvelés alapján dönt, hogyan kattintson az egérrel, mit nyomjon a klaviatúrán, miként sajátítson el más cselekvéseket asztali és mobilalkalmazások használatához.
A Claude 3.7 Sonnet chatbottal remeklő Anthropic még tavaly októberben vezetett be az utasításokat cselekvéssé alakító agentet. Csak annyit kell neki mondani, hogy „töltsd ki helyettem ezt az űrlapot”, mire a modell a kurzort mozgatva megnyitja a webböngészőt, és addig navigál, míg meg nem találja a releváns oldalakat, ahol valóban kitölti az űrlapot. Azóta a Salesforce és az OpenAI szintén bemutatott hasonló agentet.
A Google AI Co-scientistje (társtudósa) pedig általános multiagent-rendszer, kimondottan kutatóknak. Több rétegű kutatási javaslatokat generál a felhasználó által meghatározott kereteken belül. A fejlesztők gyógyszerek újrahasznosításáról, farmakológiai trendek azonosításáról és antimikrobiális ellenállásról készíttettek javaslatokat vele.







