A végtelenbe és tovább

2025-ben a mesterséges intelligencia látni fog, okosabb és pontosabb lesz, és elkezd számunkra megtenni különféle dolgokat. Ezt prognosztizálta 2024 végén a DeepMind-társalapító, jelenleg a Microsoft AI-t vezető Mustafa Suleyman. Előrejelzése az idei év három legnagyobb trendjével vált valóra: a modellek multimodálissá fejlődtek, a gondolatláncokkal megjelentek az érvelő modellek, és agentek végeznek helyettünk (és a nevünkben) összetett feladatokat.


◼︎ A mesterséges intelligencia elmúlt egy éve

Az év elején Sam Altman az általános AI egy-két éven belüli megjelenéséről beszélt, Mark Zuckerberg pedig az AGI-t (artificial general intelligence) követő fejlődési szintjének, a szuperintelligenciának a közeljövőben várható eljövetelét vetette fel. Egyelőre egyiknél sem tartunk, ezek a megnyilatkozások marketingfogások, és nem valós helyzetfelmérések voltak. Az AI elmúlt tizenkét hónapja prózaibbnak, de mégis eseménydúsnak bizonyult.

Multi- és omnimodalitás

Alig telt el hét úgy, hogy valamelyik nagy fejlesztő ne állt volna elő újabb AI-termékkel, vagy legalábbis annak tervével. A multimodalitás, mint hívószó szinte az összes bejelentésben elhangzott, és még Latin-Amerika is elkészítette első LLM-jét (Latam-GPT).

Az Nvidia még 2024 decemberében mutatta be a Fugattót, amely szöveges promptból zenét és audióanyagokat, új hangokat generál; célközönségként a zenekészítőket, a film- és videójáték-producereket nevezték meg. Elon Musk xAI-ja márciusban mutatta be a később a republikánus szavazókat kvázi lehülyéző Grok 3 családot. Eleinte szöveg inputra csak szöveg outputtal válaszolt, később audió ki- és bemeneti opcióval bővítették.

A ChatGPT az 5.0-s változatban képgenerátorral gyarapodott. Az új funkció fontos változás a korábbi modellekhez képest, a fejlesztők a GPT-4o-t „omnimodálisnak”, bármilyen fajta adatot, például szöveget, képet, hangot és videót generáló modellnek nevezik. A deep fake-ek elleni biztonságát megerősítették: megakadályozza a vízjelek eltávolítását, blokkolja a szexuális témájú kamuképeket.

A Google DeepMind Genie 3-ja sokak szerint újabb szintlépést jelentett: a modellel videójáték-szerű háromdimenziós interaktív világok generálhatók.

Érvelő modellek diadalmenete

Az USA-val az AI-elsőbbségért Donald Trump beiktatása óta a korábbinál is kíméletlenebbül versengő Kína legnagyobb dobása a januárban az amerikai csúcsmodelleket több teszten is maga mögé utasító, érvelő modell, a DeepSeek nyílt forráskódú R1 chatbotja volt – amelyet a hírek szerint az amerikai fejlesztések költségeinek töredékéből hoztak létre. A kelet-ázsiai szuperhatalom az érvelő modellel szemléltette, hogy a fejlődésnek nem a méretnövelés, irdatlan forráskapacitások igénybevétele az egyetlen útja. Más kínai AI-modellek szintén megközelítik, egyes területeken, például videógenerálásban meg is előzik már az amerikaiakat.

A Baidu márciusban jelentette be legújabb alapmodelljeit, a termék-ökoszisztémájukba fokozatosan integrálandó ERNIE 4.5-öt és a „mélygondolkodó” érvelő ERNIE XI-et. A 4.5 kivételes multimodális képességekkel és feljavított nyelvi készségekkel – megértéssel, szöveggenerálással, következtetéssel és memóriával rendelkezik. Az XI a megértésben, a tervezésben és a gondolkodásban kiemelkedően fejlett.

Energiahasználat, szabályozás és szerzői jogok

Az AI egyre „energiaéhesebb”, olyannyira, hogy már az atomenergia is opció. És szükség is lehet rá, mert a nagyok gigantikus adatközpont-terveket jelentettek be. Donald Trumppal megengedőbb lett az amerikai szabályozás, miközben Hollywood is beleállt a szerzői jogi polémiákba, az amerikai bírák pedig egyre dühösebbek a hallucináló AI-modellek miatt.

Az Alibaba májusban mutatta be a DeepSeek-modellek uralmát veszélyeztető Qwen3 család hosszú gondolatláncokon gyakoroltatott új tagjait. A termékcsalád a felhasználási területek széles skáláját célozza meg: kódolás, mérnöki tervezés, logikai következtetés, matematika, tudomány és technológia.

Közben a Csendes-óceán jobb partján sem tétlenkedtek: az AI-jal végzett érvelés és következtetés határait folyamatosan feszegető OpenAI nyár elején mutatta be o3-pro nevű érvelőmodelljét. Bár kicsit lassú, a modell különösen vonzó a többlépéses tudományos problémák megoldásán dolgozó fejlesztők számára. Az o4-mini gyorsabb, az o3-pro viszont jobban teljesít a komplex feladatokban.

Agentek az AGI felé vezető úton

A Kínából Szingapúrba költözött Butterfly Effect márciusban indult termékéről, a Manusról megjelenésekor az AI-fejlesztések fordulópontjaként beszélt a szakmai közvélemény. A modell  közvetlen és folyamatos emberi irányítás nélkül, agent módjára hajt végre komplex, a valós világban elvégzendő feladatokat, de ezen kívül kódot ír és honlapokat is készít. Már csak az a kérdés, beváltja-e a hozzá fűzött reményeket.

Kódoló gépek

A generatív modellek egyik legsikeresebb alkalmazási terület a kódolás. A természetes nyelvi promptokból kódot, webes szolgáltatásokat fejlesztő rendszereket kínáló startupok a befektetők kedvencei, de a befutott játékosok is egyre nagyobb figyelmet fordítanak erre a területre. A funkciók folyamatosan fejlődnek, a kódolás mellett a tesztelés és az architektúraépítés is megjelenik a palettán.

A Tsinghua Egyetem és a ByteDance UI-TARS modellje érvelés alapján dönt, hogyan kattintson az egérrel, mit nyomjon a klaviatúrán, miként sajátítson el más cselekvéseket asztali és mobilalkalmazások használatához.

A Claude 3.7 Sonnet chatbottal remeklő Anthropic még tavaly októberben vezetett be az utasításokat cselekvéssé alakító agentet. Csak annyit kell neki mondani, hogy „töltsd ki helyettem ezt az űrlapot”, mire a modell a kurzort mozgatva megnyitja a webböngészőt, és addig navigál, míg meg nem találja a releváns oldalakat, ahol valóban kitölti az űrlapot. Azóta a Salesforce és az OpenAI szintén bemutatott hasonló agentet.

A Google AI Co-scientistje (társtudósa) pedig általános multiagent-rendszer, kimondottan kutatóknak. Több rétegű kutatási javaslatokat generál a felhasználó által meghatározott kereteken belül. A fejlesztők gyógyszerek újrahasznosításáról, farmakológiai trendek azonosításáról és antimikrobiális ellenállásról készíttettek javaslatokat vele.

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top