Elon Musk xAI nevű vállalata bemutatta legújabb mesterségesintelligencia-modelljét, a Grok 3-at, valamint frissítéseket adott ki a Grok iOS és webalkalmazásokhoz. A Grok az xAI válasza az olyan fejlett modellekre, mint az OpenAI GPT-4o és a Google Gemini. Az MI képes képeket elemezni és kérdésekre válaszolni, valamint Musk közösségi hálózatán, az X-en is több funkciót támogat. Bár a Grok 3 fejlesztése hónapok óta zajlott, a 2024-re tervezett megjelenés végül csúszott, és csak most vált elérhetővé.
A Grok 3 fejlesztése során az xAI egy hatalmas, 200 ezer GPU-ból álló memphisi adatközpontot használt. Musk szerint az új modell tízszer több számítási teljesítménnyel készült, mint elődje, a Grok 2, és a kibővített tanítási adatkészlet olyan forrásokat is tartalmaz, mint például bírósági beadványok.
A Grok 3 több változatban érhető el: a kisebb Grok 3 mini gyorsabb válaszokat ad, de némi pontosságot feláldoz ennek érdekében. Az xAI állítása szerint a Grok 3 több mesterséges intelligencia benchmark teszten is felülmúlta az OpenAI GPT-4o modelljét, például a matematikai teljesítményt mérő AIME és a doktori szintű tudományos kérdéseket vizsgáló GPQA teszteken.
Új „gondolkodási” módok
Az érvelő modellek a Grok alkalmazásban érhetők el, ahol a felhasználók kérhetik a „Think” módot az alaposabb válaszokhoz, míg a „Big Brain” mód még több számítási erőforrást használ a bonyolultabb kérdések megoldásához. Az új modellek különösen hasznosak matematikai, tudományos és programozási feladatokhoz.
Az xAI új kutatási funkciót is bevezetett: a DeepSearch az internet és az X tartalmait elemzi, hogy összefoglalókat készítsen adott témákban. Ezt a funkciót a X Premium+ előfizetők (havi 50 dollár) érhetik el elsőként, míg a még fejlettebb SuperGrok csomag (havi 30 vagy éves 300 dollár) extra érvelési képességeket és korlátlan képgenerálási lehetőséget biztosít.
Politikailag bizonytalan?
A Grok eredetileg egy nyílt, politikailag semleges MI-ként lett beharangozva, amely képes olyan kérdésekre is válaszolni, amelyeket más modellek elkerülnek, azonban a korábbi Grok modellek még politikailag egyoldalú válaszokat adtak bizonyos kérdésekben. Musk szerint ez a nyilvános internetes adatforrások hatása, és céljuk, hogy a Grok politikailag semlegesebb legyen. Egyelőre nem világos, hogy ez mennyire sikerült, és milyen hatással lesz a modell működésére.
Andrej Karpathy tesztje
A Tesla korábbi MI-, és autopilot igazgatója, valamint az OpenAI egykori társalapítója, Andrej Karpathy tesztelte az MI-modellt. Megállapította, hogy a Grok 3 erős gondolkodási képességekkel rendelkezik, különösen a „Think” mód bekapcsolásával. Kiválóan teljesített összetett programozási és matematikai feladatokban, például egy Catan társasjátékhoz kapcsolódó HTML-oldal generálásában és a GPT-2 tréningflopok becslésében. Ugyanakkor megbukott a Unicode-alapú rejtvényeken és trükkös amőba táblák generálásán.
A Grok 3 új keresőfunkciója, a DeepSearch, jól teljesítette az aktuális hírek és keresési lekérdezések feldolgozását, de előfordultak hibák, például kitalált URL-ek generálása és valótlan információk közlése. A modell néhány „becsapós” teszten is jól szerepelt, de humorérzéke és vizuális képességei nem kiemelkedőek – tette hozzá.
Mint elmondta, összességében a Grok 3 a csúcskategóriás modellek között van, teljesítménye az OpenAI o1-pro szintjéhez közelít, és megelőzi a DeepSeek-R1-et. Bár még van hova fejlődnie, különösen a kreativitás és megbízhatóság terén, az xAI csapat rendkívül gyors fejlődést mutatott, és a Grok 3 komoly versenytársnak számít a generatív MI-k piacán.









