Alig egy hónappal a Grok nyílt forráskódúvá tétele után Elon Musk mesterséges intelligenciával (MI-vel) foglalkozó cége, az xAI bemutatta első multimodális modelljét, a Grok 1.5 Visiont, amellyel az OpenAI-val kíván versenyre kelni.
Az előzetes közlemény szerint az MI-modell a szövegértés mellett dokumentumokkal, grafikonokkal, diagramokkal, képernyőfotókkal és fényképekkel is képes dolgozni. Az OpenAI egyik finanszírozója, Musk amellett érvel, hogy a mesterséges intelligencia elképzelhetetlen módon segítheti az emberiséget. Miután azonban nem értett egyet az OpenAI stratégiájával, Musk tavaly megalapította az xAI-t, egy olyan befolyásos MI-kutatókból álló csoporttal, akiknek fontos, hogy az MI-modelleket nyíltabban fejlesszék.
Tavaly novemberben a vállalat bemutatta mesterségesintelligencia-modelljének első iterációját, a Grokot. Az elmúlt hónapban az alapmodell súlyainak és hálózati architektúrájának nyílt forráskódúvá tételével hangsúlyozta a nyitottságra való törekvését. Jól látható, hogy a vállalat milyen ütemben dolgozik: az első multimodális MI-modell alig egy hónappal az architektúra nyílt forráskódúvá tétele után érkezett meg.
Mit tud a Grok 1.5V?
Honlapja szerint a Grok 1.5V összeköti a fizikai és a digitális világot. A vállalat néhány példát kiemelt a képességeiből, hogy elmagyarázza, hogyan működik a multimodális modell:
- A felhasználó megoszthat egy folyamatábráról készült képet a Grokkal, és a mesterségesintelligencia-modell képes azt Python-kódra fordítani.
- Ha a felhasználó egyszerűen megmutat a modellnek egy tápérték-jelölést, akkor megkérdezheti, hogy hány kalóriát fogyasztana el a termék bizonyos adagjainak elfogyasztásával.
- A mesterségesintelligencia-modell képes egy gyermek rajzából egy egész esti mesét felépíteni.
- Mémek bemutatása után a modell elmagyarázza, miért vicces, és megadja a megértéséhez szükséges kontextust.
- Képes egy táblázatot CSV-formátumba konvertálni, vagy segít kijavítani egy esetleg nem működő kódot.
Az xAI egy új, „RealWorldQA” nevű benchmarkot is kiadott, amellyel a multimodális modellek által mutatott térbeli megértést értékeli. A vállalat által megosztott példák alapján a Grok 1.5V képes képeket nézni és megkülönböztetni az összehasonlíthatatlanul nagyobb tárgyakat, illetve vezetési tanácsokat is ad.
Grok 1.5V ezen a benchmarkon és más összehasonlító teszteken is szépen veri a többi MI-modellt a vállalat által megosztott adatok szerint, amelyeket ebben a táblázatban mutat be:
| Benchmark | Grok-1.5V | GPT-4V | Claude 3 Sonnet | Claude 3 Opus | Gemini Pro 1.5 |
| MMMU Multi-discipline |
53,6% | 56,8% | 53,1% | 59,4% | 58,5% |
| Mathvista Math |
52,8% | 49,9% | 47,9% | 50,5% | 52,1% |
| AI2D Diagrams |
88,3% | 78,2% | 88,7% | 88,1% | 80,3% |
| TextVQA Text reading |
78,1% | 78,0% | – | – | 73,5% |
| ChartQA Charts |
76,1% | 78,5% | 81,1% | 80,8% | 81,3% |
| DocVQA Documents |
85,6% | 88,4% | 89,5% | 89,3% | 86,5% |
| RealWorldQA Real-world understanding |
68,7% | 61,4% | 51,9% | 49,8% | 67,5% |
Mit tartogat a jövő?
Elon Musk egy nemrégiben adott interjúban kijelentette, hogy várakozásai szerint 2025 végére az MI okosabb lesz minden embernél, ezért minden szem arra szegeződik, hogy a következő hónapokban milyen fejlesztéseket mutat be a vállalat az MI-versenyben. Az xAI célja, hogy olyan hasznos mesterséges általános intelligenciát (AGI) hozzon létre, amely képes megérteni az univerzumot, ezért a következő hónapokban jelentős fejlesztéseket fog végrehajtani modelljeinek képességein más területeken, például a hang és a videó terén.
A Grok 1.5V hamarosan elérhetővé válik a cég tesztelői és a meglévő felhasználók számára – tette hozzá a vállalat a blogjában.
(forrás)







