Elon Musk és az xAI bemutatta a Grok 1.5 Visiont

[Forrás: xAI]
Alig egy hónappal a Grok nyílt forráskódúvá tétele után Elon Musk mesterséges intelligenciával (MI-vel) foglalkozó cége, az xAI bemutatta első multimodális modelljét, a Grok 1.5 Visiont, amellyel az OpenAI-val kíván versenyre kelni.

 

Az előzetes közlemény szerint az MI-modell a szövegértés mellett dokumentumokkal, grafikonokkal, diagramokkal, képernyőfotókkal és fényképekkel is képes dolgozni. Az OpenAI egyik finanszírozója, Musk amellett érvel, hogy a mesterséges intelligencia elképzelhetetlen módon segítheti az emberiséget. Miután azonban nem értett egyet az OpenAI stratégiájával, Musk tavaly megalapította az xAI-t, egy olyan befolyásos MI-kutatókból álló csoporttal, akiknek fontos, hogy az MI-modelleket nyíltabban fejlesszék.

Tavaly novemberben a vállalat bemutatta mesterségesintelligencia-modelljének első iterációját, a Grokot. Az elmúlt hónapban az alapmodell súlyainak és hálózati architektúrájának nyílt forráskódúvá tételével hangsúlyozta a nyitottságra való törekvését. Jól látható, hogy a vállalat milyen ütemben dolgozik: az első multimodális MI-modell alig egy hónappal az architektúra nyílt forráskódúvá tétele után érkezett meg.

Mit tud a Grok 1.5V?

Honlapja szerint a Grok 1.5V összeköti a fizikai és a digitális világot. A vállalat néhány példát kiemelt a képességeiből, hogy elmagyarázza, hogyan működik a multimodális modell:

  1. A felhasználó megoszthat egy folyamatábráról készült képet a Grokkal, és a mesterségesintelligencia-modell képes azt Python-kódra fordítani.
  2. Ha a felhasználó egyszerűen megmutat a modellnek egy tápérték-jelölést, akkor megkérdezheti, hogy hány kalóriát fogyasztana el a termék bizonyos adagjainak elfogyasztásával.
  3. A mesterségesintelligencia-modell képes egy gyermek rajzából egy egész esti mesét felépíteni.
  4. Mémek bemutatása után a modell elmagyarázza, miért vicces, és megadja a megértéséhez szükséges kontextust.
  5. Képes egy táblázatot CSV-formátumba konvertálni, vagy segít kijavítani egy esetleg nem működő kódot.

Az xAI egy új, „RealWorldQA” nevű benchmarkot is kiadott, amellyel a multimodális modellek által mutatott térbeli megértést értékeli. A vállalat által megosztott példák alapján a Grok 1.5V képes képeket nézni és megkülönböztetni az összehasonlíthatatlanul nagyobb tárgyakat, illetve vezetési tanácsokat is ad.

Grok 1.5V ezen a benchmarkon és más összehasonlító teszteken is szépen veri a többi MI-modellt a vállalat által megosztott adatok szerint, amelyeket ebben a táblázatban mutat be:

Benchmark Grok-1.5V GPT-4V Claude 3 Sonnet Claude 3 Opus Gemini Pro 1.5
MMMU
Multi-discipline
53,6% 56,8% 53,1% 59,4% 58,5%
Mathvista
Math
52,8% 49,9% 47,9% 50,5% 52,1%
AI2D
Diagrams
88,3% 78,2% 88,7% 88,1% 80,3%
TextVQA
Text reading
78,1% 78,0% 73,5%
ChartQA
Charts
76,1% 78,5% 81,1% 80,8% 81,3%
DocVQA
Documents
85,6% 88,4% 89,5% 89,3% 86,5%
RealWorldQA
Real-world understanding
68,7% 61,4% 51,9% 49,8% 67,5%
Mit tartogat a jövő?

Elon Musk egy nemrégiben adott interjúban kijelentette, hogy várakozásai szerint 2025 végére az MI okosabb lesz minden embernél, ezért minden szem arra szegeződik, hogy a következő hónapokban milyen fejlesztéseket mutat be a vállalat az MI-versenyben. Az xAI célja, hogy olyan hasznos mesterséges általános intelligenciát (AGI) hozzon létre, amely képes megérteni az univerzumot, ezért a következő hónapokban jelentős fejlesztéseket fog végrehajtani modelljeinek képességein más területeken, például a hang és a videó terén.

A Grok 1.5V hamarosan elérhetővé válik a cég tesztelői és a meglévő felhasználók számára – tette hozzá a vállalat a blogjában.

(forrás)

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top