A Google a rivális OpenAI GPT-4-re adott válaszát készül piacra dobni: ez lesz a Gemini: egy új generációs MI-modell, és még az idén megjelenik. Multimodális lesz (felismeri a szöveget a képeken, megérti a kimondott szavakat stb.) amelyen a Google most egyesített MI-részlegeiből, a DeepMindből és a Google Brainből kivált kutatócsoport dolgozik.
A modellt a természetes nyelvfeldolgozás jelentős előrelépésként reklámozzák. A Google várhatóan valamikor az év folyamán fogja kiadni a modellt. A közelgő megjelenést a technológiai világ nagy figyelemmel kíséri, és sokan találgatják, hogy a modell képes-e felülmúlni fő versenytársát, az OpenAI nagy nyelvi modelljét, a GPT-4-et.
Egy elemzés, amely a Google mesterséges intelligenciájának a GPT-4-gyel szembeni elsőbbségéről tett korai nyilatkozatot, heves online vitát váltott ki, amely még az OpenAI vezérigazgatóját, Sam Altmant is megszólította:
incredible google got that semianalysis guy to publish their internal marketing/recruiting chart lol
— Sam Altman (@sama) August 29, 2023
A Gemini „multimodális”
A modell várhatóan képes lesz a képek és a szöveg feldolgozására, lehetővé téve olyan funkciókat, mint például a vizuális grafikonok írásbeli elemzése. A technológiai óriáscég a technológia kódgeneráló képességével megpróbálja felvenni a versenyt a Microsoft GitHub Copilotjával, amelyet az OpenAI hajt. A Google egy blogbejegyzésben azt írta, hogy a tesztelés és a finomhangolás befejezése után a modell különböző méretekben és képességekkel lesz elérhető.
Az AlphaGo ihlette
A Gemini adós az AlphaGo-nak, amelyet a Google DeepMind fejlesztett ki, és amely az első olyan számítógépes program lett, amely legyőzött egy profi emberi Go játékost. (A mesterséges intelligencia történelmet írt még 2016-ban, amikor az AlphaGo legyőzte Lee Sedolt, a világ egyik legnagyobb Go játékosát.) Az AlphaGo-ban használt technikákat kombinálnák a ChatGPT-t működtető technológiával, mondta Demis Hassabis, a DeepMind. „Magas szinten úgy gondolhatunk a Geminire, mint amely egyesíti az AlphaGo típusú rendszerek néhány erősségét a nagy modellek elképesztő nyelvi képességeivel”, mondta.
Korai változatok
A Google olyan közel áll a Gemini bevezetéséhez, hogy már bemutatták a modell korai verzióját a vállalatok egy kis csoportjának. Az egyik tesztelő úgy nyilatkozott, hogy előnyben lehet a GPT-4-gyel szemben, mivel a Google fogyasztói termékekből származó adatait, valamint az internetről gyűjtött információkat használja fel. Azt is elmondta, hogy a modell láthatóan kevesebb hibás választ generált, kevesebbet „hallucinált”.
A SemiAnalysis blog mögött álló kutatók azt is megjósolták, hogy a Google Gemini valószínűleg felülmúlja majd a GPT-4-et, mivel a Google hozzáfér a csúcsminőségű chipekhez.







