Bemutatták a Kosmos-1-et a Microsoft kutatói. A szakemberek elmondása szerint a multimodális modell képes a képek tartalmi elemzésére, vizuális rejtvények megoldására, vizuális szövegfelismerésre, vizuális IQ-tesztek elvégzésére, valamint természetes nyelvi utasítások megértésére.
A multimodális mesterséges intelligencia – amely különböző bemeneti módokat, például szöveget, hangot, képet és videót integrál – kulcsfontosságú lépés az általános mesterséges intelligencia (AGI) megalkotásához: az AGI ugyanis képes lehet különböző általános feladatokat az emberi szinthez hasonlóan elvégezni. A Kosmos-1 tanulmányban szereplő példák pedig azt mutatják, hogy az általuk fejlesztett modell képes képeket elemezni, kérdésekre válaszolni, szöveget olvasni képről, képfeliratokat írni képekhez, és 22-27 százalékos pontossággal végez vizuális IQ-teszteket is.
Miközben a sajtó a nagy nyelvi modellektől hangos, az AI szakértők úgy vélik, a multimodális AI lesz a kulcsa egy olyan technológia létrejöttének, amely helyettesítheti az embert bármilyen szellemi feladatban. A Microsoft kutatói pedig „egy multimodális nagy nyelvi modellnek (MLLM)” nevezik alkotásukat, mivel gyökerei a természetes nyelvi feldolgozásban rejlenek, akárcsak a tisztán szöveg alapú LLM-nek, amilyen például a ChatGPT is. Ennek értelmében ahhoz, hogy a Kosmos-1 elfogadja a képi bemenetet, a kutatóknak először le kell fordítaniuk a képet egy speciális token-sorozattá (lényegében szöveggé), amelyet majd az LLM megért.
A cég a jövőbeli optimalizálástól még ennél is jelentősebb eredményeket vár és azt sem tartják kizártnak, hogy elérhetővé teszik a fejlesztők számára. Eközben a Microsoft az emberek által adott egyszerű parancsokból hozott létre kódokat robotkarok és quadcopter drónok számára a ChatGPT segítségével. De a tudósok arra hívják fel a figyelmet, hogy az ilyen eszközök mesterséges intelligencia általi irányítása még túl kockázatos.







