Az OpenAI vezérigazgatója, Sam Altman bejelentette, hogy a ChatGPT képalkotási képessége több mint egy év elteltével komoly frissítésen esett át. A ChatGPT most már képes a GPT-4o modell segítségével natívan képeket és fotókat létrehozni, módosítani.
A GPT-4o régóta az MI-alapú chatbot platform alapját képezi, de eddig csak szöveget tudott generálni és szerkeszteni – képeket nem. A chatbot a képalkotás során hosszabban „gondolkodik”, mint az általa gyakorlatilag lecserélt DALL-E 3 modell, hogy pontosabb és részletgazdagabb képeket hozzon létre. A rendszer képes a feltöltött képek szerkesztésére is, beleértve az embereket ábrázoló fotókat – módosításokat végezhetünk rajtuk, vagy akár új elemeket is beilleszthetünk.
Az OpenAI a Wall Street Journal számára elmondta, hogy a GPT-4o-t egyrészt nyilvánosan elérhető adatokon, valamint olyan vállalatokkal kapcsolatos együttműködések során képezte, mint például a Shutterstock. Több generatív MI szolgáltató is versenyelőnyként tekint a tréningadatokra, ezért ezek részleteit titokban tartják. Ugyanakkor a tréningadatokkal kapcsolatos részletek potenciális szellemi tulajdonjogi perek forrását is jelenthetik, ami további ösztönzést ad arra, hogy a cégek titokban tartsák az adatokat.
Az OpenAI lehetőséget biztosít arra is, hogy a tartalomkészítők kérhessék műveik eltávolítását a tréningadatbázisból, valamint tiszteletben tartja azokat a kéréseket, amelyek megakadályozzák, hogy webes adatgyűjtő botjai gyűjtsenek adatokat a weboldalakról.
A frissítés a Google Gemini 2.0 Flash modelljének kísérleti, natív képalkotási funkciójának bejelentését követi, amely gyorsan elterjedt a közösségi médiában – bár nem feltétlenül a legjobb okokból. A Gemini 2.0 Flash képalkotó komponense ugyanis jelenleg kevés korlátozással rendelkezik, lehetővé téve például a vízjelek eltávolítását a fotókról, vagy a szerzői jogvédett karakterek ábrázolását is.







