Hollywood otthon – Sora videót generál szövegből

Az Open AI a DALL-E 3 és a ChatGPT révén már rendelkezik piacvezető MI-modellekkel a kép- és szöveggenerálás terén. A vállalat a szöveg-videó generálás területén is bemutatott egy vadonatúj modellt, Sora-t.

 

A „Sora” nevű szöveg-videó modell, akár egyperces videókat is képes létrehozni lenyűgöző minőségben és részletességgel:

„Bemutatjuk a Sora-t, a szövegből videót készítő modellünket. A Sora akár 60 másodperces videókat is képes létrehozni, rendkívül részletes jelenetekkel, összetett kameramozgással és több, élénk érzelmekkel rendelkező karakterrel. Prompt: egy elegáns nő sétál egy meleg izzó neonokkal és animált városi feliratokkal teli tokiói utcán. Fekete bőrdzsekit, hosszú piros ruhát és fekete csizmát visel, és fekete táskát tart magánál. Napszemüveget és piros rúzst visel. Magabiztosan és lazán sétál. Az utca párás és tükröződik, tükörhatást keltve a színes fényeken. Sok gyalogos sétál.”

A Sora az OpenAI szerint képes megbirkózni az összetett jelenetekkel, beleértve több karaktert, különleges típusú mozgást. A különböző demóvideók megtekintése alapján látható, hogy az OpenAI-nak sikerült megoldania két nagy problémát a videókészítés területén: a folyamatosságot és a hosszú élettartamot. Az MI által generált videók gyakran szaggatottak és torzak, így a nézők számára egyértelművé válik, hol végződik és hol kezdődik egy-egy képkocka, mint például a Runaway AI márciusban bemutatott, legfejlettebb szövegből videót készítő modellje, a Gen-2 esetében.

Az OpenAI szerint a Sora egy olyan diffúziós modell, amely a GPT modellekhez hasonló transzformátor-architektúrával, valamint a DALL-E és a GPT modellek korábbi kutatásainak felhasználásával képes kiváló minőségű kimenetet produkálni. Amellett, hogy a Sora képes videót generálni szövegből, képes videót generálni állóképből, vagy kitölteni a hiányzó képkockákat videókból.

A modell először a vörös csapat tagjai számára válik elérhetővé, hogy felmérjék annak kockázatait, majd egy kiválasztott számú alkotó – például vizuális művészek, tervezők és filmkészítők – számára, hogy visszajelzést gyűjtsenek, hogyan lehetne a modellt az igényeiknek megfelelően fejleszteni.

Úgy tűnik, hogy egy új korszakba lépünk, amelyben a vállalatok a kutatásra, a fejlesztésre és az MI szöveg-képgenerátorok piacra dobására helyezik a hangsúlyt. Alig két hete a Google Research közzétett egy kutatási tanulmányt a Lumiere-ről, egy olyan szöveg-videó diffúziós modellről, amely rendkívül valósághű videókat is képes létrehozni.

(forrás)

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top