A Google videó-audió eszköze pixelekből állít elő zenét

[Forrás: Midjourney - Justin Viktor]
Ha láttunk már MI generálta videóklipeket – például az OpenAI Sorától – észrevehettük, hogy vagy nincs hangjuk, vagy utólag lett a filmek „alá betéve”. A Google DeepMind kutatólaboratóriuma most találhatott egy megoldást a modernkori némafilmekre.

 

A videóból audio azaz a V2A technológiáját bemutatva a Google kifejlesztett egy olyan eszközt, amely képes szinkronizált hangot generálni a videó pixeleinek felhasználásával. A szerkesztők nyelvi szöveges promptokat is beszúrhatnak a folyamatba, ha akarnak.

A Google egy sor demonstrációs videót is közzétett Veo mesterséges intelligencia-videógenerátorának használatával, „egyeztetve a karaktereket és a hangnemet” a V2A eszközzel. A V2A technológia nem csak mesterséges intelligencia-videókban használható: a Google DeepMind kutatói szerint hagyományos felvételeken is alkalmazható, „beleértve az archív anyagokat, a némafilmeket és egyebeket is”.

A videóvágók legszebb álma

A V2A láthatóan „korlátlan számú hangsávot tud generálni bármilyen videóbemenethez”. A szöveges promptok a hangkimenet pozitív vagy negatív promptokkal történő irányítására használhatók (az utóbbi eltereli a végeredményt a meghatározott, nem kívánt hangszíntől vagy stílustól.) „Ez a rugalmasság lehetővé teszi a felhasználók számára, hogy jobban szabályozzák a V2A hangkimenetét, lehetővé téve a különböző hangkimenetekkel való gyors kísérletezést és a legjobb illeszkedés kiválasztását”, írja a DeepMind egy blogbejegyzésében.

A modell felépítéséhez a Google kutatói „diffúzió alapú megközelítést” alkalmaztak az autoregresszív architektúra helyett. A V2A rendszer a videóbemenetet tömörített reprezentációba kódolja, majd a diffúziós modellek véletlenszerű zajból építik fel a hangot, ezt a folyamatot pedig a videó képei vezérlik. Ezután a hangkimenetet dekódolják, hanghullámformává alakítják, és kombinálják a videóadatokkal.

A Google azt állítja, hogy a modellt feltanította videóra, hangra és további olyan paraméterekre, amelyek segítenek a modellnek megérteni a kapcsolatot a vizuális esemény és a hang között. A kutatók úgy vélik, hogy modelljük azért is újszerű, mivel a V2A technológia képes megérteni a nyers képpontokat, és a szöveges utasítások nem is feltétlenül szükségesek a folyamathoz.

Videoszerkesztők álma – korlátozott hozzáféréssel

„A rendszernek nincs szüksége a generált hang és a videó manuális igazítására, ami a hangok, a látványelemek és az időzítések különböző elemeinek unalmas beállítgatását jelenti”, tették hozzá. Vannak azonban korlátozások, mivel a hangkimenet a videóbemenet minőségétől függ. A videó torzítása vagy más nem kívánt hatások hatással vannak a hang minőségére is.

Úgy tűnik, hogy a szájszinkron, amely pedig feltétlenül szükséges lehet az MI-videók készítői számára, mintha nem lenne beépítve a V2A-ba, mivel a modellt nem lehet „szövegfelolvasásra kondicionálni”. Az egész ezzel együtt úgy hangzik, mint a videószerkesztők álma, egyelőre azonban továbbra is kizárólag a DeepMind kutatói használhatják, akik azt akarják, hogy „szigorú biztonsági értékelésen és tesztelésen” essen át, mielőtt a szélesebb nyilvánosság számára elérhetővé válik.

A DeepMind nem említette, hogyan tanították fel a V2A eszközt, de tudható, hogy a Google-nak potenciális piaci előnye van ezen a téren a világ legnagyobb videómegosztó platformjának, a YouTube-nak köszönhetően.

(Forrás)

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top