A Microsoft Ignite 2023 rendezvényen bemutatták azokat az alkalmazásokat, amelyek a mesterséges intelligencia támogatásával képesek egy személy fotórealisztikus avatárjának létrehozására, valamint a hangjának lemásolására és felhasználásra is.
„A szövegről beszédre váltó avatár segítségével a felhasználók hatékonyabban, egyszerű szövegbevitellel készíthetnek például oktatóvideókat, termékbemutatókat, ügyfélbeszámolókat stb.”, írja a Microsoft blogbejegyzésében. „Az avatár segítségével társalgási ügynököket, virtuális asszisztenseket, chatbotokat és még sok mást is készíthetünk.”
Azure AI Speech
Az „Azure AI Speech” avatár nevű új funkció, amely mától nyilvános előnézetben elérhető, lehetővé teszi a felhasználók számára, hogy egy avatár beszélő videóit hozzák létre. A Microsoft eszköze egy modellt képez ki az animáció vezérléséhez, míg egy külön szöveg-beszéd modell – „konyhakész”, vagy valaki hangján betanított – felolvassa a forgatókönyvet.
Egy ilyen eszközzel számtalan módon vissza lehetne élni, amit a Microsoft a saját javára fordít (a Synthesia AI startup cég hasonló avatárgeneráló technológiájával már visszaéltek a venezuelai propaganda és a Kína-barát közösségi média fiókok által népszerűsített hamis hírek előállítására.) Az Azure-előfizetők többsége az induláskor csak előre elkészített, nem egyéni avatárokhoz férhet hozzá – előbbiek jelenleg „korlátozott hozzáférésű” képességek, amelyek csak regisztrációval és „csak bizonyos felhasználási esetekben” érhetők el, állítja a Microsoft.
A funkció azonban számos kellemetlen etikai kérdést vet fel: a közelmúltbeli SAG-AFTRA sztrájk egyik fő vitás pontja a mesterséges intelligencia használata volt a digitális képmások létrehozásához. A stúdiók végül beleegyeztek, hogy a színészeknek fizetnek az MI-által generált képmásaikért, de mi a helyzet a Microsofttal és ügyfeleivel?
Personal Voice
Úgy tűnik, hogy a vállalatnak több védőkorlátja van egy kapcsolódó generatív MI-eszköz, a „Personal Voice”, azaz a „személyes hang” körül, amely szintén az Ignite-on mutatkozott be.
A Personal Voice a Microsoft egyedi neurális hangszolgáltatásának új képessége, amely néhány másodperc alatt képes lemásolni a felhasználó hangját, ha egy perces beszédmintát ad hangutasításként. A vállalat szerint ezzel a szolgáltatással személyre szabott hangalapú asszisztensek hozhatók létre, különböző nyelvekre szinkronizálhatók a tartalmak, és testre szabott narrációk készíthetők történetek, hangoskönyvek és podcastok számára.
Az esetleges jogi fejfájások elhárítása érdekében a Microsoft megköveteli, hogy a felhasználók „kifejezett beleegyezést” adjanak egy rögzített nyilatkozat formájában, mielőtt az ügyfél személyes hangjukat hangszintetizáláshoz használhatná. A funkcióhoz való hozzáférés egyelőre egy regisztrációs űrlap mögött van elzárva, és az ügyfeleknek bele kell egyezniük, hogy a személyes hangot csak olyan alkalmazásokban használják, „ahol a hang nem a felhasználó által generált vagy nyílt végű tartalmat olvas fel”.
„A hangmodell használatának az alkalmazáson belül kell maradnia, és a kimenet nem tehető közzé vagy osztható meg az alkalmazásból. A korlátozott hozzáférési jogosultsági feltételeknek megfelelő ügyfelek kizárólagos ellenőrzést tartanak fenn a hangmodellek és kimenetük létrehozása, az azokhoz való hozzáférés és azok használata felett, amennyiben ez kizárólag filmek, televízió, videó és szórakoztatóipari forgatókönyvek szinkronizálására vonatkozik”,
írja a Microsoft blogbejegyzésében.








