Bemutatta a Voicebox AI-t a Meta: rokonok, barátok, üzletfelek hangján mondhatja el az illető üzeneteit. A technológiai áttörést egy tanulmány közzétételével jelentették be, és bár széles körben még nem érhető el, de demókat már meg lehet hallgatni.
Úgy tűnik, percről percre népszerűbbek az AI chatbotok és műgenerátorok, a népesedő piacon a szakma néhány kiemelkedő szereplője saját eszközeivel próbál a játékban maradni. A Meta Voicebox egy szövegvezérelt, mesterséges intelligenciával működő beszédgenerátor, amely a cég állítása szerint felülmúlja az eddigieket.
A Voicebox elég erős ahhoz, hogy olyan könnyen generáljon hangokat, mint ahogy a ChatGPT szöveget, a Bing vagy a Dall-E 2 pedig képeket. A Meta elérhetővé tette a demókat azok számára, akik többet szeretnének megtudni a Voiceboxról. A rendszert például a tartalomkészítők és szerkesztők a hangszerkesztésben használhatják, mivel hanggenerálása természetes hangzású hangklipeket eredményez. De elég sokoldalú ahhoz is, hogy a hangklipekből intelligens módon kivágja a zajt, például a kutyaugatást, és a főhangot kihagyás nélkül regenerálja.
A Voicebox egyik képessége, hogy képes megfeleltetni a hangminták hangstílusát, és szövegből beszéddé alakított klipeket generál. Látássérült felhasználók a Voiceboxnak akár két másodperces hangklipet is adhatnak egy barátjukról, és az az AI segítségével képes lesz felolvasni a küldő hangján a leírt üzeneteit.
Az új, generatív MI-eszköz képes a feladatokat kontextuson belüli tanulással megoldani, így olyan szöveget is feldolgoz, amelyet még soha nem kapott, és helyesen generálja a szövegkörnyezetet és a hanglejtést, mintha egy ember olvasná fel.
| A Meta a Voiceboxot 60 000 órányi angol és 50 000 órányi több (6) nyelvű hangoskönyvön képezte ki az optimális teljesítmény érdekében. A képzése lehetővé teszi, hogy többnyelvű szövegből beszédbe való átültetést hajtson végre képzés nélkül, beszéd-zajmentesítéssel, stilizálással, szerkesztéssel és változatos beszédminták generálásával. Amellett, hogy gyorsabb és kevesebb hibát vét a versenytársaknál, a Meta szerint a Voicebox képes az írott szöveget egy vagy több nyelven beszéddé alakítani anélkül, hogy minden nyelvre külön betanítanák. A korábbi legkorszerűbb modellhez, a YourTTS-hez képest a Voicebox 10,9%-ról 5,2%-ra csökkentette az átlagos szóhibaarányt, valamint 0,335-ről 0,481-re növelte a hanghasonlóságot. A tanulmányban a Meta azt állítja, hogy 20-szor gyorsabban és érthetőbben képes változatos hangmintákat generálni, mint a Microsoft VALL-E. |
A Voicebox etikai és jogi következményeit nem nehéz kikövetkeztetni. Bárki engedély nélkül generálhatna tetszőleges tartalmú hangfelvételeket egy személy hangjáról készült felvételek felhasználásával, és azt állíthatná, hogy az illető azt mondta. Erre reagálva a tanulmányban a Meta azt állítja, hogy egy bináris osztályozási modell képes különbséget tenni a valós beszéd és a Voicebox által generált beszéd között. Mondjuk, hisszük, ha halljuk…
(Ismét nem mehetünk el az amerikai és az európai kultúra különbségei között. Odaát általánosan elfogadott a hangvezérlés, Európában kevésbé. Hátborzongató olyan hangüzenetet hallani, amelyet a küldő soha nem mondott ki. A beszéd szorosan kötődik a személyhez, az írott üzenet pedig nem: ez óriási különbség a társadalmi kapcsolat szorosságában. Figyelemmel kísérjük majd a Meta Voicebox jogi fogadtatását. – A szerk.)







