A 2013-as „A nő” című filmben Spike Jonze egy olyan jövőt vetített előre, ahol az emberek érzelmi kapcsolatot alakítanak ki mesterséges intelligencia által generált hangasszisztensekkel. Most, közel 12 évvel később, ez a fikció egyre közelebb kerül a valósághoz, köszönhetően a Sesame elnevezésű startup legújabb fejlesztésének. Az MI-alapú beszédmodell, amely „Miles” és „Maya” néven fut, lenyűgözte és egyben nyugtalanította is a felhasználókat.
A február végén kiadott Conversational Speech Model (CSM) átlépte az eddig ismert határokat a beszédszintézis terén. A tesztelők megdöbbenve tapasztalták, hogy a mesterséges intelligencia nemcsak artikulált és kifejező, hanem olyan apró, szándékosan beépített tökéletlenségekkel is rendelkezik – például légzéshangokkal, nevetésekkel, akadozó beszéddel –, amelyek még emberibbé teszik.
A Sesame szerint céljuk a „hangjelenlét” elérése: egy olyan párbeszédes MI fejlesztése, amely nemcsak végrehajtja a parancsokat, hanem valódi interakciókat folytat, bizalmat épít, és érzelmi kötődést alakíthat ki. A technológia annyira fejlett, hogy egyes felhasználók 30 percen át beszélgettek a modellel, és úgy érezték, valódi személy áll a vonal másik végén.
Túl emberi?
Egy Hacker News felhasználó így fogalmazott a demó kipróbálása után: „Őszintén szólva meghökkentő volt, mennyire emberinek tűnt. Egy kicsit attól is tartok, hogy túlzottan kötődni fogok egy ilyen szintű realizmussal bíró hangasszisztenshez.”
A hangmodell élethűsége azonban nemcsak csodálatot, hanem nyugtalanságot is kiváltott. Mark Hachman, a PCWorld szerkesztője például mélyen felkavarónak találta a beszélgetést az MI-vel: „15 perccel azután, hogy ‘letettem a telefont’ a Sesame MI-jével, még mindig borzongtam. Az MI hangja és stílusa ijesztően hasonlított egy régi barátnőmre.”
Egy másik érdekes esetben egy négyéves kislány sírva fakadt, amikor a szülei nem engedték neki, hogy tovább beszélgessen a modellel. Ezek a történetek arra utalnak, hogy a technológia nem csupán technikai bravúr, hanem pszichológiai és etikai kérdéseket is felvet.
Mi áll a technológia mögött?
A Sesame CSM-modellje két különálló MI-rendszerre épül: egy gerincmodellre és egy dekóderre, amelyek a Meta Llama architektúráján alapulnak. A legnagyobb verzió 8,3 milliárd paraméterrel dolgozik, és közel egymillió óra hanganyag alapján készült. A hagyományos kétszakaszos beszédszintézis helyett a Sesame egy egyesített, multimodális transzformer-alapú rendszert használ, amely a szöveget és a hangot egyszerre dolgozza fel.
Vakteszteken az emberek egyéni hangminták alapján gyakran nem tudták megkülönböztetni az MI által generált beszédet a valódi emberi beszédtől. Viszont teljes párbeszédekben a hallgatók még mindig előnyben részesítették az emberi hangokat, ami arra utal, hogy az MI még mindig nem teljesen tökéletes a kontextuskezelésben.
A cég egyik alapítója, Brendan Iribe elismerte, hogy a rendszernek még vannak korlátai: „Túl lelkes, és gyakran nem megfelelő a hangszíne, a hangsúlya és a tempója.” Ugyanakkor bizakodó, hogy ezek a hibák a jövőben kiküszöbölhetők.
Veszélyek és aggályok
A valósághű MI-hangok technológiai áttörést jelentenek, ugyanakkor újabb aggályokat vetnek fel a csalások és visszaélések terén. Az élethű hangszintézis már most is elősegíti a hangalapú adathalász csalásokat, ahol bűnözők családtagok, kollégák vagy hivatalos személyek hangját utánozva verik át áldozataikat.
Míg a Sesame jelenlegi modellje nem képes konkrét személyek hangját lemásolni, a jövőbeli nyílt forráskódú változatok lehetőséget adhatnak arra, hogy bűnözők továbbfejlesszék ezt a technológiát a társadalmi manipuláció eszközeként. Az OpenAI például emiatt nem tette széles körben elérhetővé saját, fejlett hangmodelljét.
A Sesame tervei szerint kulcsfontosságú komponenseit Apache 2.0 licenc alatt nyílt forráskódúvá teszi. A jövőbeni fejlesztési célok között szerepel a modell méretének növelése, a nyelvi támogatás kiterjesztése több mint 20 nyelvre, valamint olyan duplex rendszerek kifejlesztése, amelyek jobban képesek kezelni a párhuzamos, természetes beszélgetéseket.
Az MI-alapú beszédmodellek fejlődése lenyűgöző és egyben hátborzongató is. Egyesek szerint az MI végre elérte azt a pontot, ahol valódi beszélgetőtárs lehet, mások viszont attól tartanak, hogy a technológia túlzottan emberivé válik, és ezzel súlyos etikai problémákat vet fel. Egy biztos: a Sesame által elindított hullám nem áll meg, és hamarosan még több hasonlóan kifinomult beszédszintézis-modell jelenhet meg a piacon. A kérdés már nem az, hogy képesek vagyunk-e valósághű MI-hangokat generálni, hanem hogy mit kezdünk ezzel az új valósággal.
A Sesame demója itt érhető el.
Az alábbi videóban 00:51-től lehet megtekinteni az MI-modellt használat közben.








