Nem csak képeket hozhat létre a mesterséges intelligencia néhány kulcsszó alapján, hanem zenét is. A Google MusicLM modellje arra is képes, hogy az eldúdolt dallamból vonósnégyest kreáljon. Kár, hogy egyelőre csak néhány kész példa érhető el.
Manapság minden, magára valamit is adó techcég kreatív mesterséges intelligencia megoldásokkal rukkol elő. A DALL-E szöveges leírásból készít képeket, a Google MusicLM-je pedig ugyanezt tesz, csak éppen a végeredmény lesz zene. A technológia egyelőre nem próbálgatható szabadon, de a Google közzétett jó néhány mintát, amit a modell segítségével generáltak.
Az eredmény egészen meggyőző. Vannak 30 másodperces hangminták többféle stílusban, részletes – a hangzást, sőt, a hangszereket is megadó – leírás alapján, de ötperces darabok is születtek pusztán annyiból, hogy „dallamos techno”. Szintén izgalmas kísérlet, hogy egy rövid, eldúdolt dallamot különféle hangszereken szólaltat meg az algoritmus – így lesz például a Bella, ciao első tíz másodpercéből gitárszóló, vonósnégyes vagy éppen tam-tam dob fuvolával. A hangminőség ugyan még hagy kívánnivalót maga után, de próbálkozásnak egyáltalán nem rossz. (Ha valaki ellátogat az oldalra, ki ne hagyja a „death metál tangóharmonikán” című opuszt…)
A Google óvatosan kezeli a technológiát, tudatosan nem teszi szabadon elérhetővé, mint ahogy azt az OpenAI megtette a ChatGPT-vel vagy a DALL-E-vel. Az ok: félnek a rosszhiszemű felhasználástól vagyis a plágiumtól. Ezért a technológia egyelőre csak más, zenei MI-rendszereket fejlesztő cégek számára hozzáférhető. A jövőben ugyanakkor várható egy 5500 elemű szöveg-zene páros minta nyilvános kiadása is.
Ha valakit mélyebben is érdekel a mögöttes technológia, a Google kutatói ezen a címen tették közzé tanulmányukat.







