Teknologi

ElevenLabs v4 kloner stemmen din på 10 sekunder og får den til å snakke 90 språk

Susan Hill
Legg oss til på Google

ElevenLabs har lansert Eleven v4, en tekst-til-tale-modell som leser opp tekst med latter, et sukk eller en sint fransk aksent – alt etter hva skribenten ber om. Med funksjonen for umiddelbar stemmekloning trengs det et opptak som er kortere enn en telefonsvarermelding, og den klonede stemmen kan deretter snakke dusinvis av språk uten å miste sitt eget klangpreg. Alle med en gratis ElevenLabs-konto kan bruke modellen.

For dem som skaper ting med lyd, kan dette spare dem for mange dagers arbeid. En podkastvert kan dubbe en episode til japansk med sin egen stemme, en uavhengig spillutvikler kan gi hver birolle sin egen måte å snakke på uten å bestille studiotid, og en lydbokinnleser kan skrive inn en pause eller en liten latter rett i manuset. Baksiden er like konkret: Et talememo, et klipp fra en videosamtale eller noen sekunder fra et offentlig innlegg er nå nok råmateriale til å lage en overbevisende kopi av noen.

Den viktigste nyheten er bedre kontroll, og selve kloningen krever bare ti sekunder med lyd. Tidligere ElevenLabs-modeller leste teksten tydelig, men måtte gjette seg til stemningen. Versjon 4 tar imot sceneanvisninger skrevet inn i teksten i hakeparenteser, som [laughs] eller [said angrily in French accent], og også bakgrunnslyder som [light rain] eller [phone buzzing]. Selskapet sier at modellen dessuten tolker tonefall og tempo ut fra sammenhengen, slik at en replikk i en spent scene høres spent ut uten noen merkelapp. I scener med flere stemmer holder hver av dem seg konsistent gjennom lange tekstpartier – et svakt punkt ved syntetisk opplesning, der stemmene gjerne endret seg underveis i et kapittel.

Språkdekningen øker fra 70 språk i forrige versjon til mer enn 90. Ifølge TechCrunch trekker ElevenLabs særlig fram japansk, brasiliansk portugisisk, mandarin og kantonesisk som språkene der kvaliteten har blitt best. En klonet stemme beholder identiteten sin når den skifter språk, slik at en klone av en spansktalende person som leser tysk, fortsatt høres ut som vedkommende – med tysk uttale som hos en morsmålsbruker. En annen modell, v4 Turbo, er laget for taleassistenter og kundesenteragenter. Den begynner å snakke etter omtrent 150 millisekunder, rundt tiden det tar før to personer bytter på å snakke i en samtale, og kan starte før chatboten bak den er ferdig med å skrive svaret.

ElevenLabs er ikke alene på dette markedet. Google, OpenAI, Cartesia, Deepgram og Fish Audio selger alle syntetiske stemmer til de samme utviklerne. I løpet av få timer etter lanseringen plasserte det uavhengige analysefirmaet Artificial Analysis v4 øverst på sin rangering av stemmer, der lyttere vurderer anonyme lydprøver opp mot hverandre. ElevenLabs sier også at rundt tre av fire lyttere foretrakk v4 i blindtester mot konkurrentene – et tall som stammer fra selskapets egne tester.

Forbeholdene begynner med dette med ti sekunder. ElevenLabs sier at kloning krever samtykke fra personen stemmen tilhører, at selskapet bruker en offentlig tilgjengelig klassifikator som kan merke lyd laget med verktøyene deres, og at det stanser kloning av enkelte politiske personer. Disse kontrollene hindrer tilfeldig misbruk, men forutsetter at den som laster opp lyd, snakker sant. En svindler trenger bare et kort opptak av en slektnings stemme for å iscenesette en falsk nødsamtale. Gratisversjonen har dessuten begrenset kapasitet: rundt ti minutter generert lyd i måneden, ifølge Unite.AIs gjennomgang av abonnementene. Betalte abonnementer starter på 6 dollar i måneden.

Eleven v4 og v4 Turbo ble tilgjengelige 28. september i ElevenLabs’ skaperapp, agentplattform og utvikler-API. Det London-baserte selskapet hentet inn 500 millioner dollar fra Sequoia i februar, til en verdsettelse på 11 milliarder dollar, og TechCrunch melder at den annualiserte omsetningen har passert 600 millioner dollar. Administrerende direktør Mati Staniszewski sa til TechCrunch at selskapet tar sikte på en børsnotering i løpet av de kommende årene, uten å binde seg til noen dato.

For dem som skaper innhold, er en stemme som ler på kommando på 90 språk et innspillingsstudio i en nettleserfane. For alle andre er det enda en grunn til å legge på og ringe tilbake når en kjent stemme i telefonen ber om penger.

Tagger: , , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.