Teknologi

Google lanserer Gemini 3.5 Transcribe: renere lydopptak på 85 språk

Adrian Kessler

Gemini 3.5 Transcribe fanger ikke bare opp hva noen sier. Den konverterer det de sa til det de mente å si. Når en taler retter seg selv midt i en setning — «La oss booke det til tirsdag, nei, onsdag» — leverer modellen «onsdag» og forkaster rettelsen. Fyllord forsvinner. Bakgrunnsstøy stopper den ikke. Resultatet kommer ut som polert, formatert tekst, ikke rå lyd.

For alle som spiller inn intervjuer, podkaster eller flerspråklig innhold, er dette skillet hele arbeidsflyten. Alle transkriberingsverktøy på markedet håndterer «det som ble sagt». Den menneskelige redaktøren som renset opp etterpå, tok seg av alt annet. Google bygger nå inn den redaktøren i selve modellen.

Modellen støtter to ulike API-baner. Live API håndterer kontinuerlig toveisstrømming med subsekunds latenstid – designet for sanntids stemmeagenter, kundeserviceboter og alt som trenger umiddelbar transkribering. Interactions API håndterer innspilt lyd: hele møter, samtalelogger og intervjuer, og returnerer taleridentifikasjon for opptil tre deltakere med tidsstempler. Begge oppnår en ordfeilrate på 4,0 % i strømmemodus og 2,6 % i ikke-strømmemodus – målt av det uavhengige benchmarkingselskapet Artificial Analysis. Googles forrige tale-til-tekst-modell, Chirp 3, trengte 70 % mer tid for å nå endelig transkribering.

Forbrukersiden av lanseringen er mer beskjeden. På Android bruker Gboard Rambler allerede Gemini 3.5 Transcribe til tale-til-tekst-innputt. Gemini macOS-appen støtter den på engelsk via en Speak to Window-funksjon. Chrome er oppført som «kommer snart», noe som vil la brukere diktere i alle nettfelt – svar, innlegg, skjemaer – uten å bytte app. Ingen konkret dato for utrullingen er bekreftet.

Modellens begrensninger betyr noe. Taleridentifikasjon for flere talere er begrenset til tre deltakere; paneldiskusjoner og runder med større grupper krever omveier. Forbrukerappen Rambler er foreløpig tilgjengelig i «utvalgte land og språk», ikke de 85 som modellen støtter. Google har ikke annonsert priser for API-en, som er i offentlig forhåndsvisning via Google AI Studio. Tilgang for bedrifter kommer via Gemini Enterprise Agent Platform, der prising forhandles separat. For mindre skapere forblir spørsmålet om kostnad åpent.

Det konkurransemessige bildet er også relevant. OpenAIs Whisper, fremdeles standarden for uavhengige utviklere, oppnår ordfeilrater i området 5–7 % på engelsk lyd og krever etterbehandlingskode for å fjerne fyllord og formatere. Tjenester som AssemblyAI og Deepgram tilbyr talerdiarisering, men ikke den innebygde naturligspråkskorreksjonen Gemini 3.5 Transcribe anvender som standard. Forskjellen er målbar, men hvordan den holder seg i den vanskeligere enden av det 85-språklige spekteret – regionale aksenter, språk med få ressurser, støyende miljøer – vil kreve uavhengig testing for å fastslå.

Funksjonen som sier mest om Googles langsiktige retning, er Chrome-integrasjonen. Når taleinntasting fungerer i alle nettfelt, er modellen ikke lenger et utviklerverktøy — den er infrastruktur for hvordan folk skriver. Tidslinjen for utrullingen av denne endringen er ikke bekreftet.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.