Teknologi

Gemini 3.8 Live erstatter det tomme ansiktet i AI-kundeservice

Adrian Kessler
Legg oss til på Google

Systemet heter Gemini 3.8 Live med Live Avatar. Det kombinerer Googles tale-til-tale-modell med et videolag i sanntid som genererer leppebevegelser og ansiktsuttrykk, samtidig som det håndterer verktøykall i bakgrunnen uten å avbryte samtalen. Språket oppdages automatisk – avataren bytter mellom talespråk midt i samtalen uten overføring, ny innlasting av systemet eller merkbar pause.

Det som skiller løsningen fra teknikker der video legges oppå i etterkant, er at lyd- og videogenereringen skjer i samme inferensløp i sanntid, ikke som sekvensielle trinn. Denne sammenkoblingen holder forsinkelsen lav nok til at samtalen får en naturlig rytme. Google bygger SynthID-vannmerking umerkelig inn i både lyd- og videoutdataene – hvert sekund inneholder en maskinlesbar markør som viser at innholdet er AI-generert, også hvis strømmen tas opp og spilles av senere. Vannmerket overlever rekomprimering, slik at det fortsatt er mulig å verifisere opphavet til eksporterte klipp.

Equal AI, som håndterer bedriftsutrullinger over hele India, gir det tydeligste bildet av hva løsningen kan gjøre i stor skala: ni indiske språk aktive samtidig, mer enn én million direktesamtaler om dagen og støtte for totalt 97 språk. En slik kapasitet ville vært økonomisk upraktisk å oppnå med menneskelige agenter med tilsvarende tilgjengelighet og turnusdekning. Utrullingen bygger ikke på en antakelse om at dette bare er et konseptbevis – det er kapasitet som står i sentrum.

Det lanseringen ikke oppgir, er prisen. Google har ikke offentliggjort kostnadene, men viser interesserte videre til salgsteamet for bedriftskunder. Oppretting av tilpassede avatarer – der organisasjoner lager et ansikt ut fra egne referansebilder – krever at virksomheten forhåndsgodkjennes gjennom en separat verifiseringsprosess; dette kan ikke gjøres på egen hånd. Funksjonene for Extended Thinking i Live-modellen er fortsatt i privat forhåndsvisning, noe som begrenser hvor langt den kan resonnere sammenlignet med Googles øvrige Gemini-tilbud. Det er ikke opplyst hvor mange samtidige økter som støttes. Den begrensede lanseringen følger Googles vanlige mønster for trinnvise bedriftsutrullinger, der pris og kapasitet forhandles i stedet for å offentliggjøres.

Gemini 3.8 Live med Live Avatar er nå tilgjengelig i Gemini Enterprise-konsollen og via Live API, med endepunkter i USA og EU. Google har ikke oppgitt noen tidsplan for bredere tilgang til Extended Thinking for Live-modellen utover gruppen som nå har tilgang til den private forhåndsvisningen.

Virksomhetene som tar teknologien i bruk, vil måtte besvare et spørsmål den selv ikke kan gi svar på: Blir brukeropplevelsen bedre når det visuelle signalet som viser at en interaksjon er automatisert, fjernes – eller forsvinner dermed det siste ærlige tegnet på at det er nettopp det som skjer?

Tagger: , , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.