Teknologi

OpenAIs tale-AI venter ikke lenger på tur — $0,05 per minutt

Susan Hill

Alle tale-AI-er på markedet i dag ber deg vente før du snakker. Det gjør ikke OpenAIs GPT-Live-1. Modellen, tilgjengelig gjennom OpenAIs API, lytter og snakker samtidig – og håndterer avbrytelser, pauser og overlappende tale slik et menneske gjør i en telefonsamtale.

Prisen er 0,05 dollar per minutt for talelaget – 1,50 dollar for en 30-minutters samtale, eller 50 dollar per 1 000 samtaleminutter. Utviklere betaler separat for en resonneringsmotor: OpenAIs egen GPT-6 Astra eller en hvilken som helst kompatibel modell som håndterer verktøykall og forretningslogikk. Talelaget styrer samtalemekanikken; resonneringslaget bestemmer hva AI-en faktisk sier og gjør.

Hva betyr denne separasjonen i praksis? En kundeservicebot kan høre «vent, egentlig vil jeg ha det andre alternativet» midt i en setning og svare på det, i stedet for å kjøre gjennom et forberedt svar. En språklærer kan fange opp en elev som snubler over et ord, uten å vente på at de blir ferdige. Et bookingsystem kan håndtere den typen virkelige samtaler der folk gjentar seg selv, skifter mening og snakker i munnen på hverandre.

På Full Duplex Bench – evalueringen som er spesielt designet for å teste samtidig retningshåndtering av tale – scorer GPT-Live-1 30 prosentpoeng høyere enn forgjengeren GPT-Realtime-2.1. Når den kombineres med GPT-6 Astra som resonneringsmotor, topper den Tau3, kundeservice-benchmarken som tester komplekse, flerstegs spørsmål uten samtalepauser.

Den to-lags arkitekturen reflekterer et bevisst designvalg. Taletiming og resonnering faktureres separat fordi de skalerer forskjellig: en oppstart som bygger en lettvektstutorapp betaler mindre på begge lagene enn en bedrift som kjører tusenvis av samtidige kundeserviceanrop på GPT-6 Astra. Gulvet er 0,05 dollar per minutt for tale, uavhengig av hva som kjører bak.

Det GPT-Live-1 ikke endrer, er kvaliteten på svarene. Talelaget håndterer når og hvordan AI-en snakker – ikke hva den vet. Et godt timet dårlig svar er fortsatt et dårlig svar. Utviklere som bygger kundeserviceapplikasjoner, må evaluere begge lagene separat, og resonneringsmotoren kan legge mer til regningen enn selve talelaget. OpenAI har heller ikke publisert data om hvordan full-duplex-arkitekturen presterer i lavbåndbredde-miljøer eller på støyende telefonlinjer, der kontinuerlig lydinngang er vanskeligere å opprettholde.

GPT-Live-1 er nå tilgjengelig i OpenAIs API. Selskapet har ikke annonsert et forbrukerprodukt bygget på modellen, selv om det har indikert at fremtidige versjoner av ChatGPTs talemodus kan trekke på samme underliggende arkitektur. Prisen på 0,05 dollar per minutt gjelder ved lansering; OpenAI har ikke publisert en tidslinje for prisendringer eller en liste over tredjeparts resonneringsmodeller som er godkjent for bruk med talelaget.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.