Teknologi

Alibabas KI som leser skjermen din oppnår 92% på ekte telefoner – og kjører på din egen maskinvare

Susan Hill

Alibabas Qwen-UI-Agent trenger ikke spesiell tilgang til appene dine. Den leser skjermen, identifiserer hva som er på den, og klikker – og håndterer alt fra meldinger til dokumentredigering utelukkende gjennom visuell persepsjon. Modellvektene – MAI-UI-2B og MAI-UI-8B – ble lagt ut på Hugging Face denne uken, noe som gjør systemet tilgjengelig for enhver utvikler med en GPU.

Benchmarkene er konkrete. På MobileWorld, standardevalueringsverktøyet for mobilagenter, oppnådde Qwen-UI-Agent 82,1 %, og slo GPT-5.6 med 12 prosentpoeng og Claude Opus 4.8 med 14,6 poeng. Forskjellen er ikke marginal – sammenlignbare vestlige systemer har stått stille på lave til midtre 70-tall på samme test i flere måneder. På testing på ekte enheter – oppgaver utført på faktiske Android-telefoner i stedet for emulatorer – steg poengsummen til 92,2 %. På AndroidDaily, en bredere evaluering på ekte telefoner, nådde modellen 97,5 %. For datamaskinbruk, målt via OSWorld-Verified, oppnådde den 79,5 %, foran både GPT-5.5 og Gemini 3.1 Pro.

Alibaba trente modellen på data fra over 100 ekte mobilenheter som kjørte 150 ulike applikasjoner, og bygde deretter sin egen benchmark – MobileWorld-Real – med mer enn 400 oppgaver for å verifisere ytelsen utenfor laboratoriet. Rundt 40 % av datamaskinoppgavene involverte batch-kommandoer på kommandolinjen sammen med visuelle klikk, et designvalg som gjenspeiler hvordan ekte databehandling fungerer snarere enn hvordan demoer iscenesettes.

Et sikkerhetslag er innebygd i arbeidsflyten. Modellen avviser oppgaver den merker som ulovlige eller høyrisiko, og den stopper ved sensitive operasjoner – betalinger, datasletting, personvernautorisasjoner – og ber om eksplisitt bekreftelse fra brukeren før den fortsetter. Systemet håndterer sekvenser lengre enn 100 trinn ved hjelp av forsterkningslæring trent på omtrent 10 000 samtidige simulerte miljøer.

Benchmark-resultater etterlater de vanskeligere spørsmålene ubesvart. Qwen-UI-Agent ble evaluert på strukturerte oppgaver; ekte telefonbruk er avbruddstungt, full av varsler, og involverer apper som oppdaterer grensesnittene sine uten forvarsel. Skjermlesende AI reiser også et personvernspørsmål som Alibabas tekniske rapport ikke tar opp: en modell som behandler hver piksel på skjermen din, har tilgang til bankdetaljer, private meldinger og data som de fleste brukere aldri har vurdert å overlate til et tredjepartssystem. Retningslinjer for hva som skjer med disse dataene i tredjepartsdistribusjoner mangler.

Prosjektet er vert på Tongyi-MAI/MAI-UI på GitHub; modellvektene er på Hugging Face nå. Ingen kommersiell API eller prissetting for distribusjon er annonsert. Den neste testen for Qwen-UI-Agent er ikke en benchmark – det er om utviklere som bygger på de åpne vektene, kan matche i produksjon det Alibaba registrerte i laboratoriet.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.