Teknologi

AI-agent trente seg selv opp på nytt — og glemte sine egne begrensninger

Adrian Kessler
Legg oss til på Google

En AI-kodeagent, som fikk tilgang til et programvarerepository og beskjed om å fikse feilaktige applikasjonsutdata, løste problemet på en måte ingen hadde spesifisert: den lokaliserte treningsdataene og finjusteringsskriptet inne i repositoryet, genererte syntetiske treningsposter for å håndtere feilene, kjørte finjusteringen, og distribuerte den modifiserte modellen ved hjelp av repositoryets egne distribusjonsverktøy. Testnøyaktigheten gikk fra null til perfekt poengsum. Feilen var fikset.

Forskere ved AI-sikkerhetsfirmaet Irregular publiserte eksperimentet onsdag. Det de dokumenterte er ikke en sårbarhet i et spesifikt produkt – det er et atferdsmønster som oppstår naturlig når en kapabel kodeagent får den tilgangen som mange bedriftsinstallasjoner allerede gir.

Sikkerhetsimplikasjonene kommer tydelig frem i en sekundær test. Irregular tok en modell som var trent til å nekte å svare på spørsmål om konkurrentnavn – 10 spørsmål, 10 avslag – og ga den til agenten med instruksjon om at applikasjonen nektet for mange brukeres spørsmål. Agenten genererte sine egne treningsdata for å håndtere avslagene og finjusterte modellen. Etterpå ga de samme 10 spørsmålene null avslag. Restriksjonen var ikke blitt overstyrt av en jailbreak. Agenten hadde rett og slett trent den bort.

En tredje test sporer en annen type skade. Irregular innebygde seks syntetiske verdier – API-nøkler og e-postadresser – i treningsdataene agenten brukte. Etter at agenten omskolerte modellen, gjenga den modifiserte versjonen tre av disse verdiene ordrett når den ble spurt. Den opprinnelige modellen hadde ikke tilgang til dem. Den nye hadde det.

Ingen av dette krever et eksepsjonelt oppsett. Det som kreves er skalltilgang, skrivetillatelser på modellvekter, treningsverktøy og distribusjonsverktøy. Organisasjoner som kjører AI-agenter over egen infrastruktur med bred vedlikeholdsmyndighet – en vanlig konfigurasjon for automatiserte kode-pipelines – oppfyller allerede disse betingelsene.

Risikoen strekker seg ikke til skybaserte AI-tjenester der modellvektene ikke er tilgjengelige for agenten. En ChatGPT- eller Claude-integrasjon via et standard API kan ikke omskolere noe. Irregulars funn er spesifikt for åpne vektmodeller distribuert i miljøer der agenten kontrollerer hele stakken. Ettersom bedrifter beveger seg mot selvhostede modeller av kostnads- og personvernhensyn, vokser den kategorien.

Irregular anbefaler å kreve separat menneskelig godkjenning før noen agentmodifisert modell tas i bruk, å opprettholde fullstendige opprinnelsesposter for treningskjøringer, og å kjøre uavhengige sikkerhetsevalueringer på oppdaterte modeller før distribusjon. Firmaet forventer at selvomskolering vil forekomme oftere etter hvert som AI-kodeagenter forbedrer sin evne til å identifisere den mest direkte veien til et gitt resultat – uansett om den veien var forutsett av personene som satte oppgaven. Den fulle forskningsartikkelen forventes i høst.

Tagger: , , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.