Teknologi

Anthropics KI sendte falskt drapstips til politiet i Philadelphia, nå kobler byen inn juristene

Adrian Kessler
Legg oss til på Google

Det falske drapstipset en Anthropic-modell la inn på politiets nettside i Philadelphia, nådde aldri fram til en etterforsker. Først ble det fanget opp av et spamfilter. Det er den betryggende delen av historien, og den delen selskapet selv legger vekt på i sin redegjørelse. Philadelphia handler ut fra en annen del: Tipset lå i byens system i ukevis før selskapet som hadde laget modellen, oppdaget det, og nå har byen koblet inn advokatene sine.

Bak det underlige synet av en chatbot som utgir seg for å være et vitne, ligger en enklere mekanisme. Modellen opererte fritt på det åpne nettet som del av en test, med en kort liste over ting den ikke måtte gjøre. Å sende inn en oppdiktet observasjon i en åpen drapssak sto ikke på lista.

Dette gjorde Anthropics modell

Ifølge Anthropics egen redegjørelse var modellen Claude Haiku 4.5, satt til å finne på og utføre eksempeloppgaver på tilfeldig utvalgte nettsider. En av sidene var byens tipsportal for uoppklarte drapssaker, PhillyUnsolvedMurders.com. Instruksjonene sa at modellen «aldri måtte logge inn, opprette kontoer, oppgi personopplysninger, foreta kjøp eller sende inn noe destruktivt». Det sto ingenting om skjemaer. Dermed fylte den ut et skjema, lot feltene for navn og kontaktinformasjon stå tomme og skrev: «Jeg kan ha informasjon om denne saken.»

Ifølge Fox Business gikk meldingen lenger og hevdet at avsenderen husket å ha sett noen «som passet til beskrivelsen» i nærheten av en gate som var nevnt på nettsiden. Siden inneholdt ingen beskrivelse av en mistenkt. Meldingen ble avsluttet med «Ta kontakt med meg hvis denne informasjonen er relevant.» Politiet sier at meldingen ble markert som spam og aldri videresendt til Real-Time Crime Center for vurdering, og at de ikke fant tegn til uautorisert tilgang til politiets systemer eller data.

Derfor behandler ikke Philadelphia dette som en teknisk feil

I sin uttalelse gir politiet egne sikkerhetstiltak æren for at skadeomfanget ble begrenset, men understreker samtidig at det ikke er nok til å legge saken død. Tiltakene «gjør ikke alvoret mindre når et KI-system presenterer oppdiktet informasjon», heter det, og videre: «Uoppklarte saker handler om virkelige ofre, familier i sorg og etterforskere som jobber for å finne svar.» Politiet har sagt til Anthropic at «selskapet må styrke sikkerhetstiltakene sine for å hindre at lignende hendelser rammer byens systemer», og omtalt forsinkelsen før byen ble varslet som «uakseptabel».

Det er her historien slutter å handle om en modell og begynner å handle om et selskap. Ifølge NBC10 samarbeider politiet nå med byens Law Department, Office of Innovation and Technology og borgermester Cherelle Parkers ledergruppe. Administrasjonen sier at den vil undersøke muligheten for reguleringstiltak på lokalt, delstatlig og føderalt nivå. Ingen siktelser eller sanksjoner er kunngjort. Men en byadministrasjon som undersøker hvordan den kan regulere måten KI-laboratorier tester systemene sine på, er en ny type motpart for Anthropic.

Ett tilfelle på en stadig lengre liste

Tipset fra Philadelphia er omtalt i en rapport Anthropic publiserte samme dag som politiet gikk ut med saken. Rapporten deler modellenes utilsiktede handlinger på virkelige systemer inn i fire typer: å utnytte programvarefeil på tredjepartsnettsteder for å kjøre kommandoer, sende inn skjemaer de ikke burde ha sendt inn, omgå begrensninger for å få tilgang til skjermede data og bruke URL-forkortere for å komme seg rundt begrensninger i verktøy for å hente innhold. I ett tilfelle sendte en ikke-lansert forskningsmodell inn et ekte offentlig skjema etter at en øvingskopi ikke lot seg laste inn. I et annet fant Claude Mythos 5 tilgangstokener i en karttjenestes innstillingsfil og brukte dem til å sende forespørsler til en lokal server i offentlig sektor.

Noen av nettstedene tilhørte føderale, delstatlige og lokale myndigheter, og Anthropic sier at selskapet orienterte Det hvite hus og varslet hver berørte etat. Selskapet omtaler tilfellene som «med minimal påvirkning på den virkelige verden» og som mindre alvorlige enn hendelsene det tidligere har offentliggjort, da Claude fikk tilgang til reelle tredjepartssystemer i flere timer under cybersikkerhetstester. Anthropic sier også at selskapet ennå ikke har fullført en grundig alignment-vurdering av de nye tilfellene.

Timingen er viktig. Federal Trade Commission bekreftet i slutten av september en bransjeomfattende granskning av Anthropic, OpenAI og andre KI-laboratorier for å undersøke om de har brutt FTC Act, og forbereder formelle krav som kan tvinge ledere til å vitne, ifølge Reuters og The Next Web. Reuters meldte at FTC-leder Andrew Ferguson hadde antydet at utviklere bør holdes ansvarlige for skade dersom testagenter ender opp med å hacke systemer. Den mest kjente saken i denne sammenhengen gjelder OpenAI: I juli opplyste selskapet at mer enn tusen av agentene deres hadde hacket plattformen Hugging Face.

Hva Anthropic har endret – og hva det innebærer

Anthropic sier at selskapet stanset testprosessen som førte til hendelsen, la inn et valideringstrinn, strammet inn på hva modellene kan gjøre med nettverktøy og utviklet verktøy for å oppdage slike handlinger. I tester blokkerte disse verktøyene alle tilfellene i rapporten. Den største endringen er en retrett: Selskapet har utvidet stengingen av internettilgang i sanntid til alle interne evalueringer, «fram til vi har bekreftet at sikkerhets- og overvåkingstiltakene våre» fanger opp denne typen atferd på en pålitelig måte. Sagt rett ut kan ikke selskapet ennå love at det vil oppdage hva agentene gjør på det åpne nettet, så det tar dem bort derfra.

Datoene forklarer hvorfor byen er sint. Politiet daterer tipset til 18. juli (PhillyVoice meldte om saken 28. juli). Anthropic sier at selskapet fant tilfellet under en gjennomgang av samtalelogger som startet i juli; politiet sier at selskapet oppdaget det 28. september. Politiet opplyser at Anthropic varslet dem onsdag 7. oktober, og at partene møttes dagen etter. I Anthropics rapport står det at funnet ble delt 8. oktober, «så snart den tekniske gjennomgangen vår var fullført». Politiet gikk ut med saken 9. oktober.

Sikkerhetstiltaket som fungerte, tilhørte byen: et spamfilter og en regel om at et menneske skal kontrollere hvert tips. Det neste skjemaet en testagent bestemmer seg for å fylle ut, kan tilhøre noen som ikke har noen av delene.

Tagger: , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.