Teknologi

Claude styrer 26 prosent av Anthropics AI-forskning — og kontrollerer seg selv

Adrian Kessler
Legg oss til på Google

Hver fjerde AI-forskningsoppgave hos Anthropic ledes nå av Claude. Ikke tildelt Claude som en hjelper, ikke gjennomgått av Claude i etterkant — startet fra en overordnet beskjed og fullført fra start til slutt, med et menneske som sjekker resultatet når det er ferdig. For ni måneder siden var tallet mindre enn én prosent.

Anthropic skiller mellom to ting. Når Claude leder en oppgave, håndterer den det meste av arbeidet uavhengig; en veileder undersøker resultatet i stedet for å styre hvert steg. Det er en annen kategori enn de nitti prosentene av Anthropics samlede forskning og utvikling der Claude fungerer som en samarbeidspartner — et menneske styrer, Claude tar seg av spesifikke deler. Leder er den strengere klassifiseringen. Den utgjør nå 26 prosent av all AI-forskning selskapet driver, vektet etter tiden forskere ellers ville brukt på disse oppgavene.

Skalaen er konkret. Omtrent 30 000 Claude-agenter kjører samtidig på Anthropics interne plattformer, og utfører arbeid innen modelltrening, evalueringer, tolkningsforskning og sikkerhetsanalyse. I august tok disse agentene totalt over én milliard beslutninger. Anthropics sanntidsovervåkingssystemer blokkerte 0,002 prosent av dem — omtrent én av hver 47 000 handlinger — før utførelse. Et offlinelag flagget deretter omtrent 100 000 transkripsjoner ukentlig for gjennomgang, og eskalerte omtrent 50 til et menneske.

Sikkerhet har et målbart budsjett innenfor dette systemet. I løpet av én enkelt uke i juli brukte arbeid dedikert til å holde agenter trygge seks prosent av all AI-forsknings- og utviklingskraft, og tolv prosent av den kraften som AI-drevet forskning og utvikling selv benyttet. Anthropic sier de klassifiserte konservativt, og utelot dedikerte sikkerhetsklassifiserere fra tellingen, noe som tyder på at den reelle andelen er enda høyere.

Et epistemologisk problem står i sentrum av alt dette. Claudes bidrag til Anthropics forskning evalueres delvis av Claude selv. En Claude-modell vurderer Claudes arbeid; tilsynstallene dekker bare én intern plattform; og klassifiseringen av regnekraft stolte på at Claude-modeller samplet og merket sine egne kjøringer. Ingen uavhengig tredjepart har revidert metodikken. De tre tallene Anthropic publiserte er presise, men de er selvrapportert presisjon — noe annet enn bekreftet presisjon.

Anthropic sier de vil begynne å innlemme eksterne evaluatorer i prosessen. Ingen navn, ingen startdatoer, og ingen sammenlignbare offentliggjøringer fra andre AI-laboratorier har dukket opp ennå. 26-prosenttallet, i det tempoet det har beveget seg, er et øyeblikksbilde snarere enn en tak.

Tagger: , , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.