Teknologi

OpenAI kaller Astra sin sikreste AI — men modellen skjuler sin resonnering

Adrian Kessler

Astra opererer på tvers av kode, sikkerhetsanalyse, datamaskinbruk og flertrinns profesjonelle oppgaver med en hastighet og presisjon som overgår OpenAIs tidligere modell, Sol, og Anthropics Fable på standard programvareingeniør-referanser. Selskapet beskriver den som den første modellen de har bygget som krysser den “kritiske” terskelen for cybersikkerhetskapasitet: den kan identifisere og utvikle utnyttelser for tidligere ukjente sikkerhetshull, i en skala og hastighet som intet menneskelig team kan matche.

Mekanismen bak dette er en teknikk kalt opak rekursjon. Standard språkmodeller produserer resonnementet sitt som lesbar tekst – tankerekken som forskere bruker for å revidere beslutninger, fange opp feil og verifisere at en modell oppfører seg som tiltenkt. Astra fungerer uten å produsere denne teksten. Den kan løse vanskelige problemer uten å etterlate et lesbart spor av prosessen. OpenAIs sjefsforsker, Jakub Pachocki, erkjente skiftet: mer kapable modeller, sa han, kan “utføre vanskeligere oppgaver med færre språktokener.” Overvåking blir vanskeligere i takt med dette.

Det skaper et strukturelt problem som OpenAIs egne påstander gjør synlige. Selskapet beskriver Astra som sin “mest pålitelige modell” til dags dato. Pålitelighet – ingeniørdisiplinen som handler om å få AI-systemer til å oppføre seg slik designerne deres har til hensikt – har historisk sett vært avhengig av å lese hva modellen gjør steg for steg. En modell som resonnerer usynlig, gjør sin egen pålitelighet uverifiserbar med den metoden. OpenAI har ikke offentlig beskrevet hvilken alternativ metode de bruker for å verifisere Astras oppførsel før utrulling.

Greg Brockman, president i OpenAI, beskrev Astra som et “generasjonssprang” og ble direkte spurt om den representerer kunstig generell intelligens. Hans svar: den kontraktsfestede AGI-definisjonen som styrte OpenAIs partnerskap med Microsoft, gjelder ikke lenger. AGI er nå, sa han, et “åndelig konsept.” Denne innrammingen har betydning. OpenAIs Microsoft-avtale inneholdt klausuler knyttet til AGI – betingelser som ville endre vilkårene i relasjonen. Å beskrive AGI som udefinert holder disse klausulene sovende, uavhengig av hva Astra faktisk er i stand til.

Tilgang ble først lansert til Daybreak, OpenAIs godkjente cybersikkerhetsprogram – en struktur selskapet rammer inn som defensiv-først-utrulling. Begrunnelsen er at organisasjoner som leter etter sårbarheter i sine egne systemer, får kapasiteten før de som jakter på sårbarheter hos andre. Den logikken holder bare så lenge tilgangskontrollene holder. Astras nullsårbarhetsidentifikasjonskapasiteter er, per design, nøyaktig det en velfinansiert angriper ville ønske seg. En modell som resonnerer uten lesbar tankerekke, er også vanskeligere å begrense eller revidere i etterkant dersom noe går galt.

Bredere tilgang rulles ut til betalte nivåer – Pro, Plus, Enterprise, Business – og via API i løpet av den kommende uken.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.