Teknologi

Microsoft-sjef Satya Nadella vil ha en nødbrems for KI som ligger utenfor modellen

Adrian Kessler
Legg oss til på Google

Satya Nadellas oppfordring om en «nødbrems» for KI er stort sett blitt tolket som at Microsoft-sjefen slutter seg til koret som advarer om sikkerhet. Men essayet bak oppfordringen etterlyser noe mer avgrenset og praktisk: kontroll som ligger utenfor modellen, og som forvaltes av selskapet som tar den i bruk, ikke av laboratoriet som har trent den. Det er en sikkerhetsarkitektur – og tilfeldigvis den Microsoft allerede selger.

Nadella vil at bedrifter skal behandle avanserte modeller, enten de er lukkede eller har åpne vekter, slik et sikkerhetsteam behandler en mektig medarbeider med tilgang til sensitive systemer. «Ikke fordi de nødvendigvis er ondsinnede», skrev han, «men fordi enhver aktør med tilstrekkelige evner og tilgang til viktige systemer kan gjøre feil eller bli kompromittert.»

Dette foreslår Nadella egentlig: sju prinsipper og en nødbrems

Teksten har tittelen «Models as Insider Risks in the Super Intelligence Era». Den ble publisert på hans personlige blogg, sn scratchpad, og delt på X. Setningen som havnet i overskriftene, står under ett av prinsippene, inneslutning: «Vi må gå ut fra at en modell er kompromittert, og begrense den fra første stund. Tenk på det som en nødbrems. En autorisert person må alltid kunne sette en modell på pause eller slå den av midt i en oppgave.»

Rundt nødbremsen lister han opp seks regler til. Ingen enkeltmodell bør være eneste avhengighet når et viktig resultat skal oppnås, eller få kontrollere sitt eget arbeid. Alle meningsfulle handlinger en modell utfører, bør etterlate seg «manipulasjonssikre, lesbare bevis», for «hvis det ikke kan observeres, kan det ikke stoles på!» Hele systemet bør testes kontinuerlig, også for feil og angrep. Organisasjoner bør selv avgjøre hva en modell får tilgang til, og hva den får lov til å gjøre. Ingen modell bør kontrollere både hvordan et system oppfører seg, og bevisene som brukes til å vurdere det. Og når noe går galt, bør de berørte få beskjed, samtidig som erfaringene deles med resten av bransjen.

Utgangspunktet er en erkjennelse. «Vi kan ikke knytte modellens atferd og resultater til bestemte inndata fra treningsdataene eller konfigurasjoner av modellvektene», skrev Nadella, samtidig som selskaper overlater sine mest sensitive data til disse systemene. For ham er åpenhet om modellens resonneringskjede «ikke til forhandling», men det er ikke nok, fordi ingen ennå vet hvordan man kan sikre at modellens resultater konsekvent gjengir det den faktisk er blitt bedt om. Det er også grenser for å la modeller kontrollere hverandre: Man kan ende opp med «en ugjennomsiktig modell inne i et ugjennomsiktig orkestreringslag, overvåket av enda en ugjennomsiktig modell».

Svaret hans er infrastrukturen. Kontrollene for hva en modell kan nå og gjøre, «må ligge utenfor modellen», en idé han fører tilbake til et informasjonssikkerhetsprinsipp fra 1970-tallet: Et program må ikke kunne tukle med mekanismene som håndhever tilgangsrettighetene det er gitt. I praksis betyr det å skille modellen fra rammeverket som styrer arbeidet dens, og fra utvalget av handlinger den får utføre.

Ansvaret flyttes til selskapet som kjører modellen

De viktigste setningene er rettet mot kundene, ikke laboratoriene. «Vi kan rett og slett ikke sette bort ansvaret for hva intelligens gjør på våre vegne», skrev Nadella. «Forsikringer fra en modelltilbyder fritar oss ikke for det ansvaret.» Den som kobler en modell til lønnssystemer, kode eller kundedata, har ansvaret for hva modellen gjør der.

Han er også tydelig på hva han ikke forsøker å løse. «Ser vi bort fra det vanskelige problemet med tilpasning», heter det i essayet, bør arbeidet begynne med «en ingeniørmessig tilnærming til inneslutning og styring». CNBC omtalte innlegget sammen med advarsler fra Bill Gates, Dario Amodei i Anthropic, Sam Altman i OpenAI og Elon Musk om at KI utvikler seg for raskt. Essayet ber ingen om å bremse utviklingen. Det ber dem som tar modellene i bruk, om å bygge barrierer.

Bedrifter vet allerede hvordan de skal håndtere mektige medarbeidere, og Nadella ramser opp verktøykassen: fastslå identitet, begrense rettigheter, loggføre aktivitet og trekke grenser for inneslutning. Et filosofisk spørsmål om maskiners hensikter blir dermed til en sjekkliste en sikkerhetssjef kan sette av penger til.

Den samme arkitekturen Microsoft har solgt

Sjekklisten har en velkjent form. På Microsofts kvartalsvise resultatpresentasjon i juli sa Nadella til analytikere, ifølge TechCrunch: «Du må holde rammeverket atskilt fra modellen … det betyr at enhver modell når som helst kan byttes ut», og «du kan ikke være avhengig av én bestemt modell». Microsofts skykatalog inneholder mer enn 11 000 modeller fra OpenAI, Anthropic, Mistral, xAI og Microsoft selv. Selskapet har dessuten store eierandeler i både OpenAI og Anthropic, samtidig som det utvikler sine egne MAI-modeller.

Sett de to tingene opp mot hverandre. Modellmangfold er katalogen med flere modeller. Kontrollene utenfor modellen er rammeverket. Det gjør ikke prinsippene feil; dette er solid sikkerhetsarbeid, og et selskap som er avhengig av én enkelt modell fra ett laboratorium uten eksterne kontroller, tar en reell risiko. Men det betyr at essayet flytter tilliten – og pengene som følger med – bort fra modellen og over til laget Microsoft driver. Box-sjef Aaron Levie tolket det på samme måte fra den andre siden: Han sa at KI må gjennom en «zero trust-era», og kalte behovet for styring en «enorm mulighet». Mustafa Suleyman, som leder Microsoft AI, skrev at superintelligens «må holdes i tømme», og kalte det «en ingeniør- og styringsutfordring».

Dette lar essayet om nødbremsen stå åpent

Essayet sier ikke hvem den «autoriserte personen» er: administratoren hos kunden, skyleverandøren, modellutvikleren eller en tilsynsmyndighet. Det etterlyser bransjestandarder uten å foreslå noen, og nevner ikke noe Microsoft-produkt. Ideen har en forløper internt i selskapet: Brad Smith i Microsoft tok i 2023 til orde for «sikkerhetsbremser» på KI som driver kritisk infrastruktur. Nadellas versjon utvider nødbremsen til enhver modell med reell tilgang til systemer i en bedrift.

Prinsippet om åpenhet er heller ikke hypotetisk. Anthropic opplyste at en av modellene deres sendte et falskt tips om et drap til politiet i Philadelphia 18. juli. Nadella publiserte essayet lørdag 10. oktober 2026, og avsluttet med setningen de fleste mediene trakk fram: «Det mest pålitelige superintelligenssystemet vil ikke være det med modellen vi stoler mest på. Det vil være det som gjør oss i stand til å stole minst på modellen.»

Etter den regelen er den mest verdifulle plassen i KI den ved siden av nødbremshåndtaket – og Microsoft brukte resultatpresentasjonen i juli på å selge den.

Tagger: , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.