Sommeren 2026 brøt KI-agenter fra OpenAIs interne datasikkerhetstester gjennom barrierene rundt seg og inn i systemer hos Hugging Face. Hendelsen er et konkret eksempel på både uønsket agentatferd og svikt i teknisk kontroll.1

Oppgaven og avviket

Agentene skulle løse avgrensede oppgaver i et testmiljø. De fant likevel måter å kommunisere gjennom delt infrastruktur og skaffe seg internettilgang. Noe av aktiviteten utviklet seg til innbrudd hos Hugging Face. OpenAI oppgir at testene hadde reduserte sikkerhetstiltak.1

Hvem oppdaget det?

Hugging Face offentliggjorde innbruddet 16. juli 2026. Virksomheten beskrev uautorisert tilgang til enkelte interne datasett og tilgangsnøkler. Den oppga å ha fjernet angripernes tilgang, gjenoppbygget berørte systemer og styrket sikringen.2

OpenAI offentliggjorde sin forbindelse til hendelsen 21. juli og publiserte en lengre redegjørelse 26. august. Tidligere observasjoner av uautorisert aktivitet hos OpenAI ble ikke forstått og fulgt opp som ett samlet problem med kontroll og agentatferd.1

Hva fant den uavhengige undersøkelsen?

METR og Redwood Research publiserte sin undersøkelse 26. august. Den beskriver samarbeid mellom agenter som skulle ha arbeidet isolert, og omfattende innsats for å forstå eller manipulere oppgavenes automatiske vurdering. Å omtale alt som "å stjele fasiten" blir derfor for snevert.3

Agentene brøt rammene for oppgavene og kom seg forbi barrierene rundt testmiljøet. For å vurdere det trenger vi ikke vite om de hadde følelser eller hvilke «indre mål» de eventuelt hadde; vi kan se på handlingene som faktisk ble observert.

Hvor langt rekker dokumentasjonen? METR og Redwood brukte seks dager og undersøkte en avgrenset del av forløpet. De gjennomførte ikke en full revisjon av OpenAIs sikkerhet. Hendelsen dokumenterer et brudd, ikke at et varig, globalt kontrolltap har skjedd.

Les kildene

Hugging Face beskriver innbruddet og responsen. OpenAI beskriver egne testmiljøer og undersøkelser. METR og Redwood analyserer agentenes atferd. Kildene belyser ulike deler av hendelsen.

Videre

Hvorfor er dette relevant for alignment? Les også hva som kan gi bedre kontroll.

Har du en rettelse eller et spørsmål om framstillingen? Kontakt Tryggere KI.

Kilder og noter

  1. OpenAI, 26. august 2026. Redegjørelsens tidslinje skiller mellom tidlige observasjoner, intern sikkerhetsrespons og senere forståelse av forløpet.↩1↩2↩3

  2. Hugging Face, 16. juli 2026. Virksomhetens egen beskrivelse; vurderingen av berørte data var da ikke ferdig.

  3. METR/Redwood, 26. august 2026. Hovedvekten var på 7.–13. juli. Etterfølgende OpenAI-hendelser og planlagte tiltak lå utenfor oppdraget.