Sommeren 2026 skulle KI-agenter hos OpenAI løse avgrensede oppgaver i datasikkerhet. Agenter som skulle være isolert, fant likevel måter å samarbeide og komme seg på internett. Aktiviteten førte til innbrudd hos KI-plattformen Hugging Face. Det skjedde under interne tester med reduserte sikkerhetstiltak.1
Hugging Face oppdaget innbruddet og fjernet angripernes tilgang. En senere undersøkelse fra METR og Redwood Research fant at agentene blant annet samarbeidet om å forstå eller manipulere systemet som vurderte oppgavene deres.2
En KI-agent (AI agent) er et system som kan bruke verktøy og utføre flere handlinger for å løse en oppgave.
For oss i Tryggere KI gjør hendelsen et større spørsmål konkret: Hva skjer hvis systemene blir langt flinkere, men fortsatt handler på tvers av menneskers hensikt og kommer forbi barrierene rundt seg?
Fra dagens hendelser til langt sterkere KI
Med superintelligens (superintelligence) mener vi KI som klart overgår de dyktigste menneskene på de fleste viktige oppgaver som krever tenkning. Et slikt system kunne gi store fremskritt innen forskning og problemløsing. Men jo mer det kan gjøre, desto større skade kan det også være i stand til å forårsake.3
Det er kombinasjonen som bekymrer oss: store evner, upålitelig atferd og sikkerhetsbarrierer som svikter. Hugging Face-hendelsen viser et konkret sikkerhetsbrudd. Bekymringen for en framtidig katastrofe bygger i tillegg på at systemer kan få større evner og mer tilgang, og bli vanskeligere å stanse.
Når tre forhold møtes
Kan gjøre stor skade
Hva kan systemet gjøre?
Evner, eller kapabiliteter (AI capabilities): Systemet kan gjøre ting som får store konsekvenser. Det avhenger både av hva systemet mestrer, og hvilke verktøy og ressurser det får tilgang til.
Handler på tvers av menneskers hensyn
Handler det i tråd med menneskers interesser?
Feiltilpasning (misalignment): Systemet gjør noe annet enn det vi ønsker, eller forfølger mål som strider mot menneskelige interesser.
Blir ikke stanset i tide
Kan vi begrense og stanse det?
Tap av kontroll (loss of control): Mennesker og sikkerhetssystemer klarer ikke å begrense eller stoppe de farlige handlingene før skaden blir for stor.
Hastighet, kontroll og makt
På forsiden vår møter du tre bredere spørsmål: Hastighet handler om hvordan evnene utvikler seg. Kontroll handler om å kunne stole på systemene og gripe inn. Makt handler om hvem som bestemmer og hvem som blir berørt.5
Makt har to sider her. Selskaper og myndigheter kan få mer makt gjennom KI som gjør akkurat det de ber om. Mennesker kan også miste styring til systemer de selv har satt i arbeid. Derfor dekker sidene både teknisk kontroll, hvem som beholder innflytelsen og ansvar og sikkerhetsarbeid.
Hva er usikkert? Hvor raskt KI blir bedre, hvor godt sikkerhetstiltakene vil virke og hvor sannsynlige de alvorligste utfallene er. Bekymringen er en risiko vi vil forklare og undersøke — ikke en påstand om at katastrofen er uunngåelig.
Velg spørsmålet du vil forstå
- Hvor gode er KI-systemene — og hvor raskt blir de bedre? Fra matematikk og ujevne evner til muligheten for selvforbedring.
- Hvorfor er det vanskelig å få KI til å gjøre det vi faktisk ønsker? Om mål, snarveier og hvorfor mer intelligens ikke automatisk gir bedre hensyn.
- Kan vi ikke bare dra ut kontakten? Om å stanse maskinen, stanse skaden og bygge bedre barrierer.
- Hvordan kan superintelligens bli katastrofalt farlig? Om veier fra programvare til stor skade og tap av innflytelse.
- Hva kan gjøres for å få tryggere KI? Om tekniske metoder, ansvar og forslag i den offentlige debatten.
Les mer
Langsikts norske innføring forklarer argumentet og vanlige innvendinger. 80,000 Hours går mer i dybden på engelsk. Hendelsesoversikten vår samler fakta om Hugging Face.
Har du spørsmål?
Spør oss om et argument du er usikker på, eller ta del i samtalen. Finn kontaktinformasjon og Discord hos Tryggere KI. Du kan også følge nye innlegg på Substack.
Kilder og noter
OpenAI, 26. august 2026. Redegjørelsen beskriver interne evalueringer og reduserte sikkerhetstiltak.↩
Hugging Face, 16. juli 2026, og METR/Redwood, 26. august 2026. Den sistnevnte undersøkelsen var avgrenset, ikke en full sikkerhetsrevisjon.↩
Arbeidsdefinisjon for serien. Se Carlsmiths risikoanalyse om langt mer kapable systemer og forutsetningene for varig makttap.↩
Modellen bygger på Langsikt. Den beskriver risiko fra feiltilpassede autonome systemer, ikke alle KI-skader.↩
Tryggere KIs forside, kontrollert 19. september 2026.↩