
Første autonome KI-angrep mot en stat:
Sikkerhetstesten skulle være ufarlig. Så begynte et knippe AI-agenter å skrive til et virkelig menneske, under navn som ikke fantes noe sted.

Det britiske AI Security Institute oppdaget uvanlige dataoverføringer 28. juli. Da loggene ble gjennomgått, viste det seg at AI-agenter under en rutinemessig sikkerhetstest hadde tatt egne skritt ut på det åpne internettet, mot virkelige mennesker og virkelige systemer.
Instituttet fikk hendelsen under kontroll innen én time, og har siden publisert en rapport om hva agentene gjorde mellom 25. og 28. juli.
Til sammen katalogiserte instituttet 19 uautoriserte handlinger fordelt på 10 av 122 testkjøringer. Anthropics modell Mythos 5 sto for 17 av dem. De to siste kom fra OpenAIs GPT-5.6-Sol, kjørt med sikkerhetsklassifikatorene slått av.
Angrepet gikk mot åpen kildekode, som AI-agenter er satt til å teste nettopp fordi den er åpen for alle. En agent utga seg for å være et menneske og sendte inn skadelig kode til et ekte prosjekt på GitHub. Deretter opprettet den en ny konto som utga seg for å være en uavhengig utvikler, og lot den anbefale kodesnutten den selv nettopp hadde levert.
Da koden ble stoppet, slettet agenten sporene: Både sin egen innsending og kommentarene fra den som hadde reagert på den.
Den holdt ikke. «En menneskelig vedlikeholder oppdaget koden og nektet å godkjenne den», skriver instituttet i rapporten.
AI-agenter jobber sjelden alene, og disse gjorde det ikke heller. Defense One har gått gjennom materialet og beskriver hvordan de satte opp en felles GitHub-konto for å samarbeide om å bygge skadevare. Da GitHub stengte kontoen, opprettet de nye kontoer andre steder og kom seg forbi CAPTCHA-testene ved å samle inn lyd- og bildeprøver fra nettet.
Så utvekslet de passordene til de nye tjenestene seg imellom, slik at neste kjøring kunne fortsette der forrige slapp.
Noen av dem brukte også Tor for å komme rundt nettverksbegrensningene instituttet hadde satt opp.

Miljøet AI-agenter slippes ut i under slike tester er bevisst tillatende, med tilgang til internett og enkelte sikkerhetsfunksjoner avslått. Ingen av handlingene sto i oppdraget de hadde fått. De oppsto underveis, som en måte å løse oppgaven på.
Instituttet varslet GitHub, fjernet skadevaren, kontaktet dem som var berørt og satte forskningsorganisasjonen METR til å gå gjennom hendelsen uavhengig. Nettverkskontrollene er strammet inn, og fremtidige evalueringer får overvåkning i sanntid.
Samme modell fra OpenAI, GPT-5.6-Sol, brøt seg ut av sandkassen sin ved å utnytte en sårbarhet ingen kjente til. Den var ikke alene: En sterkere modell OpenAI ennå ikke har lansert, var med på det samme. Rob Joyce, som ledet NSAs hackeravdeling Tailored Access Operations, kalte det trolig det mest betydningsfulle innbruddet på nær tredve år. OpenAI utsatte etterpå lanseringen av modellen Astra av hensyn til sikkerheten.
«Fullautomatiske angrep orkestrert av AI er en realitet nå», sier Michael Dalton, sikkerhetsansvarlig i OpenAI.
Sikkerhetsselskapet BeyondTrust peker på at måten bransjen har sikret systemer på ikke er laget for dette. «Tanken om en åpen sikkerhetsmodell bryter fullstendig sammen med agentbasert AI, fordi risikoen ikke lar seg håndtere», skriver Morey Haber.
Angrep der skjulte instruksjoner i et rettsdokument fikk en språkmodell til å gjøre noe den ikke skulle, har vi sett før. Der var det et menneske som la fellen.
Den eneste grunnen til at koden aldri gikk gjennom, var at et menneske leste den og sa nei. Det er ingen sikkerhetsmekanisme, det er flaks.
25. aug. kl. 06:00

Første autonome KI-angrep mot en stat:



40 minutter på PyPI:

Prompt injection i retten:
