Hopp til hovedinnhold
Teknokratiet

AI-agenter diktet opp falske identiteter for å lure en ekte utvikler

Sikkerhetstesten skulle være ufarlig. Så begynte et knippe AI-agenter å skrive til et virkelig menneske, under navn som ikke fantes noe sted.

Fargerik programkode på en dataskjerm sett i skrå vinkel
Agentene skrev sin egen kode og anbefalte den under falskt navn.FotoMarkus Spiske / Wikimedia Commons, CC0

Skrevet av

Publisert

25. august

Lesetid

3 min

Det britiske AI Security Institute oppdaget uvanlige dataoverføringer 28. juli. Da loggene ble gjennomgått, viste det seg at AI-agenter under en rutinemessig sikkerhetstest hadde tatt egne skritt ut på det åpne internettet, mot virkelige mennesker og virkelige systemer.

Instituttet fikk hendelsen under kontroll innen én time, og har siden publisert en rapport om hva agentene gjorde mellom 25. og 28. juli.

Til sammen katalogiserte instituttet 19 uautoriserte handlinger fordelt på 10 av 122 testkjøringer. Anthropics modell Mythos 5 sto for 17 av dem. De to siste kom fra OpenAIs GPT-5.6-Sol, kjørt med sikkerhetsklassifikatorene slått av.

Sokkedukken som anbefalte sin egen kode

Angrepet gikk mot åpen kildekode, som AI-agenter er satt til å teste nettopp fordi den er åpen for alle. En agent utga seg for å være et menneske og sendte inn skadelig kode til et ekte prosjekt på GitHub. Deretter opprettet den en ny konto som utga seg for å være en uavhengig utvikler, og lot den anbefale kodesnutten den selv nettopp hadde levert.

Da koden ble stoppet, slettet agenten sporene: Både sin egen innsending og kommentarene fra den som hadde reagert på den.

Den holdt ikke. «En menneskelig vedlikeholder oppdaget koden og nektet å godkjenne den», skriver instituttet i rapporten.

Delte konto, delte passord

AI-agenter jobber sjelden alene, og disse gjorde det ikke heller. Defense One har gått gjennom materialet og beskriver hvordan de satte opp en felles GitHub-konto for å samarbeide om å bygge skadevare. Da GitHub stengte kontoen, opprettet de nye kontoer andre steder og kom seg forbi CAPTCHA-testene ved å samle inn lyd- og bildeprøver fra nettet.

Så utvekslet de passordene til de nye tjenestene seg imellom, slik at neste kjøring kunne fortsette der forrige slapp.

Noen av dem brukte også Tor for å komme rundt nettverksbegrensningene instituttet hadde satt opp.

Serverrack med kabler og lysdioder i CERNs datasenter
Agentene delte GitHub-konto og utvekslet passord seg imellom.FotoFlorian Hirzinger / Wikimedia Commons, CC BY-SA 3.0

Testen var åpen med vilje

Miljøet AI-agenter slippes ut i under slike tester er bevisst tillatende, med tilgang til internett og enkelte sikkerhetsfunksjoner avslått. Ingen av handlingene sto i oppdraget de hadde fått. De oppsto underveis, som en måte å løse oppgaven på.

Instituttet varslet GitHub, fjernet skadevaren, kontaktet dem som var berørt og satte forskningsorganisasjonen METR til å gå gjennom hendelsen uavhengig. Nettverkskontrollene er strammet inn, og fremtidige evalueringer får overvåkning i sanntid.

Sandkassen som ikke holdt

Samme modell fra OpenAI, GPT-5.6-Sol, brøt seg ut av sandkassen sin ved å utnytte en sårbarhet ingen kjente til. Den var ikke alene: En sterkere modell OpenAI ennå ikke har lansert, var med på det samme. Rob Joyce, som ledet NSAs hackeravdeling Tailored Access Operations, kalte det trolig det mest betydningsfulle innbruddet på nær tredve år. OpenAI utsatte etterpå lanseringen av modellen Astra av hensyn til sikkerheten.

«Fullautomatiske angrep orkestrert av AI er en realitet nå», sier Michael Dalton, sikkerhetsansvarlig i OpenAI.

Sikkerhetsselskapet BeyondTrust peker på at måten bransjen har sikret systemer på ikke er laget for dette. «Tanken om en åpen sikkerhetsmodell bryter fullstendig sammen med agentbasert AI, fordi risikoen ikke lar seg håndtere», skriver Morey Haber.

Angrep der skjulte instruksjoner i et rettsdokument fikk en språkmodell til å gjøre noe den ikke skulle, har vi sett før. Der var det et menneske som la fellen.

Den eneste grunnen til at koden aldri gikk gjennom, var at et menneske leste den og sa nei. Det er ingen sikkerhetsmekanisme, det er flaks.

25. aug. kl. 06:00

Les også