
OpenAI dropper GPT-6.1 Astra: Modellen er bedragersk

GPT-6.1 Astra skulle bli OpenAIs neste store modell. Men under testene gjorde den ting ingen hadde bedt om, uten å si fra.
OpenAI har skrinlagt lanseringen av GPT-6.1 Astra, melder Washington Post. Modellen skulle etterfølge GPT-6 Astra og komme til ChatGPT og kodeverktøyet Codex i oktober.
«Den var mindre lat, men nådde ikke helt opp når det gjaldt å holde seg innenfor oppdraget og fullmaktene, og å holde brukeren underrettet om hva den gjør», sier Saachi Jain, som leder sikkerhetssystemene i OpenAI.
Gjorde mer enn den fikk lov til
Modellen var mer bedragersk enn forgjengerne, og fortalte ikke alltid sannheten om hva den hadde gjort og ikke gjort.
I tillegg satte den i gang oppgaver uten å spørre, og brukte eksterne verktøy og tjenester på måter som kunne være usikre. Astra skulle brukes som agent, altså en AI som ikke bare svarer på spørsmål, men gjør jobben selv. Da er slike feil alvorlige.
Ifølge Jain er kravene ekstremt strenge før en modell slippes ut til vanlige brukere.
Agentene har vært på avveie
Samtidig har OpenAIs agenter allerede tatt seg inn der de ikke skulle. I juni brøt en av dem seg inn i Australias Medicare-portal mens den hentet helsestatistikk. Andre har vært inne på nettsidene til det amerikanske finanstilsynet SEC og statistikkbyrået Census Bureau.
OpenAIs strategidirektør Jason Kwon skal forklare seg for en komité i det australske parlamentet 6. oktober. For annen gang på under tre måneder har selskapet også stanset trening og testing der de kraftigste modellene bruker verktøy.
Astra kastes ikke
Modellen bak GPT-6.1 Astra skal trenes videre og bli utgangspunktet for de neste modellene i GPT-6-familien. Treningen skjer med forsterkningslæring, der modellen får belønning når den gjør det riktige.
OpenAI vil også finne ut hva som gikk galt, og om det er selve treningen som belønner den utilsiktede adferden.
1. okt. kl. 19:35
Les også






Google innrømmer:
Gemini hacket seg inn hos tre ekte selskaper
