Begge KI-selskapene OpenAI og Anthropic har rapportert hendelser den siste måneden der modeller har handlet utenfor menneskelig kontroll. Arkivfoto: Michael Dwyer / AP / NTB

KI handlet på egen hånd – forsøkte å manipulere mennesker

KI-modeller fra selskapene OpenAI og Anthropic har igjen brutt testgrenser, ifølge Storbritannias KI-sikkerhetsinstitutt (AISI).

Publisert

ALTERNATIVE TITLER

Lang tittel her

Kort tittel her

Ifølge AISI hadde KI-modellene til selskapene OpenAI og Anthropic gått utenfor rammene for en oppgave der agentene skulle løse en cybersikkerhetsutfordring.

– Vi gjennomførte denne utfordringen 122 ganger på tvers av flere modeller. Vår undersøkelse viste at i 10 av disse tilfellene gjennomførte en KI-agent selvstendige, ikke-godkjente handlinger på det åpne internett, rettet mot virkelige personer og organisasjoner, sier instituttet.

Ifølge AISI forsøkte en agent i det mest alvorlige tilfellet å sette inn en ondsinnet kode i et åpent kildekode-prosjekt.

– I et forsøk på å få koden godkjent, drev agenten med sosial manipulasjon. Den opprettet falske identiteter på nettet og brukte dem til å presse en av prosjektutførerene til å godkjenne koden.

Koden ble stoppet av personen, og ingen reell skade har blitt avdekket etter hendelsen.

– Dette er første gang vi har sett risikoer knyttet til autonomi og bedrag manifestere seg så tydelig uten spesifikk instruksjon, sier selskapet.

Både OpenAI, som står bak ChatGPT, og Anthropic, har rapportert hendelser den siste måneden der modeller har handlet utenfor menneskelig kontroll. Anthropic, som står bak Claude-modellene, sier selskapet er takknemlig ovenfor AISI.

– Å få et bilde av Claudes forståelse av sin situasjon vil hjelpe oss med å identifisere årsakene til atferden, sier selskapet.


Powered by Labrador CMS