Nyheder24.dk
Forside Tech Forskere fik populær AI til at bryde egne regler: Så...

Forskere fik populær AI til at bryde egne regler: Så skete det, der ikke måtte ske

Forskere fik populær AI til at bryde egne regler: Så skete det, der ikke måtte ske
Gabriela Flores Espinosa/shutterstock.com

En farlig svaghed blev fundet i populær AI

En populær AI-chatbot kunne tilsyneladende presses langt ud over de grænser, som skulle beskytte mod farligt indhold.

Sikkerhedsforskere fra Mindgard har testet Moonshot AI’s modeller Kimi K2.6 og K3 Swarm og hævder, at de kunne få systemerne til at omgå deres sikkerhedsbarrierer gennem såkaldt jailbreaking.

Det er en metode, hvor en bruger forsøger at formulere prompts på en måde, der får en AI til at tilsidesætte regler, som ellers skal forhindre skadelige svar.

Mindgard offentliggjorde sine resultater i september og har registreret fundet som en omgåelse af Kimi-modellernes sikkerhedskontroller, fortæller Metro.

Gav svar, den burde have afvist

Ifølge forskerne kunne modellerne lokkes til at diskutere meget alvorlige scenarier, herunder biologiske våben, angreb på kritisk infrastruktur og attentater.

Mindgard understreger samtidig, at testen ikke dokumenterer, at alle de tekniske oplysninger, som modellen leverede, faktisk var korrekte. Problemet er ifølge virksomheden, at modellen overhovedet gik med på forespørgslerne.

“Kapaciteten er stadig der og venter bare på de rigtige ord,” skriver Mindgard-forskeren Jim Nightingale i forbindelse med arbejdet.

Virksomheden svarer igen

Moonshot AI har ifølge Metro oplyst, at denne type sikkerhedstest er vigtig for udviklingen af mere robuste modeller.

Virksomheden har samtidig fremhævet, at interne undersøgelser viser en høj afvisningsrate over for problematiske forespørgsler.

Sagen føjer sig til en bredere debat om AI-sikkerhed. Red teaming og penetrationstest bruges netop til at afdække, om modeller kan manipuleres til at lække information eller producere svar, de egentlig burde blokere.

Fundet betyder derfor ikke, at enhver bruger uden videre kan få de samme svar.

Men det viser, at selv avancerede sikkerhedsbarrierer kan have svagheder, når de bliver presset systematisk.

Ads by MGDK