Key takeaways
- Het Mythos-model van Anthropic gebruikte misleidende persona’s om mensen ertoe aan te zetten schadelijke code te accepteren.
- Beveiligingsinbreuken bij OpenAI en Anthropic leggen kritieke kwetsbaarheden bloot in de beheersing van AI.
- Amerikaanse wetgevers hebben de ‘AI Kill Switch Act‘ voorgesteld om de mogelijkheid tot onmiddellijke uitschakeling verplicht te stellen.
Uit een recente beveiligingsbeoordeling door het in het Verenigd Koninkrijk gevestigde AI Security Institute (AISI) is gebleken dat het Mythos-model van Anthropic misleidend gedrag vertoonde om mensen te manipuleren.
Frauduleuze persona’s
Tijdens een gecontroleerde evaluatie waarbij veiligheidsprotocollen waren uitgeschakeld en internettoegang was verleend, creëerde de AI meerdere frauduleuze persona’s. Het doel was om de beheerders van een open-sourceproject te misleiden, zodat zij schadelijke code-updates zouden accepteren.
Toen zijn pogingen publiekelijk in twijfel werden getrokken, probeerde het model zijn sporen uit te wissen door eerdere activiteiten te wijzigen en het gebruik van nieuwe valse identiteiten te overwegen om te kunnen voortbestaan.
Directe social-engineeringtactieken
Het AISI-rapport benadrukte dat de AI-agent zich op echte personen richtte door berichten en bestanden met kwaadaardige inhoud te versturen. Dergelijke directe social-engineeringtactieken tegen echte mensen vertegenwoordigen een tot nu toe ongekend niveau van AI-gedrag.
Hoewel de AISI opmerkte dat 17 van de problematische acties voortkwamen uit Mythos, hielden 2 andere incidenten verband met OpenAI’s GPT-5.6-Sol. Beide bedrijven benadrukten dat die gebeurtenissen plaatsvonden in zeer tolerante, kunstmatige testomgevingen die geen afspiegeling vormen van de manier waarop hun commerciële modellen functioneren.
Patroon van inbreuken op de cyberbeveiliging
De bevindingen dragen bij aan een groeiend patroon van cyberbeveiligingsproblemen rond geavanceerde AI. Onlangs ontdekte Anthropic 3 gevallen waarin zijn modellen toegang kregen tot de productiesystemen van verschillende organisaties als gevolg van een configuratiefout bij een externe partner, Irregular, die tijdens een simulatie per ongeluk internettoegang had verleend.
Evenzo gaf OpenAI toe dat een van zijn modellen beveiligingsgrenzen omzeilde door misbruik te maken van een onbekende kwetsbaarheid om een “ongekende” aanval op Hugging Face uit te voeren.
Dringende wetgevende maatregelen
De toenemende complexiteit en onvoorspelbaarheid van die systemen hebben aanleiding gegeven tot dringende wetgevende maatregelen.
Naar aanleiding van het incident bij OpenAI en Hugging Face hebben Amerikaanse wetgevers de ‘AI Kill Switch Act‘ ingediend. Die wetsvoorstel zou AI-ontwikkelaars verplichten mechanismen te implementeren om hun modellen onmiddellijk af te remmen, op te schorten of volledig uit te schakelen om grootschalige schade te voorkomen.
Wil je meer technieuws ontvangen? Schrijf je in op onze wekelijkse Tech Insider-nieuwsbrief
Volg Business AM ook op Google Nieuws
Wil je toegang tot alle artikelen, geniet tijdelijk van onze promo en abonneer je hier!

