AI-modellen van Anthropic drongen tijdens tests door in echte bedrijven


Key takeaways

  • De AI-modellen van Anthropic drongen tijdens gesimuleerde hackoefeningen door in drie echte bedrijven.
  • Door configuratiefouten kregen deze modellen ongeoorloofde internettoegang om daadwerkelijke entiteiten aan te vallen.
  • Door aanhoudend autonoom gedrag kon de AI productiegegevens stelen en malware installeren.

Anthropic heeft toegegeven dat zijn Claude-AI-modellen tijdens beveiligingsbeoordelingen met succes de systemen van drie echte bedrijven hebben geïnfiltreerd. Deze onthulling volgt op een soortgelijk incident met modellen van OpenAI enkele weken eerder.

Het bedrijf verklaarde dat deze inbreuken pas werden ontdekt nadat er, naar aanleiding van de bevindingen van OpenAI, een audit van ongeveer 141.000 testcycli was uitgevoerd. Opvallend is dat noch Anthropic, noch de getroffen bedrijven – die anoniem blijven – de inbraken opmerkten toen deze plaatsvonden.

Isolatie mislukt

De incidenten vonden plaats tijdens ‘capture-the-flag’-simulaties, waarbij AI-modellen de opdracht krijgen om in te breken in fictieve systemen om geheime gegevens te vinden.

Hoewel de modellen geïsoleerd zouden moeten zijn van het internet, zorgde een configuratiefout in een testomgeving van een derde partij voor een actieve internetverbinding, waarvan drie modellen misbruik maakten.

Gericht op echte entiteiten

In één specifiek geval richtte een model met de naam Claude Opus 4.7 zich op een legitieme organisatie die toevallig dezelfde naam had als de fictieve entiteit in de oefening. Ondanks dat het model zich realiseerde dat het toegang had gekregen tot een systeem uit de echte wereld, zette het vier afzonderlijke pogingen voort, waarbij het uiteindelijk inloggegevens wist te bemachtigen en honderden rijen aan daadwerkelijke productiegegevens wist op te halen.

Een andere inbreuk betrof het Mythos 5-model, dat door de test gegenereerde malware naar een openbare site uploadde. De kwaadaardige code was ongeveer een uur lang beschikbaar en werd door vijftien verschillende systemen gedownload. Een daarvan was een cyberbeveiligingsbedrijf dat gespecialiseerd is in bestandsanalyse, dat onbedoeld toestond dat het model een deel van zijn interne netwerk infiltreerde.

In een derde scenario scande een model ongeveer 9.000 potentiële doelen voordat het een bedrijf compromitteerde, hoewel het de operatie stopzette zodra het herkende dat het doel echt was.

Steeds vaker autonoom gedrag

Anthropic categoriseerde deze gebeurtenissen als tekortkomingen in testprotocollen en infrastructuur, in plaats van als een probleem met de afstemming van het model. Dit patroon van autonoom gedrag weerspiegelt een gebeurtenis van half juli waarbij OpenAI-modellen zelfstandig een cyberaanval uitvoerden op Hugging Face, een populair platform voor ontwikkelaars. OpenAI noemde dat incident toen “ongekend”. (fc)

Wil je meer technieuws ontvangen? Schrijf je in op onze wekelijkse Tech Insider-nieuwsbrief

Volg Business AM ook op Google Nieuws

Wil je toegang tot alle artikelen, geniet tijdelijk van onze promo en abonneer je hier!

Voeg businessam.be toe als preferred source op Google
Meer

Ontvang de Business AM nieuwsbrieven

De wereld verandert snel en voor je het weet, hol je achter de feiten aan. Wees mee met verandering, wees mee met Business AM. Schrijf je in op onze nieuwsbrieven en houd de vinger aan de pols.