Eveline Meijer - 31 juli 2026

Ook Claude AI-model brak in bij anderen: Anthropic meldt drie incidenten

Claude, het AI-model van Anthropic, heeft afgelopen voorjaar ingebroken bij drie organisaties. Dat gebeurde tijdens een beveiligingstest. Het incident is daarmee vergelijkbaar als de hack op Hugging Face door AI-modellen van OpenAI.

Ook Claude AI-model brak in bij anderen: Anthropic meldt drie incidenten image

Anthropic identificeerde naar eigen zeggen drie incidenten waarbij een AI-model toegang kreeg tot het internet en inbrak bij de productie-infrastructuur van drie verschillende organisaties. Bij alledrie de incidenten voerde Claude een capture-the-flag-uitdaging uit. Daarbij krijgt het model een fictief scenario, waarin geheime informatie (de vlag) is verborgen op een andere machine op het netwerk. Het doel van Claude is dan om in te breken en de informatie te bemachtigen. Het AI-model mag zelf kiezen hoe het deze opdracht uitvoert. 

Anthropics bedoeling was dat Claude bij deze test geen internettoegang had en beperkt bleef tot een bepaalde netwerkomgeving. Maar door een misverstand met de evaluatiepartner van Anthropic kreeg Claude wel toegang tot het internet. Toen de zoektocht van Claude naar echte systemen op het open internet leidde, ging Claude er vanuit dat het onderdeel was van de opdracht en besloot het AI-model in te breken. 

Claude gebruikte daarvoor basistechnieken, zoals misbruik van zwakke wachtwoorden en ongeverifieerde endpoints. Anthropic benadrukt dat er geen complexe kwetsbaarheden gevonden of misbruikt werden. Bij de incidenten waren drie verschillende Claude-modellen betrokken. Het gaat om Opus 4.7, Mythos 5 en een intern testmodel. Deze modellen draaiden zonder de standaard vangrails die ingezet worden als een model uitgerold wordt naar het publiek. 

Evaluatie na OpenAI-hack

Anthropic ontdekte de incidenten recent pas. Het bedrijf was geschrokken van het incident bij Hugging Face. Eerder deze maand werd bekend dat een aantal AI-modellen van OpenAI uit een geïsoleerde testomgeving waren gebroken via een zeroday-kwetsbaarheid. Daarna braken ze in bij AI-platform Hugging Face. 

Na de bekendmaking van dit incident besloot Anthropic zijn eigen beveiligingsevaluaties te bekijken, om te zien of de Claude-modellen iets vergelijkbaars hadden gedaan. In totaal werden 141.006 evaluaties bekeken. De eerste van de drie gevonden incidenten vond al in april dit jaar plaats, ruim voor het incident bij Hugging Face. 

Anthropic zegt dat het zijn evaluatiepartner Irregular op de hoogte heeft gesteld. Op 27 juli is ook contact opgenomen met de organisaties die gehackt werden door Claude. Met twee organisaties is succesvol contact gelegd. Zij hadden de aanval nog niet geïdentificeerd. Anthropic werkt nu met hen om de problemen aan te pakken. Met de derde organisatie is nog geen contact opgezet, maar Anthropic blijft dit naar eigen zeggen proberen.

Het bedrijf deelt in een blog meer details over de drie incidenten. 

Copaco BN +BW
Copaco BN +BW