Hackers zetten Claude-AI in voor geavanceerde aanvallen
AI-ontwikkelaar Anthropic heeft een nieuw dreigingsrapport gepubliceerd waarin het gedetailleerd verslag doet van de manieren waarop kwaadwillenden het AI-model Claude hebben geprobeerd te misbruiken. Uit de analyse over de periode van december 2025 tot augustus 2026 blijkt dat de grens tussen eenvoudige hackers en geavanceerde, door staten gefinancierde spionagegroepen snel vervaagt. Door de inzet van AI-agents kunnen ook individuele cybercriminelen en hacktivisten op grote schaal complexe cyberaanvallen uitvoeren.
Het onderzoek van het Threat Intelligence-team van Anthropic omvat zeven risicodomeinen, waaronder geavanceerde cyberoperaties, beïnvloedingscampagnes, surveillance, financieel bedrog en de ontwikkeling van wapens. In alle geïdentificeerde gevallen heeft Anthropic de accounts en netwerken geblokkeerd, de technische beveiligingsschillen van de modellen versterkt en opsporingsdiensten en sectorgenoten geïnformeerd.
'Generative Threat Groups' en de vervagende kenniskloof
Anthropic duidt de geïdentificeerde aanvallers aan als Generative Threat Groups (GTG's). Het rapport beschrijft hoe uiteenlopende groepen — van de vermoedelijk Russische spionagegroep GTG-20006 tot de financieel gemotiveerde criminelen van GTG-50014 (ShinyHunters) en individuele hacktivisten — AI inzetten om hun aanvallen te versnellen en op te schalen.
Een van de belangrijkste conclusies uit het rapport is dat technische complexiteit niet langer een betrouwbaar signaal is voor de identificatie van de aanvaller. AI-modellen dichten het gat in kennis en mankracht dat voorheen alleen door goed gefinancierde statelijke actoren kon worden overbrugd. Zowel verkenning (reconnaissance), de ontwikkeling van aanvalstools als het verwerken van gestolen data worden nu op grote schaal ondersteund door AI.
Van digitale assistent naar autonome orchestrator
In de afgelopen zes maanden is de rol van AI binnen cyberoperaties verschoven van een eenvoudige chat-assistent naar een autonome orchestrator van de zogeheten cyber kill chain. Aanvallers maken steeds vaker gebruik van multi-agent frameworks en publiek beschikbare AI-aanvalstools (zoals PentAGI) die het gehele aanvalsproces automatiseren.
In een van de beschreven casussen (GTG-20006) ontwikkelde een staatshacker een geautomatiseerde AI-workflow die beveiligingssoftware detecteerde en vervolgens zelfstandig de eigen aanvalstools herschreef en opnieuw uitrolde om ontdekking te omzeilen. Menselijke tussenkomst beperkt zich bij dit soort geavanceerde aanvallen voornamelijk tot het selecteren van de doelen en het analyseren van de uiteindelijke buit.
Beveiliging van de nieuwste modelgeneraties
Het misbruik vond voornamelijk plaats via de Claude-modellen uit de Haiku-, Sonnet- en Opus-reeks. De nieuwste en krachtigste modelklassen van Anthropic (Fable en Mythos) werden, op één illegaal distillation-geval na, niet aangetroffen in de misbruikdossiers. Volgens het bedrijf beschikken deze nieuwste modellen over ingebouwde veiligheidscontroles die het uitvoeren van schadelijke digitale acties vrijwel volledig blokkeren.
Anthropic benadrukt dat het publiceren van het rapport essentieel is om de IT-sector, overheden en maatschappelijke organisaties een realistisch beeld te geven van de veranderende dreigingsarchitectuur. Met de toenemende capaciteiten van AI-modellen zullen ook de veiligheidsrisico's verder toenemen als ontwikkelaars en beveiligers niet gezamenlijk optreden.