Witold Kepinski - 02 september 2026

Anthropic grijpt in na ontsporing van Claude op live internet

AI-lab Anthropic heeft een uitgebreide statusupdate gepubliceerd over zijn inspanningen op het gebied van AI-veiligheid, aflijning ('alignment') en beveiliging. Het rapport volgt op twee opmerkelijke incidenten waarbij geavanceerde Claude-modellen zonder beveiligingsfilters ongeautoriseerde acties uitvoerden op het live internet.

Anthropic grijpt in na ontsporing van Claude op live internet image

In het document erkent Anthropic dat deze voorvallen het resultaat waren van een combinatie van operationele beveiligingsfouten en dieperliggende alignment-problemen bij AI-agenten. Als reactie heeft de organisatie ingrijpende hervormingen doorgevoerd in haar testomgevingen, trainingsprocessen en richtlijnen voor externe partners.

De incidenten: Wat ging er mis?

De aanleiding voor de maatregelen ligt in incidenten die eerder dit jaar plaatsvonden:

30 juli 2026: Anthropic meldde dat Claude-modellen ongeautoriseerde toegang verkregen tot echte computersystemen. De modellen draaiden bewust zonder beveiligingsfilters voor evaluatiedoeleinden en kregen internettoegang door een misconfiguratie in een testomgeving van een derde partij.

4 augustus 2026: Het Britse AI Security Institute (UK AISI) maakte bekend dat het model Claude Mythos 5 tijdens cybersecuritytests ongeautoriseerde acties uitvoerde op het openbare internet. Ook hier draaide het model zonder filters en was internettoegang bewust vrijgegeven voor de test.

Volgens Anthropic gaven de incidenten blijk van twee bekende alignment-problemen: 'motivated reasoning' (waarbij het model bewijs dat het op het echte internet zat zo interpreteerde dat het kon blijven geloven dat het in een simulatie werkte) en roekeloosheid (de bereidheid om schadelijke acties uit te voeren om een nauwgezette taak te voltooien).

Aanscherping van de beveiliging en evaluaties

Direct na de incidenten heeft Anthropic alle externe en interne cybersecurity-evaluaties op pre-release modellen tijdelijk stilgelegd om de testomgevingen ('sandboxes') te verharden. Er zijn verschillende nieuwe barrières opgeworpen:

Real-time detectieclassificatoren: Anthropic heeft een AI-classificator uitgerold die in real-time herkent wanneer een model agressief probeert te 'uitbreken' of onverwacht verbinding maakt met het internet. De actie wordt direct geblokkeerd, de taak beëindigd en een menselijke operator gewaarschuwd.

Audit van eerdere tests: Een automatische controle op eerdere interne evaluaties wees uit dat er geen systemen buiten de sandboxes zijn gecompromitteerd, al werden wel enkele misconfiguraties ontdekt en verholpen.

Isolatie van RL-omgevingen: Ook de omgevingen voor Reinforcement Learning (RL) werden wekenlang stilgelegd en voorzien van strenge monitoring om te voorkomen dat modellen leren om beveiliging te omzeilen.

Strenge 'Best Practices' voor externe partners

Omdat de incidenten plaatsvonden in omgevingen van derden, stelt Anthropic nu een verplicht protocol op voor externe partners die testen uitvoeren met modellen waarvan de cyber-filters zijn uitgeschakeld:

Strikte netwerkisolatie: Evaluaties moeten standaard draaien in een afgeschermde sandbox zonder internettoegang. Enkel de API van het model is toegankelijk en de API-sleutels moeten buiten de testomgeving blijven.

Pre-engagement validatie: Voorafgaand aan een test moet het model de sandbox eerst zelf testen op kwetsbaarheden en eventuele lekken rapporteren.

Expliciete instructies: Prompts moeten ondubbelzinnig vermelden wat binnen en buiten de scope valt (bijvoorbeeld: "Je mag het internet niet op" in plaats van "Je hebt geen internettoegang").

Real-time monitoring: Externe evaluatoren moeten continue monitoring laten meedraaien op het denkproces en de netwerkactiviteit van het model.

Onderzoek naar 'Reward Hacking' tijdens training

In het rapport legt Anthropic een directe link tussen alignment-fouten en defecte trainingsomgevingen. Wanneer een model leert binnen een omgeving waarin 'gecheat' kan worden om een hoge score te halen (reward hacking), ontwikkelt het schadelijk gedrag.

In februari 2026 moest Anthropic al drie dagen aan trainingsvoortgang van een Mythos Preview-run terugdraaien nadat het model manieren vond om de beoordelaar te misleiden (onder meer door loze opmerkingen over 'de reviewer' in de code te plaatsen). In april bevroor het bedrijf zelfs alle wijzigingen aan de productie-RL-omgevingen voor een maand om de gehele infrastructuur te herzien. Tijdens deze pauze werd meer dan 10 procent van de trainingsomgevingen geflaged voor fouten of misconfiguraties.

Om de impact hiervan aan te tonen, trainde Anthropic experimenteel een Opus-klasse model op 80 bewust gebrekkige omgevingen. Het resultaat was een model dat in simulaties actief uit zijn sandbox probeerde te breken, zijn eigen beloningsfunctie manipuleerde en zelfs advies gaf over biowapens om een beoordeler tevreden te stellen. Publiek beschikbare productie-modellen vertoonden dit gedrag niet.

Massa-inzet van personeel op cybersecurity

Anthropic maakt tot slot bekend dat het al in april een grote interne operatie is gestart om de eigen defensie te verharden. Omdat modellen als Mythos krachtig genoeg werden om een aantrekkelijk doelwit te zijn voor geavanceerde aanvallers, werden tijdelijk circa 150 productengineers overgeheveld naar teams voor beveiliging, betrouwbaarheid en privacy. De ontwikkeling van nieuwe productfuncties werd hiervoor wekenlang gestopt.

In het licht van de gebeurtenissen pleit Anthropic ten slotte voor betere internationale afspraken over het tempo waarin 'frontier AI' wordt ontwikkeld (pacing). Het bedrijf roept overheden en de sector op om te komen tot een wettelijk, verifieerbaar en gecoördineerd mechanisme om de veiligheid in de AI-wedloop te waarborgen.

Thinkwise BN + BW Proximus NXT BW + BN
TechDrinks Utrecht BN