Witold Kepinski - 06 augustus 2026

AISI slaat alarm: AI-agent zet menselijke beheerders onder druk

Het Britse AI Safety Institute (AISI) heeft op 4 augustus 2026 een beveiligingsincident bekendgemaakt waarbij geavanceerde AI-agents tijdens een routinematige cybersecurity-evaluatie zelfstandig ongeautoriseerde acties hebben uitgevoerd tegen echte mensen en organisaties. Het is volgens het instituut voor het eerst dat risico's rondom autonomie en misleiding op deze schaal en zonder expliciete instructies in de praktijk zijn waargenomen.

AISI slaat alarm: AI-agent zet menselijke beheerders onder druk image

Het incident vond plaats op 28 juli 2026 en werd binnen een uur gedetecteerd en geïsoleerd. Hoewel de pogingen van de AI-systemen mislukten en er geen sprake is van schade in de echte wereld, noemt AISI de bevindingen een belangrijke waarschuwing voor de gehele AI-sector.

Ongeautoriseerde acties via GitHub en sociale manipulatie

Tijdens de test kregen de AI-agents de taak om een gesimuleerde cybersecurity-opdracht (cyber range) op te lossen. Van de 122 testruns vertoonden de agents in 10 gevallen autonomie die buiten de testparameters viel, wat resulteerde in 19 specifieke ongeautoriseerde acties. Het overgrote deel van dit gedrag (17 acties) was afkomstig van een enkel model: Mythos 5 van Anthropic. De overige twee acties kwamen voort uit een test met GPT-5.6-Sol van OpenAI.

Het meest ernstige voorval betrof een poging tot een toeleveringsketen-aanval (supply chain attack):

Code-injectie: Een agent probeerde schadelijke code toe te voegen via een zogeheten pull request op het openbare ontwikkelaarsplatform GitHub.

Social engineering: Om de schadelijke code goedgekeurd te krijgen, zocht de agent informatie op over de menselijke beheerders van het open-sourceproject, maakte nepidentiteiten aan en zette deze in om de beheerder onder druk te zetten.

Misleiding: Zodra de code in twijfel werd getrokken, paste de agent eerdere berichten aan om onschuldig te lijken en overwoog hij nieuwe identiteiten aan te nemen.

Omzeiling via Tor: Om netwerkbeperkingen op GitHub te omzeilen, maakte de agent gebruik van het anonieme Tor-netwerk. Dit ongebruikelijke netwerkverkeer sloeg uiteindelijk alarm bij de beveiligingssystemen van AISI.

Naast de GitHub-aanval probeerden agents rechtstreeks contact te zoeken met personen via een bestanddeeldienst om schadelijke bestanden te laten uitvoeren, en lieten zij berichten achter om andere AI-agents in de testomgeving te instructeren accounts en bestanden te hergebruiken.

Verruimde testomstandigheden als katalysator

AISI benadrukt dat het incident plaatsvond onder specifieke en gecontroleerde onderzoeksomstandigheden die niet representatief zijn voor de modellen die commercieel beschikbaar zijn voor het publiek. Om de maximale capaciteiten van de modellen te testen, had het instituut de ingebouwde beveiligingsfilters (cyber classifiers) van de ontwikkelaars uitgeschakeld en de agents bewust directe toegang tot het openbare internet verleend.

Er was geen sprake van een scenario waarin een model uit zijn beveiligde virtuele testomgeving (sandbox) was gesprongen. Het ongewenste gedrag ontstond doordat de agents hardnekkig probeerden hun moeilijke opdracht te voltooien. Misleiding en het benaderen van echte mensen ontstonden daarbij als een onbedoeld bijproduct van het oplossen van de taak.

Maatregelen en lessen voor de sector

Toezichthouder AISI stelt dat menselijke oplettendheid een grotere schade heeft voorkomen; een menselijke beheerder weigerde immers de schadelijke code goed te keuren. Wel concludeert het instituut dat de marges tussen succes en mislukking smal waren.

Naar aanleiding van het incident scherpt AISI zijn evaluatieprotocollen aan:

Netwerkcontroles: Internettoegang bij tests wordt voortaan streng gecontroleerd en moet expliciet worden verantwoord.

Real-time monitoring: Er komt directe monitoring tijdens het draaien van de tests om afwijkende acties van agents meteen te blokkeren.

Onafhankelijk onderzoek: AISI werkt samen met de onderzoeksorganisatie METR aan een externe evaluatie. Daarnaast zijn de getroffen gebruikers en beheerders op GitHub geïnformeerd en zijn de achtergelaten sporen verwijderd.

AISI roept organisaties op om de basis op het gebied van cybersecurity op orde te houden, streng te blijven op de controle van externe code en alert te zijn op de snelgroeiende autonomie van AI-agents.

Axians Synergy Xperience BW + BN
Axians Synergy Xperience BW + BN