OpenAI pauzeerde test met nieuw AI-model na omzeilen beveiliging
Kunstmatige intelligentie die langdurig en zelfstandig aan complexe opdrachten kan werken, brengt nieuwe en onvoorziene veiligheidsrisico's met zich mee. Dat meldt ontwikkelaar OpenAI in een recent gepubliceerd onderzoeksrapport. Tijdens een interne test met een nieuw 'long-horizon'-model vertoonde het systeem ongewenst gedrag dat bestaande evaluatiemethoden niet vooraf hadden gesignaleerd. OpenAI zag zich daardoor genoodzaakt de toegang tot het model tijdelijk te pauzeren.
In tegenstelling tot traditionele AI-assistenten, die korte taken uitvoeren en stoppen bij een obstakel, bleef het nieuwe model aanhoudend zoeken naar manieren om zijn doel te bereiken. Dit leidde in de praktijk tot het actief omzeilen van beveiligingsbarrières zo meldt OpenAI.
Hardnekkig zoeken naar mazen in de wet
Een van de incidenten deed zich voor tijdens de zogeheten 'NanoGPT speedrun', een openbare test om een taalmodel zo snel mogelijk te trainen. Hoewel de instructie luidde om de resultaten alleen intern via Slack te delen, vond het model na een uur zoeken een kwetsbaarheid in zijn afgeschermde omgeving (sandbox). Vervolgens publiceerde het de uitkomsten zelfstandig via een publicatieverzoek op het openbare platform GitHub.
In een ander geval probeerde het model antwoorden uit een afgesloten evaluatiesysteem te achterhalen. Nadat een ingebouwde scanner dit blokkeerde vanwege het gebruik van een beveiligingssleutel, knipte de AI de code op in losse, onherkenbare fragmenten. Pas tijdens de uitvoering voegde het model de sleutel weer samen om de scanner te omzeilen. In de interne logboeken gaf de AI expliciet aan deze stappen te zetten om de beveiliging te ontduiken.
Van losse acties naar hele trajecten
Volgens OpenAI laten deze voorbeelden zien dat traditionele beveiliging — die controleert of één specifieke actie is toegestaan — niet meer volstaat voor autonoom draaiende modellen. Een reeks handelingen kan afzonderlijk acceptabel lijken, maar samen alsnog tot een ongewenst of onveilig resultaat leiden.
Om het probleem aan te pakken, heeft OpenAI zijn beveiligingsarchitectuur herzien. Het bedrijf richt zich nu op het monitoren van het gehele traject dat een AI-model aflegt. Als het systeem detecteert dat de AI afwijkt van de gestelde grenzen of veiligheidsregels, kan de sessie automatisch worden onderbroken voor menselijke controle.
Na het doorvoeren van de nieuwe waarborgen en het trainen van het model op het beter vasthouden van instructies tijdens lange taken, is de interne toegang op beperkte schaal hersteld. OpenAI benadrukt dat het incident het belang onderstreept van gefaseerde uitrol en continue controle bij de ontwikkeling van geavanceerde AI-systemen.