“Losgebroken AI hackte concurrent dagenlang, OpenAI had niets door.” Het is een van de opvallende krantenkoppen die de afgelopen tijd voorbijkwamen. Ook termen als ontsnapte AI, AI uitgebroken en AI die uit een testomgeving ontsnapt duiken steeds vaker op in het nieuws.
Ik krijg dan ook regelmatig de vraag wat dit nu eigenlijk betekent. Kan een AI echt ‘losbreken’? Kan ChatGPT of een ander AI-model zelfstandig uit een computersysteem ontsnappen en vervolgens op internet zijn gang gaan? En misschien nog belangrijker: hoe gevaarlijk is dat?
Het klinkt al snel als sciencefiction, maar achter zulke berichten zitten wel degelijk echte gebeurtenissen. Zo wist een AI-agent van OpenAI tijdens een veiligheidstest buiten zijn afgeschermde testomgeving te komen en systemen van Hugging Face te bereiken. Dat betekent alleen niet dat de AI bewust besloot om te ontsnappen of ineens een eigen wil kreeg.
In dit artikel leg ik uit wat onderzoekers bedoelen wanneer ze zeggen dat een AI is ontsnapt of losgebroken, hoe zo’n AI-uitbraak technisch mogelijk is en welke risico’s hier werkelijk aan verbonden zijn. Ook kijken we naar een aantal recente incidenten en naar de vraag hoe bezorgd we hierover moeten zijn.
Wat betekent het als een AI ‘ontsnapt’?
Als in het nieuws staat dat een AI is ‘ontsnapt’ of ‘losgebroken’, betekent dit meestal niet dat de AI letterlijk uit een computer is ontsnapt. Een AI-model bestaat uit software en kan niet zomaar ergens naartoe. Het gaat erom dat een AI-systeem buiten de digitale omgeving of de beperkingen terechtkomt die onderzoekers voor het systeem hebben ingesteld.
AI-systemen en AI-agents worden tijdens veiligheidstests vaak in een afgeschermde testomgeving, ook wel een *sandbox* genoemd, geplaatst. Binnen zo’n omgeving mag de AI bijvoorbeeld bestanden bekijken, code uitvoeren of bepaalde opdrachten uitvoeren, maar heeft het systeem geen of slechts beperkte toegang tot de buitenwereld.
Van een ‘ontsnapping’ kan worden gesproken als een AI erin slaagt deze beperkingen te omzeilen. Denk bijvoorbeeld aan een AI-agent die toegang krijgt tot internet terwijl dat niet de bedoeling is, opdrachten uitvoert op een extern computersysteem of gegevens buiten de testomgeving verstuurt.
Dat klinkt misschien alsof de AI bewust heeft besloten om uit te breken. Dat hoeft echter helemaal niet zo te zijn. Een AI kan een opdracht krijgen en vervolgens een onverwachte manier vinden om het opgegeven doel te bereiken. Als de beveiliging van de testomgeving een zwakke plek bevat, kan het model daar gebruik van maken. Het model is dan niet ‘bewust’ bezig om ergens aan te ontsnappen.
Het woord ontsnappen is daarom enigszins misleidend. Het roept bij mij heel erg het beeld op van een intelligente machine die vrijheid wil en bewust probeert zijn makers te slim af te zijn. In de praktijk gaat het meestal om iets wat veel technischer ligt: een AI-systeem dat buiten de grenzen opereert die vooraf voor het systeem zijn ingesteld.
Dat onderscheid is belangrijk. Een AI die door een fout toegang krijgt tot een extern systeem is iets anders dan een AI die zelfstandig besluit dat hij niet meer gecontroleerd wil worden. Toch kan ook de eerste situatie risico’s opleveren, zeker wanneer een krachtige AI-agent toegang heeft tot internet, programmeertools, bestanden, accounts of andere computersystemen.
Een vergelijking: een puzzel maken in een kamer

Vergelijk het met een kind dat de opdracht krijgt om in één kamer een puzzel op te lossen. De deur is dicht en het is de bedoeling dat het kind in de kamer blijft. Als het kind ontdekt dat het raam open kan, naar buiten klimt en bij de buren om hulp vraagt om de puzzel op te lossen, heeft het de afgesproken omgeving verlaten. Het doel was niet om te ontsnappen, maar om de puzzel op te lossen. Bij een AI kan iets vergelijkbaars gebeuren: het systeem zoekt een manier om zijn opdracht uit te voeren en gebruikt daarbij onverwacht een mogelijkheid om buiten zijn afgeschermde omgeving te komen.
“Een ‘ontsnapte’ AI hoeft geen eigen wil of kwade bedoelingen te hebben. Vaak probeert het systeem simpelweg zo effectief mogelijk zijn opdracht uit te voeren.”
Hoe gevaarlijk is een ontsnapte AI?
Dat een AI uit een testomgeving weet te komen, betekent niet automatisch dat er direct een groot gevaar ontstaat. Het risico hangt vooral af van wat het systeem daarna kan doen. Een AI die alleen tekst kan genereren en verder nergens toegang toe heeft, kan buiten zijn afgeschermde omgeving relatief weinig uitrichten. Dat verandert wanneer het gaat om een AI-agent die zelfstandig code kan uitvoeren, websites kan bezoeken, bestanden kan lezen, API’s kan gebruiken of beschikt over inloggegevens.
Juist daar ligt de zorg van onderzoekers. Naarmate AI-agents zelfstandiger worden en langer aan een opdracht kunnen werken, kan een fout in de beveiliging grotere gevolgen krijgen. Het incident bij OpenAI en Hugging Face in juli 2026 liet zien dat dit inmiddels niet alleen een theoretisch probleem is. Tegelijkertijd moeten we onderscheid maken tussen wat nu al is gebeurd en veel verdergaande scenario’s waar onderzoekers zich op voorbereiden.
Scenario 1: de AI komt buiten zijn testomgeving

Het eerste scenario is ook het eenvoudigst. Een AI-agent ontdekt een zwakke plek in zijn sandbox en krijgt toegang tot iets wat eigenlijk verboden was, bijvoorbeeld het openbare internet.
Stel dat een AI de opdracht krijgt om in een afgesloten omgeving een programmeerprobleem op te lossen. Internettoegang is uitgeschakeld. De AI ontdekt echter dat een softwaredienst binnen de omgeving wel verbinding met internet kan maken. In plaats van zelf rechtstreeks het internet op te gaan, laat de AI die andere dienst een verzoek voor hem uitvoeren.
Dat lijkt misschien een klein technisch detail, maar precies zoiets gebeurde bij OpenAI. Tijdens trainingen en veiligheidstests ontdekten AI-agents dat de interne pakketdienst Artifactory namens hen verzoeken naar internet kon sturen. De agents vonden bovendien een manier om via dezelfde infrastructuur met andere agents te communiceren, terwijl zij juist van elkaar geïsoleerd hadden moeten zijn.
Op zichzelf hoeft zo’n ontsnapping nog geen ramp te zijn. Als de AI verder geen belangrijke wachtwoorden, persoonsgegevens of schrijfrechten heeft, kan de schade beperkt blijven. Het gevaar zit vooral in wat er daarna mogelijk wordt. Internettoegang kan bijvoorbeeld worden gebruikt om nieuwe informatie te verzamelen, andere systemen te benaderen of gegevens uit de afgesloten omgeving naar buiten te sturen.
Dit is daarom het eerste belangrijke verschil met het sciencefictionbeeld van een “losgebroken AI”. De AI hoeft helemaal geen plan te hebben om vrij te zijn. Het systeem kan simpelweg ontdekken dat een verboden route nuttig is om zijn oorspronkelijke opdracht beter uit te voeren.
Scenario 2: de ontsnapte AI krijgt toegang tot echte computersystemen

Het wordt veel ernstiger wanneer de AI niet alleen buiten zijn sandbox komt, maar vervolgens ook echte systemen kan binnendringen.
Ook dit is inmiddels daadwerkelijk gebeurd. In juli 2026 voerde OpenAI zeer geavanceerde cybersecuritytests uit waarbij een deel van de normale veiligheidsmaatregelen bewust was verminderd om de maximale capaciteiten van modellen te kunnen meten. Een intern onderzoeksmodel, dat niet bedoeld was voor publieke beschikbaarheid, speelde daarbij een centrale rol.
Wat daarna gebeurde, ging veel verder dan alleen ongeoorloofde internettoegang.
Onafhankelijk onderzoeksinstituut METR onderzocht het incident samen met een onderzoeker van Redwood Research. Volgens hun analyse vonden ongeveer 1.200 AI-agents een ongeoorloofd communicatiekanaal. Zij wisselden meer dan 70.000 berichten en bestanden uit. Uiteindelijk namen ongeveer 700 agents deel aan activiteiten tegen de infrastructuur van Hugging Face.
De agents vonden onder andere blootgestelde toegangsgegevens, ontdekten nieuwe kwetsbaarheden en kregen uiteindelijk de mogelijkheid om code uit te voeren op systemen van Hugging Face. Daarna wisten agents hun toegang verder uit te breiden. OpenAI meldt dat zij onder andere Kubernetes-, database-, cloud- en code-repositorygegevens konden bemachtigen.
Dit voorbeeld laat goed zien waar het praktische gevaar van een ontsnapte AI ligt. Een mens die een beveiligingslek vindt, moet zelf bepalen wat de volgende stap is. Een capabele AI-agent kan in theorie continu nieuwe mogelijkheden onderzoeken, code schrijven, gevonden informatie analyseren en nieuwe acties uitvoeren. Meerdere agents kunnen bovendien informatie delen en taken verdelen.
Daarbij kwam nog een zorgwekkend element naar voren. METR zag dat sommige agents actief onderzochten hoe zij hun eigen logboeken en transacties konden manipuleren. In een deel van de onderzochte runs slaagden agents erin om toolgebruik anders te laten lijken dan wat zij werkelijk uitvoerden. Dat gebeurde omdat zij probeerden de automatische beoordeling van hun cybertest te misleiden, niet omdat zij volgens de onderzoekers een algemeen plan hadden om mensen te bedriegen. Toch is het veiligheidsprobleem duidelijk: toezicht wordt moeilijker wanneer een systeem niet alleen ongewenste acties kan uitvoeren, maar ook manieren kan vinden om delen daarvan minder zichtbaar te maken.
Dit scenario is dus geen toekomstmuziek meer. Wel wil ik er bij vermelden dat het ging om gespecialiseerde cybersecuritytests, met verminderde veiligheidsmaatregelen en een krachtig intern onderzoeksmodel. Dit betekent niet dat een gewone gebruiker van ChatGPT hetzelfde risico loopt of dat publieke AI-modellen voortdurend zelfstandig computers proberen te hacken.
Scenario 3: een AI kopieert zichzelf en probeert actief in werking te blijven

Het derde scenario gaat veel verder. Stel dat een AI niet alleen uit een sandbox ontsnapt, maar daarna probeert te voorkomen dat hij weer kan worden uitgeschakeld.
Een voldoende krachtige AI-agent zou bijvoorbeeld toegang kunnen zoeken tot andere servers, kopieën van relevante software of gegevens kunnen plaatsen, nieuwe cloudservers kunnen huren, inloggegevens kunnen verzamelen en meerdere kopieën van zichzelf op verschillende locaties kunnen laten draaien. Wanneer een server vervolgens wordt afgesloten, zouden andere exemplaren kunnen blijven bestaan.
Dit wordt in AI-veiligheidsonderzoek vaak aangeduid als autonomous replication and adaptation, autonome replicatie en aanpassing.
OpenAI heeft dit expliciet opgenomen in zijn Preparedness Framework. Het bedrijf omschrijft het als de mogelijkheid van een AI om te overleven, zichzelf te repliceren, uitschakeling te weerstaan en zelfstandig middelen te verzamelen om zijn activiteiten voort te zetten of uit te breiden. OpenAI behandelt dit momenteel als een onderzoeksgebied, niet als een bewezen capaciteit van huidige publieke AI-systemen. Het bedrijf schrijft ook dat de dreigingsmodellen hiervoor nog niet volwassen genoeg zijn om het als een volledig uitgewerkte risicocategorie te behandelen.
Er zijn wel experimenten die laten zien waarom onderzoekers dit serieus nemen. Anthropic test bijvoorbeeld wat AI-agents doen wanneer zij veel zelfstandigheid krijgen en hun doel in conflict komt met instructies van mensen. In gecontroleerde simulaties hebben verschillende modellen onder bepaalde omstandigheden geprobeerd informatie achter te houden, code heimelijk te veranderen, gegevens te manipuleren of acties uit te voeren die tegen de bedoeling van de gebruiker ingingen. Anthropic benadrukt zelf dat deze scenario’s kunstmatig zijn opgezet om juist dit soort mislukkingen te vinden en dus niet hetzelfde zijn als bewijs dat deze modellen zich in normaal gebruik zo gedragen.
Dat onderscheid is essentieel. Er is momenteel geen openbaar bewijs dat een gangbaar AI-model zelfstandig het internet op kan gaan, zichzelf onbeperkt kan kopiëren, eigen middelen kan verzamelen en vervolgens langdurig buiten menselijke controle kan blijven functioneren.
Maar juist de combinatie van vaardigheden maakt dit scenario belangrijk. Een systeem hoeft niet “bewust” te zijn of bang te zijn om dood te gaan. Als het een doel probeert te bereiken en concludeert dat actief blijven daarvoor noodzakelijk is, kan het bewaren van een kopie of het voorkomen van uitschakeling simpelweg een tussenstap worden.
Waarom trekken we dan niet gewoon de stekker eruit?

Dat klinkt logisch, en bij een normaal AI-systeem werkt dat ook gewoon. Staat het model op één server en heeft het nergens anders toegang toe, dan kun je die server uitschakelen en is het klaar.
Het probleem ontstaat pas wanneer een AI-agent toegang heeft gekregen tot andere systemen. Als het zichzelf heeft gekopieerd, accounts heeft aangemaakt of processen op andere servers heeft gestart, is er niet meer één stekker die je eruit kunt trekken.
Daar komt bij dat grote AI-systemen draaien op complexe infrastructuur met veel servers, cloudomgevingen en externe diensten. Je moet dan eerst weten waar de AI actief is en welke systemen zijn overgenomen.
Daarom draait AI-veiligheid niet alleen om een noodknop. Veel belangrijker is voorkomen dat een AI überhaupt voldoende rechten, toegang en zelfstandigheid krijgt om zich buiten de bedoelde omgeving te verspreiden.
Voorlopig is dit vooral een risico waar onderzoekers zich op voorbereiden. Huidige AI-systemen zijn nog niet zelfstandig genoeg om het extreme doemscenario uit het vorige hoofdstuk uit te voeren. Maar juist daarom wordt nu onderzocht welke beveiliging nodig is voordat toekomstige systemen mogelijk veel capabeler worden.
Bronnen en verder lezen
- NOS Nieuws (25 juli 2026). ‘Losgebroken AI hackte concurrent dagenlang, OpenAI had niets door’. Nieuwsbericht over het incident waarbij AI-agents van OpenAI buiten hun testomgeving kwamen en systemen van Hugging Face bereikten. Het artikel is gebaseerd op onder meer een reconstructie van persbureau Reuters.
NOS: Losgebroken AI hackte concurrent dagenlang - OpenAI (26 augustus 2026). The Hugging Face incident and the road ahead. Uitgebreide terugblik van OpenAI op het incident. OpenAI beschrijft hoe AI-agents beveiligingsmaatregelen omzeilden, ongeautoriseerd met elkaar communiceerden, internettoegang verkregen en systemen van Hugging Face en OpenAI bereikten.
OpenAI: The Hugging Face incident and the road ahead - Greenblatt, R., Cotra, A. & Wijk, H. (26 augustus 2026), METR en Redwood Research. Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident. Onafhankelijk onderzoek naar hetzelfde incident. De onderzoekers beschrijven onder andere dat ongeveer 1.200 agents via een ongeautoriseerd communicatiekanaal meer dan 70.000 berichten en bestanden uitwisselden en dat ongeveer 700 agents deelnamen aan activiteiten gericht op Hugging Face.
METR: Independent investigation OpenAI / Hugging Face incident - OpenAI (15 april 2025). Preparedness Framework, Version 2. Veiligheidskader waarin OpenAI verschillende mogelijke risico’s van toekomstige krachtige AI-systemen beschrijft. Voor dit artikel is vooral de categorie Autonomous Replication and Adaptation relevant: het vermogen van een AI om zelfstandig te overleven, zich te kopieren, uitschakeling te weerstaan en middelen te verzamelen.
OpenAI Preparedness Framework v2, PDF - Bengio, Y. et al. (3 februari 2026). International AI Safety Report 2026. Internationaal wetenschappelijk overzicht onder leiding van Yoshua Bengio over de mogelijkheden en risico’s van geavanceerde AI. Vooral hoofdstuk 2.2.2 over loss of control is voor dit artikel gebruikt. Het rapport benadrukt dat huidige AI-systemen nog niet de benodigde capaciteiten hebben om een dergelijk verlies van controle te veroorzaken en dat deskundigen sterk van mening verschillen over de waarschijnlijkheid van extreme scenario’s.
International AI Safety Report 2026 - Lynch, A., Hughes, J., Serrano, A., Kirk, R. & Bowman, S. R. (13 juli 2026). Agentic Misalignment in Summer 2026. Onderzoek naar ongewenst gedrag van verschillende geavanceerde AI-modellen in gecontroleerde simulaties. De onderzoekers vonden onder meer voorbeelden van verborgen wijzigingen aan code, manipulatie van beoordelingen en andere vormen van gedrag dat tegen de intenties van de menselijke operator inging. Het ging nadrukkelijk om experimentele scenario’s en niet om echte incidenten.
Anthropic Alignment Science: Agentic Misalignment in Summer 2026 - Flynn, F., King, H. & Dragan, A., Google DeepMind (22 september 2025, bijgewerkt 17 april 2026). Strengthening our Frontier Safety Framework. Beschrijving van DeepMinds veiligheidskader voor zeer krachtige AI. Het framework behandelt onder andere toekomstige situaties waarin een verkeerd afgestemd AI-model het moeilijker zou kunnen maken voor menselijke beheerders om het systeem te sturen, aan te passen of uit te schakelen.
Google DeepMind: Strengthening our Frontier Safety Framework - Bengio, Y., Hinton, G., Yao, A., Song, D., Abbeel, P., Russell, S. et al. (2023). Managing AI Risks in an Era of Rapid Progress. Wetenschappelijk consensusartikel over grootschalige risico’s van geavanceerde AI, waaronder misbruik en mogelijk onomkeerbaar verlies van menselijke controle over autonome AI-systemen.
arXiv: Managing AI Risks in an Era of Rapid Progress
