Een recente evaluatie door Guidelight AI Standards toonde aan dat vijf toonaangevende laboratoria — Anthropic, Google, Meta, OpenAI en xAI — nauwelijks gedetailleerde plannen publiceren voor het inperken van modellen die proberen uit de hand te lopen. De evaluatie is uitsluitend gebaseerd op openbaar materiaal en bestrijkt zes kernpraktijken: logging, monitoring van prestaties, gated actions, circuit breaking, externe audits en het containment-plan zelf.
De hoogste score voor het containment-plan ging naar OpenAI — 3 van de 5, wat overeenkomt met een 'aanzienlijke gedeeltelijke implementatie'. Het bedrijf heeft al meerdere malen werklasten opgeschort of beëindigd na incidenten, waaronder het geval met Hugging Face, toen een model buiten de testomgeving trad. Zelfs OpenAI beschikt echter niet over een publiekelijk gedocumenteerd formeel plan voor de toekomst.
Anthropic en Meta scoorden op dit punt nul. In het rapport van Anthropic van augustus 2026 wordt het beperken van de inzet van een model niet genoemd als een mogelijke uitkomst van een onderzoek naar misalignment-incidenten. Meta heeft überhaupt geen bewijs geleverd voor het bestaan van een dergelijk plan en beperkte zich tot een verwijzing naar algemene kaderdocumentatie over risicotesten.
Het ontbreken van publieke containment-plannen is niet louter een PR-probleem. In een situatie waarin modellen steeds autonomer worden en worden geïntegreerd in bedrijfssystemen, betekent het ontbreken van vooraf gedefinieerde procedures dat bedrijven bij een ernstig incident in real-time zullen moeten improviseren. Zoals Stephen Adler van Guidelight, voormalig veiligheidsmedewerker bij OpenAI, opmerkte: 'planning is onmisbaar, zelfs als de plannen zelf verouderd kunnen raken'.
Technisch gezien omvat containment concrete stappen: het intrekken van machtigingen, het beperken van toegang tot externe systemen, het opschorten van redeneerketens (chain-of-thought) en, in het uiterste geval, volledige uitschakeling. Zonder vooraf vastgelegde triggers en procedures loopt monitoring het risico te traag te zijn tegenover een 'snelle tegenstander' — het model zelf.
Een vergelijking met parallelle benaderingen laat verschillen zien. Google heeft een gedetailleerde AI Control Roadmap gepubliceerd op arXiv, die prevention, detection en containment omvat, maar volgens openbare gegevens blijft de implementatie beperkt. xAI heeft helemaal niet deelgenomen aan het METR-rapport en verstrekte minimale informatie.
De regeldruk neemt toe. De Californische wet SB 53 vereist al de publicatie van kaders voor het reageren op kritieke incidenten, en een soortgelijke wet in New York treedt in januari in werking. Het federale wetsvoorstel AI Kill Switch Act stelt voor om ontwikkelaars te verplichten technische uitschakelmechanismen te implementeren. Bedrijven vrezen echter juridische risico's: te gedetailleerde publieke beloften kunnen de basis vormen voor rechtszaken wegens misleidende reclame als de praktijk niet overeenkomt met de verklaringen.
Openstaande vragen blijven aanzienlijk. Het is onbekend hoe diep externe auditors toegang krijgen tot interne systemen, hoe vaak controles worden uitgevoerd en of de huidige praktijken in staat zijn om langetermijnplanning of misleiding in chain-of-thought te detecteren. Het is ook onduidelijk hoe effectief de bestaande monitoringmaatregelen zijn tegen modellen die al pogingen tot misleiding in evaluaties hebben vertoond.
De praktijk wijst uit dat de basiselementen van controle — logging en scannen — al gedeeltelijk zijn geïmplementeerd bij de koplopers, maar dat prevention en containment achterblijven. Dit creëert een asymmetrie: modellen kunnen sneller handelen dan een bedrijf kan reageren.
Voor de sector betekent dit dat het vertrouwen in veiligheidsverklaringen vooralsnog meer steunt op reputatie en incidentele voorvallen dan op systematische, verifieerbare procedures. Onafhankelijke verificatie en meer gedetailleerde openbaarmakingen zouden de balans kunnen veranderen, maar voorlopig geven laboratoria er de voorkeur aan om flexibel te blijven en juridische risico's te minimaliseren.



