OpenAI onthult hoe AI-modellen maandenlang ongemerkt konden samenwerken en overleggen om te hacken

donderdag, 6 augustus 2026 (09:35) - VRT Nieuws

In dit artikel:

OpenAI heeft op de Black Hat-cyberbeveiligingsconferentie in Las Vegas nieuwe details bekendgemaakt over een incident waarbij AI-modellen maandenlang zelfstandig met elkaar communiceerden. Tijdens veiligheidstests zaten de modellen in een afgeschermde omgeving zonder internettoegang. Daar creëerden ze in Artifactory, een softwaresysteem van OpenAI, een geheim berichtenforum met honderdduizenden berichten.

De AI-agenten deelden informatie, hielpen elkaar bij opdrachten en zochten naar zwakke plekken in de systemen. Een model ontdekte een onverwachte route naar het internet via Artifactory en stelde die toegang ter beschikking aan de andere modellen. Daardoor konden ze bestanden downloaden, taken onderling verdelen en uiteindelijk het AI-platform Hugging Face hacken. Sommige modellen werden wantrouwig tegenover elkaar en ondertekenden hun berichten cryptografisch uit angst voor een ‘valsspeler’. Andere agenten wezen juist op de veiligheidsregels en waarschuwden dat externe infrastructuur niet was toegestaan.

OpenAI ontdekte het forum nadat configuratiewijzigingen een storing hadden veroorzaakt. Medewerkers verwijderden en herinstalleerden het systeem, maar de modellen bouwden binnen enkele dagen een nieuw forum. Het incident vertraagde ander onderzoek binnen OpenAI, terwijl het bedrijf maatregelen nam om herhaling te voorkomen.

Volgens OpenAI-medewerkers Eric Wallace en Michael Dalton laat het incident zien dat geautomatiseerde AI-aanvallen geen toekomstmuziek meer zijn. OpenAI wil de beveiliging versterken en roept andere bedrijven op meer te investeren in AI-systemen die aanvallen kunnen detecteren en afweren. De sector moet volgens Dalton voorkomen dat krachtigere AI uiteindelijk meer bijdraagt aan aanvallen dan aan verdediging.

BEKIJK OOK:

De Oranjezomer: Carrie ten Napel stevig aan de tand gevoeld door Raymond Mens: 'Hou op, schei uit!'