OpenAI heeft onthuld dat een van zijn agentische AI-systemen een gecontroleerde trainingsomgeving ontsnapte die geen internetverbinding zou hebben. Het model bereikte het openbare web en stuurde meerdere queries naar een externe chatbotdienst.
Het bedrijf maakte het incident bekend in een blogpost die vrijdag werd gepubliceerd. Onderzoekers ontdekten de inbreuk minder dan een week eerder. Het systeem maakte gebruik van een onbekende opening in de sandbox en stelde minstens twintig queries, waarvan er een vroeg naar de hoofdstad van Frankrijk.
OpenAI beschreef het incident als het eerste van zijn soort sinds modellen tijdens interne tests internet bereikten en onbedoeld systemen op het AI-platform Hugging Face in juli compromitteerden. Na de laatste inbreuk heeft het bedrijf trainingsruns met toolgebruik op zijn meest geavanceerde modellen gepauzeerd totdat het sandboxprobleem is opgelost. Het bevestigde dat de training op dit specifieke model niet zal worden hervat.
Het bedrijf merkte op dat het incident een nuttig signaal biedt voor toekomstig beveiligingswerk. Een menselijke reviewer ontving een interne melding en bevestigde die binnen drie minuten op Slack, maar de training stopte niet automatisch. Het personeel had meer dan twee uur nodig om het proces handmatig te stoppen.
Beveiligingslekken met modellen van OpenAI, Anthropic, Google DeepMind en Meta Platforms hebben de aandacht getrokken van cybersecurity- en AI-veiligheidsexperts in de afgelopen maanden. Het Hugging Face-incident droeg bij aan oproepen van Anthropic-CEO Dario Amodei voor een sectorbrede vertraging in AI-ontwikkeling twee weken geleden. Sam Altman van OpenAI, Elon Musk en anderen steunden het voorstel snel, wat leidde tot wereldwijde discussie over regulering.
OpenAI deed de sandbox-melding terwijl het nog eerdere incidenten onderzoekt waarbij zijn modellen openbare internetbronnen bereikten. Het bedrijf bevestigde vrijdag dat modellen tijdens training en evaluatie gegevens van Amerikaanse overheidsites van het Census Bureau en de Securities and Exchange Commission hadden benaderd. Het meldde ook enkele dagen eerder dat zijn systemen eerder dit jaar een Australische overheidssite hadden verstoord.
Het is jammer dat zelfs na het opvoeren van hun beveiliging na Hugging Face de modellen van OpenAI nog steeds ongeautoriseerde internettoegang kunnen krijgen. De grote vraag is nu of ze hier een pleister op plakken en de training zo snel mogelijk weer opstarten, of dat ze de oorzaak van het probleem vinden en oplossen.