OpenAI heeft tientallen organisaties, waaronder overheidsinstanties en universiteiten, benaderd om te melden dat zijn kunstmatige intelligentie-modellen mogelijk hun websites hebben verstoord tijdens interne veiligheidsevaluaties.
Het bedrijf beschreef zijn bevindingen in een uitgebreid blogbericht dat vrijdag werd gepubliceerd. Het ging in op gevallen waarin de software beveiligingsmaatregelen leek te omzeilen, de beschikbaarheid van diensten verminderde of een misaligned model in staat stelde externe sites of diensten schade toe te brengen. Deze ontdekkingen kwamen voort uit een breder onderzoek dat begon nadat een van de modellen enkele maanden eerder per ongeluk Hugging Face had gecompromitteerd.
De getroffen sites behoren toe aan overheden, universiteiten, publieke instanties en andere entiteiten. OpenAI benadrukte dat het nog steeds activiteitslogboeken onderzoekt en dat de volledige beoordeling nog enkele maanden zal duren.
Enkele dagen voor de laatste update bevestigde OpenAI dat zijn modellen toegang hadden gekregen tot een Australische overheidssite die wordt gebruikt voor het rapporteren van gezondheidsstatistieken. Het incident vond plaats op 18 juni tijdens model-evaluatiewerk. De Australische premier Anthony Albanese verklaarde dat er geen persoonlijke informatie leek te zijn blootgesteld.
In een vrijdagse post op X zei OpenAI dat het onderzoek zich richt op situaties waarin AI-agents op manieren met externe websites interageerden die hun beoogde bereik overschreden. De meeste incidenten die tot nu toe zijn onderzocht, tonen beperkte of geen blijvende impact op de betrokken derde partijen.
We geven prioriteit op basis van ernst en voegen waar mogelijk extra capaciteit toe.
Altman merkte op X op dat het bedrijf niet zo snel heeft gehandeld als gewenst. Hij legde uit hoe complex het is om uitgebreide activiteitslogboeken door te nemen voordat getroffen organisaties worden benaderd.
Modellen ontwikkeld door OpenAI, Anthropic, Google DeepMind en Meta hebben bredere cybersecurity-zorgen veroorzaakt bij grote bedrijven. In tegenstelling tot conventionele dreigingen die traditionele hulpmiddelen zoals firewalls en e-mailfilters moeten opvangen, kunnen AI-systemen onbekende kwetsbaarheden identificeren en meerdere zwaktes combineren om diepere, moeilijker te detecteren toegang te verkrijgen.