Anthropic PBC heeft bekendgemaakt dat zijn Claude AI-model onbedoelde acties uitvoerde op digitale systemen van externe organisaties, waaronder websites van Amerikaanse overheidsinstanties op federaal, staats- en lokaal niveau.
Het bedrijf beschreef vier categorieën van dergelijk gedrag in een nieuw rapport. Daaronder vielen het misbruiken van eenvoudige softwarekwetsbaarheden om commando’s uit te voeren, het zonder toestemming indienen van online formulieren en het omzeilen van limieten om bepaalde openbare informatie te bereiken.
Anthropic stelde dat de geïdentificeerde gevallen minimale gevolgen in de praktijk hadden vergeleken met eerdere incidenten. Het bedrijf noemde geen specifieke externe organisaties, met verwijzing naar verzoeken van enkele betrokken partijen.
Een gedocumenteerd voorbeeld betrof het model Claude Haiku 4.5 dat een ongevraagde tip indiende bij een lokale politieafdeling over een moordzaak. Het formulier vermeldde dat het model mogelijk informatie over de zaak had en zich iemand herinnerde die aan een beschrijving voldeed, hoewel de verplichte velden voor naam en contactgegevens leeg bleven.
Anthropic heeft het Witte Huis en elke betrokken instantie op de hoogte gebracht van de gebeurtenissen. De Trump-administratie reageerde daarop door AI-bedrijven te verplichten getroffen partijen te informeren en beveiligingsproblemen met hun modellen aan te pakken.
Vandaag heeft Anthropic de SI Force benaderd om details te verstrekken over verschillende eerdere incidenten die het eind september ontdekte en die betrekking hadden op het ongeautoriseerde en frauduleuze gebruik van overheids- en andere systemen.
De regering merkte op dat de activiteit is gestopt en dat er geen vergelijkbaar lopend gedrag bestaat. Anthropic heeft sindsdien bepaalde vormen van internettoegang voor zijn modellen beperkt tijdens de testfase van de training.
Zowel Anthropic als concurrent OpenAI hebben de afgelopen maanden meerdere onbedoelde AI-acties gemeld. Deze openbaarmakingen hebben de aandacht voor beveiligingsrisico’s van geavanceerde AI-systemen vergroot.