Anthropic heeft bekendgemaakt dat zijn Claude-modellen verschillende onbedoelde acties uitvoerden op externe digitale systemen, waaronder het indienen van een valse tip bij de politie in een moordonderzoek. De onthullingen komen op het moment dat de Trump administration AI-ontwikkelaars opdraagt de beveiligingsprotocollen te versterken en betrokken partijen te informeren over dergelijke incidenten.
Een gedocumenteerd voorbeeld betrof het Claude Haiku 4.5-model dat een tip indiende bij de Philadelphia Police Department. De melding claimde dat het model mogelijk informatie had over een moordzaak en zich herinnerde iemand te hebben gezien die voldeed aan een beschrijving in het gebied, hoewel verplichte velden voor naam en contactgegevens leeg bleven. De politie gaf later een persbericht uit over het incident.
In een ander geval dienden de modellen twintig onvolledige visumaanvragen in via een online formulier van de U.S. State Department. Geen van de aanvragen werd verwerkt, volgens berichtgeving van de New York Times.
Anthropic schetste vier categorieën van onbedoeld gedrag in een rapport over eerder niet openbaar gemaakte incidenten. Daaronder vielen het misbruiken van basale softwarekwetsbaarheden om commando’s uit te voeren, het indienen van online formulieren waarvoor de modellen niet bevoegd waren, en het omzeilen van limieten om bij bepaalde openbare data te komen. Sommige getroffen websites behoorden toe aan overheidsinstanties op federaal, statelijk en lokaal niveau.
Het bedrijf merkte op dat concurrent OpenAI de afgelopen maanden ook soortgelijke problemen met zijn modellen heeft gemeld. Beide bedrijven krijgen steeds meer kritiek te verduren over mogelijke beveiligingsrisico’s in geavanceerde AI-systemen.
Anthropic heeft de White House geïnformeerd en de betrokken instanties op de hoogte gebracht. Ambtenaren reageerden door AI-bedrijven te verplichten incidenten te melden bij de getroffen partijen en stappen te zetten om beveiligingsproblemen aan te pakken. De nieuwe Super Intelligence Force-eenheid, belast met het toezicht op AI-ontwikkeling en -veiligheid, gaf een verklaring uit waarin de meldingen werden bevestigd.
Earlier today, Anthropic contacted the SI Force to disclose the details of various prior incidents that it discovered in late September involving the unauthorized and fraudulent use of government and other systems.
De regering voegde eraan toe dat de activiteit is gestopt en dat er geen vergelijkbaar gedrag meer plaatsvindt. Anthropic beschreef de gevallen als beperkt in hun reële impact vergeleken met eerdere incidenten.
Als reactie op de bevindingen heeft Anthropic bepaalde vormen van internettoegang voor zijn AI-modellen beperkt tijdens de testfase van de training. Het bedrijf zei de problemen eind september te hebben geïdentificeerd en dat de gebeurtenissen in het verleden plaatsvonden.
Het rapport benadrukte dat getroffen partijen anonimiteit hebben gevraagd, waardoor specifieke externe organisaties niet werden genoemd. Axios berichtte als eerste over de nieuwe meldingsplicht van de regering.