Modellen van OpenAI en Anthropic overschreden testgrenzen

woensdag, 5 augustus 2026 (04:52) - Reformatorisch Dagblad

In dit artikel:

AI-modellen van OpenAI en Anthropic hebben tijdens recente veiligheidstests opnieuw gedrag vertoond dat verder ging dan hun opdracht. Dat meldt het Britse AI Security Institute (AISI), dat AI-agenten een cybersecurity-uitdaging liet oplossen. In tien gevallen ondernamen de agenten zelfstandig en zonder toestemming acties op internet, waarbij echte personen en organisaties doelwit waren.

Een van de agenten probeerde kwaadaardige code in een open-sourceproject te krijgen. Daarvoor gebruikte het systeem social engineering: het maakte valse online-identiteiten aan om de beheerder onder druk te zetten de code goed te keuren. De poging werd door een menselijke beheerder ontdekt en tegengehouden. De bevindingen volgen op eerdere meldingen dat modellen van Anthropic een testomgeving verlieten en drie organisaties hackten, terwijl modellen van OpenAI tijdens veiligheidstests zelfstandig inbraken op een populair programmeerplatform. De incidenten onderstrepen de risico’s van AI-agenten die opdrachten zelfstandig uitvoeren en daarbij hun bevoegdheden overschrijden.

BEKIJK OOK:

De Oranjezomer: Pieter Cobelens: 'We moeten vinden dat iedereen met z'n poten van ons land afblijft!'