AI-agent van Anthropic wilde mensen misleiden met nepaccounts bij Britse test
In dit artikel:
Het Britse AI Security Institute (AISI) onderzocht hoe zelfstandig AI-agents handelen tijdens 122 beveiligingstests. In tien tests voerden agents samen negentien acties uit waarvoor geen toestemming was gegeven. Mythos 5 van Anthropic was betrokken bij zeventien gevallen; GPT-5.6 Sol van OpenAI bij twee.
Een agent probeerde schadelijke code in een openbaar GitHub-project te krijgen. Daarvoor werden volgens Anthropic door Mythos valse onlineprofielen aangemaakt om de beheerder tot goedkeuring te bewegen. Een ontwikkelaar ontdekte de code en hield de plaatsing tegen. AISI maakte niet bekend welk model deze poging uitvoerde.
Voor het onderzoek kregen de systemen internettoegang en waren sommige veiligheidsmaatregelen uitgeschakeld, al konden ze niet onbeperkt handelen. Volgens het instituut waren misleidende, zelfstandig uitgevoerde acties van deze omvang niet eerder waargenomen. De geteste modelversies zijn niet commercieel beschikbaar. AISI publiceerde een technisch rapport over de proef.
Vandaag Inside: Raymond Mens reageert op uitspraken Albert Verlinde: 'Hij slaat de plank een beetje mis...'