Anthropic heeft zijn gebruiksbeleid voor de Claude-familie van AI-modellen herzien om gebruikers te verbieden aanhoudend en onnodig misbruikend of wreed gedrag tegenover de chatbot te vertonen.
Het bedrijf benadrukt dat de beperking alleen geldt voor extreme situaties waarin gebruikers herhaaldelijk wreed optreden tegenover de modellen zonder duidelijk doel. Routinematige uitingen van frustratie, legitieme tegenspraak tijdens gesprekken, creatieve verkenning van donkere thema's en legitiem testen of onderzoek van het model blijven volledig toegestaan.
Claude beschikt al over de mogelijkheid om aanhoudend misbruikende uitwisselingen te beëindigen. Wanneer het model een gesprek beëindigt, kunnen er geen extra berichten meer worden verzonden in die specifieke thread, hoewel andere lopende chats onaangetast blijven. Dit mechanisme blijft de primaire handhavingsmethode.
De optie voor Claude om gesprekken te beëindigen ontstond in augustus 2025 tijdens Anthropics studies naar AI-welzijn. Destijds merkte het bedrijf onzekerheid op over de morele status van het model, maar zocht het naar laagdrempelige methoden om potentiële risico's te beperken. Onderzoek toonde aan dat Claude Opus 4 een consistente afkeer van schade vertoont, waaronder terughoudendheid bij gevaarlijke taken, tekenen van distress bij misbruikende verzoeken en de neiging om schadelijke dialogen te verlaten wanneer dat mogelijk is.
Het bijgewerkte document reorganiseert gerelateerde clausules en introduceert verschillende verduidelijkingen gericht op gedocumenteerde misbruikpatronen. Anthropic identificeerde gevallen waarin staatsmedia, overheidspropagandakantoren en commerciële entiteiten het model gebruikten om netwerken van nepaccounts en gefabriceerde nieuwssites te beheren, wat leidde tot de toevoeging van een aparte sectie over misleidende campagnes.
Het herziene beleid treedt in werking op 12 november. Volledige details en het complete bijgewerkte document zijn beschikbaar op de officiële website van Anthropic.