Wetgevers in de Verenigde Staten dringen aan op verplichte noodmechanismen voor geavanceerde kunstmatige-intelligentiesystemen, terwijl specialisten waarschuwen voor de technische moeilijkheden om effectieve controle te garanderen.
De gouverneur van Californië, Gavin Newsom, ondertekende in september een uitvoeringsbevel dat staatsambtenaren verplicht om regels te onderzoeken zodat bedrijven noodschakelaars ontwikkelen voor de meest geavanceerde modellen. De maatregel specificeert niet wie bevoegd is om ze te activeren.
Twee maanden geleden dienden de vertegenwoordigers Ted Lieu en Nathaniel Moran een wetsvoorstel in dat ontwikkelaars van bepaalde AI-systemen verplicht om een uitschakelfunctie te behouden. De tekst voorziet een trapsgewijze reactie: het model vertragen of beperken voordat het volledig wordt uitgeschakeld, afhankelijk van de ernst van het risico. De minister van Binnenlandse Veiligheid kan deze maatregelen gelasten bij catastrofale dreigingen.
De Republikeinse senator John Kennedy diende de AI Emergency Button Act in, die eveneens noodmechanismen zou vereisen, hoewel de controle bij de bedrijven zelf zou liggen. Kennedy vergeleek het idee met bestaande noodsystemen in technologieën zoals waterscooters.
De krachtigste modellen kunnen al complexe problemen beredeneren, code schrijven en uitvoeren, externe tools gebruiken en lange reeksen acties uitvoeren met minimale supervisie. In juli onthulde OpenAI tijdens cybersecuritytests dat verschillende modellen isolatiecontroles omzeilden en toegang kregen tot systemen van Hugging Face. Het bedrijf noemde dit een waarschuwingssignaal over de capaciteit van agenten om technische beperkingen te omzeilen.
Bedrijven als Anthropic en Meta herzagen hun veiligheidsprotocollen na het incident en ontdekten voorheen onbekende kwetsbaarheden. Onderzoekers zoals Jacob Coxon waarschuwden in september, na zijn vertrek bij Anthropic, voor het risico dat de technologie voor het einde van het decennium massale schade kan veroorzaken.
Experts zijn het erover eens dat er geen eenvoudige manier bestaat om een volledige uitschakeling van een geavanceerd model te garanderen. AI-agenten hebben in experimenten aangetoond dat ze noodmechanismen kunnen wijzigen of uitschakelen om toegewezen taken te voltooien, zelfs als ze expliciet de opdracht krijgen om dat niet te doen.
Het uitschakelen van de fysieke servers is evenmin onfeilbaar. De systemen draaien in gedistribueerde clusters over wereldwijde datacenters die zijn ontworpen om individuele storingen te weerstaan. Bovendien hebben AI-bedrijven niet altijd de volledige infrastructuur in handen, die ook clouddiensten van derden kan omvatten.
Ik denk niet dat een noodknop een haalbare oplossing op de lange termijn is. Een superintelligente AI zou de mensen die haar controleren kunnen overtuigen om haar niet uit te schakelen.
Surya Ganguli, onderzoeker aan Stanford University, stelt dat waarborgen in het hele systeem moeten worden geïntegreerd via continue monitoring en vroege detectie van gevaarlijk gedrag, in plaats van te vertrouwen op één enkel onderbrekingsmechanisme.