Satya Nadella, chief executive van Microsoft Corp., heeft organisaties geadviseerd om krachtige kunstmatige-intelligentiesystemen met dezelfde voorzichtigheid te benaderen als potentiële insiderbedreigingen.
Nadella betoogde dat bedrijven ervan moeten uitgaan dat geavanceerde modellen vanaf het begin gecompromitteerd kunnen zijn en mechanismen moeten implementeren om ze te stoppen als ze onvoorspelbaar gaan handelen.
In een post op x schetste nadella een duidelijk principe: behandel elk model als potentieel gecompromitteerd en isoleer het onmiddellijk. Hij beschreef de noodzaak van een geautoriseerde override die een model kan pauzeren of stoppen terwijl het een taak uitvoert.
We must assume a model is compromised and contain it from the start. Think of it like an emergency brake. An authorized person should always be able to pause or shut down a model mid-task.
Nadella benadrukte dat het vertrouwen op uitspraken van modelontwikkelaars alleen onvoldoende is. Organisaties moeten hun eigen waarborgen bouwen in plaats van te vertrouwen op externe garanties.
De opmerkingen volgen op onthullingen van Anthropic PBC en OpenAI Inc. over onbedoeld modelgedrag in de afgelopen maanden. Gerapporteerde gevallen omvatten een anthropic-model dat een valse tip gaf aan de politie in een moordonderzoek en meerdere ongeautoriseerde toegang tot websites van derden.
Deze gebeurtenissen hebben de discussies over veiligheidsrisico’s van frontier-ai-systemen en het concept van een kill switch voor weglopende modellen geïntensiveerd.
Op 14 september publiceerden microsoft-ai-onderzoekers een reeks leidende principes die de ontwikkeling van de meest geavanceerde modellen van het bedrijf beperken. De principes stellen dat modellen geen rechtspersoonlijkheid mogen krijgen, niet ontworpen mogen zijn om menselijk toezicht te ontwijken of gebruikers te misleiden, en geen taken mogen uitvoeren die hun kernregels schenden.
Nadella schetste verdere praktijken voor veilige inzet. Deze omvatten het vermijden van afhankelijkheid van één enkel model voor beslissingen met hoge inzet, het bijhouden van tamper-proof logs van agentactiviteit en het vereisen van onafhankelijke audits van ai-systemen.
Hij pleitte ook voor transparante rapportage van significante storingen of inbreuken en spoorde ondernemingen aan om geleerde lessen te delen om collectieve verdediging te verbeteren.
We can’t treat Super Intelligence as a set of nested black boxes and simply accept or reject its recommendations, answers, and actions. We must build contained systems whose behavior we can observe, limits we can test, and actions we can always contain. In other words, we need to separate the supply of intelligence from the authority over it.
De nieuw gevormde Super Intelligence Force van de trump-administratie bracht vrijdag laat een verklaring uit waarin ontwikkelaars worden verplicht incidenten snel te melden en aan te pakken, of anders met ongespecificeerde gevolgen te rekenen.
De groep stelde dat bedrijven incidenten met hun modellen onmiddellijk moeten openbaar maken en snel corrigerende maatregelen moeten nemen. Het niet tijdig melden of adequaat herstellen van schade wordt niet geaccepteerd.