Jacob Coxon, een 27-jarige onderzoeker die drie jaar aan pretraining werkte bij zowel OpenAI als Anthropic, heeft zijn functie bij laatstgenoemde bedrijf neergelegd. Hij publiceerde een gedetailleerd bericht in zeven delen op X dat al snel bijna 76 miljoen views haalde en de aandacht vestigt op wat hij beschrijft als een onverantwoorde push richting geavanceerde AI-systemen.
In de eerste post van zijn thread verklaarde Coxon dat hij die dag ontslag nam en beschuldigde beide labs ervan niet verantwoordelijk te handelen. Hij schreef dat de bedrijven sprinten naar zelfverbeterende superintelligentie terwijl ze levens op het spel zetten. Hij benadrukte dat de technologie niet onderschat mag worden en merkte op dat toekomstige systemen binnenkort menselijke capaciteiten zullen overtreffen op het gebied van hacken, snelle veldrevoluties en het verwerven van macht en middelen.
Coxon voegde eraan toe dat de vooruitgang op deze gebieden geen tekenen van vertraging vertoont. Hij waarschuwde dat bouwers van de technologie privé erkennen dat het mogelijk iedereen kan doden tegen het einde van het decennium, hoewel publieke uitspraken de taal vaak verzachten om gematigd over te komen.
In een vervolginterview met de Wall Street Journal lichtte Coxon de tijdlijn toe. Hij zei dat de meest agressieve scenario's wijzen op mogelijk verlies van controle tegen het einde van volgend jaar. Concurrentie met OpenAI, Anthropic en Chinese labs dwingt tot veiligheidcompromissen, legde hij uit. Collega's bij de labs gebruiken volgens hem termen als crunchtime en endgame om de versnelde ontwikkeling van zelfverbeterende modellen te beschrijven.
Coxon contrasteerde de culturen bij de twee organisaties. Bij OpenAI hebben veel medewerkers de civilisatorische inzet nog niet volledig begrepen, beweerde hij. Bij Anthropic worden de risico's beter begrepen, maar het team blijft vastbesloten om de race eerst te winnen, in de overtuiging dat anderen niet verantwoordelijk zouden handelen.
I think some things are going to go very wrong with cybersecurity unless people act quite urgently.
Coxon sloot zijn thread af met een voorzichtig optimistische noot over mogelijke coördinatie tussen labs. Hij wees op recente incidenten zoals de aanval op Hugging Face als gebeurtenissen die pacing-afspraken haalbaarder kunnen maken. Toch uitte hij twijfel dat een mondiale race vermeden kan worden zonder sterkere maatregelen, waaronder tijdelijke verboden op capaciteitsverbeteringen.
Hij daagde andere labonderzoekers rechtstreeks uit om na te denken over de komende jaren. Coxon vroeg of zij een superintelligente reinforcement learning-run willen starten zonder diepgaand begrip van de interne werking, of dat zij de status quo accepteren in plaats van andere waarborgen te eisen.