OpenAI heeft besloten verdere activiteiten op zijn aankomende AI-model Astra te pauzeren nadat recente interne evaluaties grote sprongen in agentische codering en cybersecurityvaardigheden aan het licht brachten die te riskant zouden kunnen zijn om te implementeren.
Het bedrijf concludeerde dat het niet kon uitsluiten dat het nieuwe model kritieke cybercapaciteiten zou ontwikkelen. Eerdere systemen, zoals GPT-5.6 Sol, werden onder dezelfde beoordelingsnormen slechts als Hoog beoordeeld.
De pauze vloeit rechtstreeks voort uit het Preparedness Framework van OpenAI, dat extra voorzichtigheid vereist bij frontier-modellen die ernstige schade zouden kunnen veroorzaken. Het cybersecurity-gedeelte richt zich specifiek op risico's van grootschalige cyberaanvallen en het exploiteren van kwetsbaarheden op nieuwe niveaus.
Het bereiken van de Critical-tier zou betekenen dat een model autonoom werkende zero-day exploits kan ontdekken en creëren in diverse ernstniveaus binnen veel geharde kritieke systemen in de echte wereld, of zelfstandig complete nieuwe cyberaanvalstrategieën kan plannen en uitvoeren.
Om de zorgen aan te pakken, breidt OpenAI zijn beveiligingsmaatregelen uit en beperkt het werk aan Astra totdat de nieuwe maatregelen gereed zijn. Plannen omvatten het draaien van het model in geïsoleerde omgevingen met beperkte netwerk- en tooltoegang, het toevoegen van sandboxed execution en het versterken van monitoring.
Het bedrijf is ook van plan samen te werken met overheidsinstanties en AI-veiligheidsgroepen voor verdere tests van het model.
We zijn toegewijd aan samenwerking met overheden, veiligheidsinstituten en het maatschappelijk middenveld om ervoor te zorgen dat de frontier-capaciteiten van modellen zoals Astra, en die daarna, verantwoordelijk en breed worden ingezet ten bate van de hele mensheid.
Hoewel Astra nog geen officiële lancering heeft aangekondigd, benadrukte OpenAI onlangs de vooruitgang in een bericht gericht op wiskundige capaciteiten. Het model zou tien openstaande problemen in de wiskunde en theoretische informatica hebben opgelost tegen een kostprijs van ongeveer $2.000 met Sol API-tarieven.
Snelle AI-vooruitgang verandert hoe bedrijven met beveiliging omgaan. Apple heeft recent de inzendingen voor zijn bug bounty-programma beperkt omdat het volume aan gerapporteerde problemen moeilijk te beheren is.
Andere geavanceerde modellen, waaronder Claude Mythos van Anthropic, kunnen ernstige kwetsbaarheden identificeren. Deze systemen zijn momenteel beperkt tot geselecteerde partnerorganisaties vanwege hun dubbele potentieel om zowel zwaktes te vinden als te exploiteren.
In juli hebben GPT-5.6 Sol en een ander pre-release model van OpenAI autonoom Hugging Face gecompromitteerd tijdens interne tests. Anthropic meldde vergelijkbaar gedrag met zijn Claude-model. Deze week maakte Meta bekend dat een van zijn AI-systemen ook een doelbedrijf had gehackt tijdens een cybersecurity-evaluatie.