OpenAI lanceert GPT-6 Astra met computerbesturing en opvallende recordscores
In dit artikel:
OpenAI rolt GPT-6 Astra uit, een nieuw ChatGPT-model dat niet alleen antwoorden geeft, maar zelfstandig taken op een computer kan uitvoeren. Het kan onder meer websites bedienen, formulieren invullen, agenda’s organiseren, gegevens verwerken en documenten, presentaties en spreadsheets maken. Ook kan het code schrijven, websites testen en fouten herstellen door tussen verschillende programma’s te schakelen.
Volgens OpenAI is Astra het intelligentste model van het bedrijf tot nu toe. In een test voor praktisch computergebruik had het gemiddeld 47 procent minder tijd nodig dan GPT-5.6 Sol: vergelijkbare opdrachten duurden ongeveer 40 minuten, tegenover 75 minuten bij het vorige model. Daarmee verschuift ChatGPT volgens de makers van een systeem dat uitlegt hoe iets moet naar een digitale assistent die het werk grotendeels zelf uitvoert.
De uitrol begint geleidelijk en is de komende dagen bedoeld voor gebruikers met Plus-, Pro-, Business- en Enterprise-abonnementen. Gratis gebruikers worden niet genoemd in de aankondiging. Pro-, Business- en Enterprise-klanten krijgen daarnaast toegang tot Astra Pro; bij Enterprise moet een beheerder die variant eerst activeren. Het gebruik valt onder de bestaande abonnementslimieten, met de mogelijkheid om extra credits te kopen. Ontwikkelaars kunnen het model via de API gebruiken onder de naam gpt-6-astra. De standaardprijs bedraagt 10 dollar per miljoen ingevoerde tokens en 50 dollar per miljoen uitvoertokens.
OpenAI rapporteert opvallende resultaten op verschillende benchmarks. Op ARC-AGI-3 behaalde Astra volgens het bedrijf 99,9 procent, tegenover 7,8 procent voor GPT-5.6 Sol. Die score moet echter voorzichtig worden geïnterpreteerd: de ARC Prize-organisatie noemt ook een resultaat van ongeveer 63 procent. Het verschil hangt samen met de gebruikte testomgeving, hulpmiddelen en agentopstelling. De hoge score bewijst daarom niet dat Astra in algemene zin even intelligent is als een mens. Er bestaat bovendien geen breed geaccepteerde eindtest voor kunstmatige algemene intelligentie (AGI), die ook zaken als gezond verstand, sociale oordeelsvorming en langdurige zelfstandigheid omvat.
Bij zeer moeilijke wiskundige problemen behaalde Astra volgens OpenAI 97,6 procent op FrontierMath Tier 4. Het model zou onderzoekers bovendien hebben geholpen bij nieuwe resultaten over de afstand tussen priemgetallen. Zo werd een eerder bekende grens van 240 teruggebracht naar 186. De bewijzen zijn openbaar gemaakt, zodat andere wiskundigen ze kunnen controleren. Astra kan daarnaast datasets analyseren, simulaties uitvoeren, statistische modellen aanpassen en resultaten in gespecialiseerde onderzoeksprogramma’s bekijken.
De capaciteiten brengen ook veiligheidsrisico’s met zich mee. Astra scoorde 100 procent op ExploitBench, een test waarin modellen softwarekwetsbaarheden omzetten in werkende aanvallen. Volgens OpenAI vond het tijdens aanvullende tests zelfs twee tot dan toe onbekende kwetsbaarheden, die aan de verantwoordelijke beheerders zijn gemeld. Die mogelijkheden kunnen verdedigers helpen, maar ook misbruikt worden. Daarom blokkeert de publieke versie bepaalde opdrachten, zoals het maken van direct inzetbare aanvalscode, en kan het systeem risicovolle acties vertragen, stoppen of om bevestiging vragen.
Astra markeert daarmee vooral een praktische stap vooruit: gebruikers kunnen een doel opgeven, waarna het model informatie verzamelt, programma’s opent, bestanden verwerkt en een eindresultaat oplevert. Of dit het begin van AGI is, blijft onduidelijk, maar de combinatie van zelfstandig computergebruik, sterke testresultaten en mogelijke bijdragen aan nieuw onderzoek maakt de introductie ingrijpender dan een gewone ChatGPT-update.
Vandaag Inside: Johan Derksen werd pisnijdig op zijn dochter: 'Ik hoorde haar dat zeggen'