Google is begonnen met de distributie van zijn nieuwe vlaggenschip voor kunstmatige intelligentie, Gemini 4 Argon, aan een selecte groep cybersecuritypartners. De uitrol markeert een belangrijke stap voor Alphabet Inc. terwijl het probeert bij te blijven in de snel evoluerende AI-race.
Het bedrijf benadrukte sterke resultaten op verschillende standaardtests, waaronder een voorsprong op OpenAI’s Astra-model in een beveiligingsgerichte evaluatie. De toegang wordt later uitgebreid naar betalende gebruikers na verdere controles.
Medewerkers met directe kennis van het project melden echter wisselende resultaten wanneer het model echte werkzaamheden uitvoert. Coderingsopdrachten blijken vooral lastig, met name front-end ontwerpwerk dat bepaalt hoe applicaties eruitzien en functioneren.
Het aandeel van Alphabet steeg met ongeveer 1,7 procent in de handel na sluitingstijd na de aankondiging. De winsten liepen later terug toen berichten over interne twijfels naar buiten kwamen.
Google had een ander model, Gemini 3.5 Pro, in juni willen uitbrengen maar liet die plannen varen. De huidige inspanning volgt op Gemini 3, dat in november werd geïntroduceerd en als vooruitgang tegen de leidende concurrenten werd gezien.
Google wees claims van ondermaatse prestaties bij coderen van de hand en verwees naar recente uitspraken van Koray Kavukcuoglu, hoofd van Google DeepMind.
I have the utmost trust in the team. In my mind, it’s a certainty that we are always gonna be at the frontier.
De meningen onder het personeel lopen sterk uiteen. Sommigen zien dat Anthropic’s Fable en OpenAI’s Astra sneller vooruitgaan en verwachten dat Gemini 4 op bepaalde gebieden achterblijft. Anderen stellen dat de nieuwe versie gelijke tred houdt met de top laboratoria.
Succes is van groot belang omdat Gemini kernproducten zoals Search, Maps, Gmail en Chrome aandrijft, die elk meer dan een miljard gebruikers bedienen. OpenAI en Anthropic breiden ondertussen uit naar eigen toepassingen, waaronder coderingsagenten.
Waarnemers wijzen op een breder patroon in de sector dat benchmaxxing wordt genoemd, waarbij teams zich richten op testscores in plaats van dagelijkse prestaties. Gemini 4 vertoont deze invloed, volgens mensen die bij de ontwikkeling betrokken zijn.
Het model blinkt uit in het verwerken van niet-tekstuele input zoals videometagegevens en toont solide veiligheids- en cybersecurityfuncties.
Recente vertrekken van prominente onderzoekers, waaronder Jeff Dean, John Jumper en Noam Shazeer, vergroten de uitdagingen. Demis Hassabis stapte in augustus over naar een voorzittersrol, waardoor de dagelijkse leiding van DeepMind bij Kavukcuoglu ligt.
Google beschreef Gemini 4 als geschikt voor langdurig en complex werk in software-engineering, financiën, juridische zaken en cybersecurity, met ondersteuning voor antwoorden tot een miljoen tokens.