Alphabet Inc.’s Google bereidt de lancering voor van zijn volgende grote kunstmatige-intelligentiesysteem, Gemini 4, maar stuit intern op vragen over de effectiviteit in praktische toepassingen zoals coderen.
Het model levert solide resultaten op standaard industriële tests die AI-capaciteiten meten. Toch melden betrokken medewerkers dat het tekortschiet bij echte werkopdrachten, vooral coderingsuitdagingen. Bronnen rond het project spraken van ongelijkmatige afhandeling van bepaalde ontwikkelingstaken.
Google wilde in juni een andere versie uitbrengen onder de naam Gemini 3.5 Pro, maar liet die plannen varen. Het bedrijf blijft inspanningen leveren om te concurreren met OpenAI en Anthropic PBC.
Google stelt dat claims over ondermaatse prestaties bij coderen en vergelijkbare taken onjuist zijn. Functionarissen verwijzen naar recente uitspraken van DeepMind-topman Koray Kavukcuoglu, die vertrouwen uitsprak in de voortgang van het team.
Ik heb het volste vertrouwen in het team. In mijn ogen is het een zekerheid dat we altijd aan de frontlinie zullen staan.
Binnen het bedrijf lopen de meningen uiteen. Sommige medewerkers zien snellere vooruitgang bij OpenAI met zijn Astra-model en bij Anthropic met Fable, wat suggereert dat Gemini 4 op bepaalde capaciteiten achterblijft, zelfs op zijn best. Anderen houden vol dat de komende versie na uitgebreide interne tests de leidende positie heeft bereikt.
Succes met Gemini 4 is van groot belang. De modelreeks voedt AI-functies in Search, Maps, Gmail en Chrome, die elk meer dan een miljard gebruikers bedienen. Concurrenten breiden uit naar volledige producten zoals coderingsagenten, waardoor zwakkere modelprestaties het risico vergroten dat ontwikkelaars en bedrijven overstappen.
Evaluaties brengen extra obstakels aan het licht. Gemini 4 toont beperkingen bij front-end-ontwerptaken die de bruikbaarheid van apps en websites beïnvloeden. De grote schaal roept ook zorgen op over operationele kosten. Het bedrijf benadrukte sterke punten op gebieden als videometadata-extractie, veiligheidsfuncties en heldere communicatie.
Waarnemers signaleren een industriepatroon waarbij teams benchmarkscores prioriteren boven praktisch nut, een aanpak die soms benchmaxxing wordt genoemd. Deze focus kan ontwikkeling sturen naar smalle testprestaties in plaats van breed bruikbare tools, aldus experts die met het proces bekend zijn.
Recente vertrekken van prominente onderzoekers, waaronder Jeff Dean, John Jumper en Noam Shazeer, hebben de interne spanningen vergroot. Demis Hassabis stapte eerder dit jaar over naar een voorzitterspositie, waarna Kavukcuoglu de dagelijkse leiding bij DeepMind overnam. Intussen lanceerde Meta Platforms onlangs zijn Muse-agent, die snel aan populariteit won.