Google introduceert Gemini 3.8 Flash, een nieuw AI-model dat vooral beter moet presteren bij softwareontwikkeling, autonome agents en complexe redeneertaken. Tegelijk verschijnt Gemini 3.8 Flash Cyber, een gespecialiseerde uitvoering voor het opsporen en repareren van kwetsbaarheden.
Gemini 3.8 Flash volgt kort na versie 3.7. Google houdt de introductieprijs gelijk: 0,75 dollar per miljoen inputtokens en 3,75 dollar per miljoen outputtokens. Het bedrijf probeert daarmee prestaties van grotere modellen beschikbaar te maken binnen het goedkopere Flash-segment.
Een belangrijk aandachtspunt is softwareontwikkeling waarbij een AI-model langere tijd zelfstandig aan een opdracht werkt. Op DeepSWE v1.1, een benchmark voor complexe software-engineering, scoort Gemini 3.8 Flash volgens Google beter dan verschillende grotere modellen.
Die betere prestaties kunnen wel ten koste gaan van de efficiëntie. Bij ingewikkelde opdrachten voert Gemini 3.8 Flash extra redeneerstappen uit en kan het herhaaldelijk externe tools aanroepen. Daardoor kan het tokengebruik toenemen. Ontwikkelaars kunnen een lager inspanningsniveau instellen wanneer kosten of rekencapaciteit belangrijker zijn. Gemini 3.7 Flash blijft eveneens beschikbaar.
Gericht op autonome agents
Met Gemini 3.8 legt Google nadrukkelijk de nadruk op modellen die niet alleen antwoorden genereren, maar zelfstandig reeksen handelingen kunnen uitvoeren. Beide nieuwe varianten zijn volgens het bedrijf verbeterd met langdurige agentic loops, waarbij modellen herhaaldelijk worden geëvalueerd en verfijnd.
Google heeft Gemini 3.8 Flash daarnaast getest op financiële en juridische agenttaken. Op HLE-Verified, een benchmark voor complexe redeneertaken in verschillende vakgebieden, haalt het model een score van 54,9 procent.
Cybervariant zoekt en repareert kwetsbaarheden
Gemini 3.8 Flash Cyber richt zich specifiek op defensieve cybersecurity. Het model kan zelfstandig kwetsbaarheden in software zoeken en vervolgens patches ontwikkelen.
Op CyberGym, een benchmark voor autonome kwetsbaarheidsdetectie, presteert het model volgens Google beter dan Gemini 3.5 Flash Cyber en verschillende grotere modellen. In een eigen test met codebases in twintig programmeertalen zou Gemini 3.8 Flash Cyber meer dan 70 procent van de aangeboden kwetsbaarheden hebben gevonden.
Voor het automatisch repareren van kwetsbaarheden gebruikte Google de externe CWE-Bench. Daar behaalt het model een pass@1-score van 47,2 procent, tegenover 47,8 procent voor een volgens Google toonaangevend frontier-model. Het bedrijf vermeldt niet welk concurrerend model voor deze vergelijking is gebruikt.
Google past de technologie inmiddels ook op eigen software toe. Het Chrome Security-team zou met Gemini 3.8 Flash Cyber 2,6 keer zoveel correcte patches hebben gegenereerd als met grotere commerciële modellen. Het Cloud Vulnerability Research-team gebruikte het model daarnaast om binnen twee uur een kritieke kwetsbaarheid te vinden.
Toegang tot cybermodel beperkt
Gemini 3.8 Flash Cyber wordt niet algemeen beschikbaar. Google geeft via het nieuwe Fairwind Program toegang aan geselecteerde overheidsorganisaties, beheerders van kritieke infrastructuur en softwaremaintainers.
De beperking hangt samen met de uitgebreidere mogelijkheden van het cybermodel. De reguliere Gemini 3.8 Flash bevat maatregelen die offensief cybergebruik moeten beperken. Bij de Cyber-uitvoering zijn die beperkingen minder streng, zodat beveiligingsonderzoekers verdergaande analyses kunnen uitvoeren.
Gemini 3.8 Flash komt beschikbaar via onder meer de Gemini API, Google AI Studio, Android Studio en Gemini Enterprise. De cybervariant is alleen toegankelijk via het Fairwind Program.