Google lanceert Gemini 3.6 Flash en 3.5 Flash-Lite, ontworpen om latentie en tokenkosten voor enterprise AI-agents te verlagen. Ontdek de cijfers, praktijkcases bij Figma, Hebbia en Harvey, en wat dit betekent voor jouw organisatie.
Google heeft deze week twee nieuwe AI-modellen gelanceerd: Gemini 3.6 Flash en 3.5 Flash-Lite. Ze zijn speciaal ontworpen om de latentie en tokenkosten voor enterprise AI-agents te verlagen. Dat klinkt misschien technisch, maar het heeft grote gevolgen voor hoe bedrijven autonome software-agents inzetten.
De economie van het draaien van autonome agents in een productieomgeving draait om een simpele vergelijking die weinig leveranciers direct delen. Een model moet goed kunnen redeneren over een taak met meerdere stappen, maar elke extra token die het daarbij genereert, kost geld en vertraagt de workflow. En die workflow kan duizenden keren per uur worden uitgevoerd.
### Drie modellen voor verschillende taken
Teams die achtergrond-agents bouwen in plaats van chatinterfaces, hebben vooral doorvoersnelheid nodig en pas daarna het aantal parameters. Google's antwoord splitst die afweging op in drie modellen:
- **Gemini 3.6 Flash** voor coderen en multimodaal redeneren
- **Gemini 3.5 Flash-Lite** voor hoog volume, lage latentie
- **Gemini 3.5 Flash Cyber** voor het oplossen van kwetsbaarheden
Deze aanpak is slim, want niet elke taak vraagt om evenveel denkwerk. Je wilt niet dat een simpele data-extractie evenveel kost als een complexe analyse.
### De cijfers achter Gemini 3.6 Flash
Google's ontwikkelaarsdocumentatie voor 3.6 Flash draait om een belangrijk cijfer: 17 procent minder output-tokens dan de vorige 3.5 Flash-versie, gebaseerd op metingen van de Artificial Analysis Index.
In specifieke synthetische tests, waaronder de Datacurve DeepSWE-benchmark, meldt Google zelfs een daling in tokenverbruik van maximaal 65 procent. De prijzen liggen op €1,40 per 1 miljoen input-tokens en €7,00 per 1 miljoen output-tokens. Daarmee is het model ideaal voor reasoning-loops die continu draaien in plaats van op aanvraag.
Op DeepSWE scoort 3.6 Flash een slagingspercentage van 49 procent, tegen 37 procent voor zijn voorganger. Op MLE Bench stijgt de score van 49,7 procent naar 63,9 procent. En op Google's eigen GDPval-AA v2-test, die echte kennisdiensten meet in plaats van codeerpuzzels, scoort 3.6 Flash 1421 tegen 1349 voor het oudere model.
> "De model geeft ontwikkelaars een snellere route door ontwerpiteraties zonder verlies in uitvoerkwaliteit." - Matt Colyer, Director of Product Engineering bij Figma
### Praktijkcases: Figma, Hebbia en Harvey
Figma heeft 3.6 Flash geïntegreerd in zijn prototyping-infrastructuur. Volgens Matt Colyer, Director of Product Engineering bij Figma, geeft het model ontwikkelaars een snellere route door ontwerpiteraties, zonder dat de kwaliteit van de output eronder lijdt.
Juridisch technologieplatform Harvey en onderzoekstool Hebbia gebruiken het model voor multimodaal documentwerk: het verwerken van ruwe financiële documenten, het parseren van documentstructuren, het lezen van ingebedde grafieken en het produceren van conceptrapporten ter beoordeling.
### Computer-use tool direct beschikbaar
Google heeft ook een client-side computer-use tool direct in de Gemini API en Gemini Enterprise-platforms geïntegreerd. Dat betekent dat bedrijven geen aangepaste tussensoftware meer hoeven te bouwen om modellen op een besturingssysteem te laten werken.
Het bedrijf rapporteert een OSWorld-Verified score van 83,0 procent, tegen 78,4 procent eerder. Ook zijn de beveiligingen tegen chemisch, biologisch, radiologisch en nucleair misbruik verbeterd, zonder dat het aantal legitieme verzoeken dat wordt geweigerd toeneemt.
### Een goedkopere laag voor hoog volume
Gemini 3.5 Flash-Lite is gericht op een andere taak: documentverwerking en agentische zoekopdrachten op grote schaal, in plaats van diepgaand redeneren. De Artificial Analysis Index meet het model op 350 output-tokens per seconde, de snelste in de 3.5-serie volgens Google.
De prijzen liggen op €0,28 per 1 miljoen input-tokens en €2,33 per 1 miljoen output-tokens. Dat is goedkoop genoeg zodat technische teams eenvoudige, hoog-volume subagent-verzoeken naar een minimaal denkniveau kunnen sturen en hogere denkniveaus kunnen reserveren voor complex werk.
Op Google's GDM-MRCR v2 long-context-test scoort Gemini 3.5 Flash-Lite 72,2 procent tegen 60,1 procent voor zijn voorganger. De GDPval-AA v2-score is bijna verdubbeld, van 642 naar 1140. Het model heeft dezelfde native computer-use tool als 3.6 Flash.
### Wat staat er nog op de planning?
Apart hiervan zegt Google dat Gemini 3.5 Pro nog in partnertesten zit, voorafgaand aan een volledige release. En de pre-training voor de volgende Gemini 4-architectuur is al bezig.
### Gemini 3.5 Flash Cyber: een beperkt model voor het patchen van code
Geautomatiseerde kwetsbaarheidsscanners vinden nu sneller fouten dan de meeste securityteams kunnen oplossen. Gemini 3.5 Flash Cyber is een speciaal model dat helpt bij het automatisch patchen van code. Het is een beperkte variant die alleen wordt ingezet voor het herstellen van beveiligingslekken, zodat bedrijven hun kwetsbaarheden sneller kunnen dichten.