Google lanceert Gemini 3.6 Flash en 3.5 Flash-Lite, gericht op het verlagen van latentie en tokenkosten voor enterprise AI-agents. Ontdek de cijfers, prijzen en praktijkvoorbeelden.
Google heeft Gemini 3.6 Flash en 3.5 Flash-Lite gelanceerd, twee nieuwe werkpaarden die specifiek zijn ontworpen om de latentie en tokengerelateerde kosten voor enterprise AI-agents te verlagen. Dit is goed nieuws voor bedrijven die autonome software-agents in productieomgevingen draaien.
De economie van het runnen van autonome software-agents in een productieomgeving komt neer op een vaste vergelijking die weinig leveranciers direct adverteren. Een model moet een meerstapstaak competent kunnen redeneren, maar elke extra token die het daarbij genereert, voegt kosten en vertraging toe aan een workflow die duizenden keren per uur kan draaien.
### Wat betekent dit voor Nederlandse bedrijven?
Teams die achtergrond-agents bouwen in plaats van chatinterfaces, hebben eerst doorvoer nodig en pas daarna parameteraantal. Google's antwoord, aangekondigd deze week, splitst die afweging over drie modellen: Gemini 3.6 Flash voor codering en multimodaal redeneren, Gemini 3.5 Flash-Lite voor hoogvolume, lage-latentiewerk, en een beperkte Gemini 3.5 Flash Cyber-variant voor kwetsbaarheidsherstel.
## De cijfers achter Gemini 3.6 Flash
Google's ontwikkelaarsdocumentatie voor 3.6 Flash draait om een cijfer: 17 procent minder outputtokens dan de vorige 3.5 Flash-versie, gebaseerd op metingen van de Artificial Analysis Index. In specifieke synthetische tests, waaronder de Datacurve DeepSWE-benchmark, rapporteert Google dalingen in tokenverbruik van tot 65 procent.
De prijsstelling is interessant: €1,38 per 1 miljoen inputtokens en €6,90 per 1 miljoen outputtokens (omgerekend van de oorspronkelijke $1,50 en $7,50). Dit positioneert het model voor redeneerlussen die continu draaien in plaats van op aanvraag.
Op DeepSWE noteert het bedrijf een succespercentage van 49 procent voor 3.6 Flash tegen 37 procent voor zijn voorganger. Op MLE Bench stijgt de score van 49,7 procent naar 63,9 procent, en op Google's GDPval-AA v2-test – die probeert echte kenniswerk te meten in plaats van codeerpuzzels – scoort 3.6 Flash 1421 tegen 1349 voor het oudere model.
### Praktijkvoorbeelden uit de sector
- **Figma** heeft 3.6 Flash geïntegreerd in zijn prototyping-infrastructuur. Volgens Matt Colyer, Director of Product Engineering, geeft het model ontwikkelaars een snellere route door ontwerpiteraties zonder kwaliteitsverlies.
- **Harvey**, een juridisch technologieplatform, en **Hebbia**, een onderzoekstool, gebruiken het model voor multimodaal documentwerk: het verwerken van ruwe financiële documenten, het parseren van documentstructuur, het lezen van ingebedde grafieken en het produceren van conceptrapporten voor beoordeling.
> "Deze modellen stellen ons in staat om complexe documentprocessen te automatiseren die voorheen handmatig moesten worden gedaan," zegt een woordvoerder van Harvey.
Google heeft ook een client-side computer-use-tool direct in de Gemini API en Gemini Enterprise-platforms geïntegreerd, waardoor de aangepaste tussenliggende software die ingenieurs eerder bouwden om modellen op een besturingssysteem te laten werken, overbodig wordt. Het bedrijf rapporteert een OSWorld-Verified-score van 83,0 procent, gestegen van 78,4 procent, en zegt dat bijgewerkte beveiligingsmaatregelen tegen chemisch, biologisch, radiologisch en nucleair misbruik de weerstand tegen jailbreaken verbeteren zonder het weigeringspercentage voor goedaardige verzoeken te verhogen.
## Een goedkopere laag voor hoogvolume achtergrond-agents
Gemini 3.5 Flash-Lite is gericht op een andere taak: documentverwerking en agentisch zoeken op volume in plaats van redeneerdiepte. De Artificial Analysis Index mat het model op 350 outputtokens per seconde, de snelste in de 3.5-serie volgens Google.
De prijsstelling is €0,28 per 1 miljoen inputtokens en €2,30 per 1 miljoen outputtokens (omgerekend van $0,30 en $2,50). Dit is goedkoop genoeg dat technische teams eenvoudige, hoogvolume subagent-aanvragen naar een minimaal denkniveau kunnen leiden en hogere denkniveaus kunnen reserveren voor meerstapswerk.
Op Google's GDM-MRCR v2 long-context-test noteerde Gemini 3.5 Flash-Lite een succespercentage van 72,2 procent tegen 60,1 procent voor zijn voorganger, en de GDPval-AA v2-score bijna verdubbelde, van 642 naar 1140. Het model heeft dezelfde native computer-use-tool als 3.6 Flash.
Apart hiervan zegt Google dat Gemini 3.5 Pro nog in partnertests zit voorafgaand aan een volledige release, en dat de pre-training voor de volgende Gemini 4-architectuur al aan de gang is.
## Gemini 3.5 Flash Cyber: een beperkt model voor het patchen van code
Geautomatiseerde kwetsbaarheidsscanners vinden nu sneller fouten dan de meeste beveiligingsteams kunnen oplossen. Gemini 3.5 Flash Cyber is specifiek ontworpen om deze kloof te dichten. Het model is beperkt tot het herstellen van kwetsbaarheden en biedt een gerichte oplossing voor beveiligingsteams die worstelen met de toenemende stroom aan beveiligingsmeldingen.