Google's nieuwe AI-modellen verlagen kosten voor enterprise agents drastisch

·
Luister naar dit artikel~5 min
Google's nieuwe AI-modellen verlagen kosten voor enterprise agents drastisch

Google lanceert Gemini 3.6 Flash en 3.5 Flash-Lite: nieuwe AI-modellen die tokenkosten drastisch verlagen voor enterprise agents. Ontdek de cijfers, prestaties en impact voor Nederlandse bedrijven.

Google heeft onlangs Gemini 3.6 Flash en 3.5 Flash-Lite gelanceerd. Deze nieuwe modellen zijn ontworpen om de latentie en tokengerelateerde kosten voor AI-agents in bedrijfsomgevingen aanzienlijk te verlagen. De economie van het draaien van autonome software-agents in een productieomgeving draait om een simpele vergelijking die maar weinig leveranciers direct adverteren. Een model moet een taak met meerdere stappen goed kunnen beredeneren, maar elke extra token die het daarbij genereert, verhoogt de kosten en vertraagt een workflow die duizenden keren per uur kan draaien. Teams die achtergrond-agents bouwen in plaats van chatinterfaces, hebben vooral doorvoer nodig en pas daarna het aantal parameters. Google's antwoord, aangekondigd deze week, splitst die afweging op in drie modellen: Gemini 3.6 Flash voor coderen en multimodaal redeneren, Gemini 3.5 Flash-Lite voor hoogvolume, lage-latentie werk, en een beperkte Gemini 3.5 Flash Cyber-variant voor het herstellen van kwetsbaarheden. ### De cijfers achter Gemini 3.6 Flash Google's ontwikkelaarsdocumentatie voor 3.6 Flash draait om één cijfer: 17 procent minder output-tokens dan de vorige 3.5 Flash-versie, gebaseerd op metingen van de Artificial Analysis Index. In specifieke synthetische tests, waaronder de Datacurve DeepSWE-benchmark, meldt Google dalingen in tokenverbruik tot 65 procent. De prijzen liggen op €1,40 per 1M input-tokens en €7,00 per 1M output-tokens, wat het model positioneert voor redeneerlussen die continu draaien in plaats van op aanvraag. Op DeepSWE scoort het bedrijf een slagingspercentage van 49 procent voor 3.6 Flash, tegen 37 procent voor zijn voorganger. Op MLE Bench stijgt de score van 49,7 naar 63,9 procent, en op Google's GDPval-AA v2-test – die probeert echte kenniswerk te meten in plaats van codeerpuzzels – scoort 3.6 Flash 1421 tegen 1349 voor het oudere model. ### Figma, Hebbia en Harvey zetten het model in Figma heeft 3.6 Flash geïntegreerd in zijn prototyping-infrastructuur. Volgens Matt Colyer, Director of Product Engineering bij het bedrijf, geeft het model ontwikkelaars een snellere route door ontwerpiteraties zonder verlies van outputkwaliteit. Juridisch technologieplatform Harvey en onderzoekstool Hebbia leiden gegevens via het model voor multimodaal documentwerk: het verwerken van ruwe financiële rapporten, het ontleden van documentstructuur, het lezen van ingebedde grafieken en het produceren van conceptrapporten ter beoordeling. Google heeft ook een client-side computer-use tool direct in de Gemini API en Gemini Enterprise-platforms verwerkt. Dit verwijdert de aangepaste tussensoftware die ingenieurs eerder bouwden om modellen bovenop een besturingssysteem te laten werken. Het bedrijf rapporteert een OSWorld-Verified score van 83,0 procent, een stijging van 78,4 procent. Daarnaast zeggen ze dat bijgewerkte beveiligingsmaatregelen tegen chemisch, biologisch, radiologisch en nucleair misbruik de weerstand tegen jailbreaking verbeteren zonder dat het aantal weigeringen voor onschuldige verzoeken toeneemt. ### Een goedkopere laag voor hoogvolume achtergrond-agents Gemini 3.5 Flash-Lite is gericht op een andere taak: documentverwerking en agentisch zoeken op volume in plaats van redeneerdiepte. De Artificial Analysis Index mat het model op 350 output-tokens per seconde, de snelste in de 3.5-serie volgens Google. De prijzen liggen op €0,28 per 1M input-tokens en €2,33 per 1M output-tokens. Dit is goedkoop genoeg dat technische teams eenvoudige, hoogvolume subagent-verzoeken naar een minimaal denkniveau kunnen sturen en hogere denkniveaus kunnen reserveren voor werk met meerdere stappen. Op Google's GDM-MRCR v2 long-context test scoorde Gemini 3.5 Flash-Lite een slagingspercentage van 72,2 procent tegen 60,1 procent voor zijn voorganger. De GDPval-AA v2-score verdubbelde bijna, van 642 naar 1140. Het model heeft dezelfde native computer-use tool als 3.6 Flash. Los daarvan zegt Google dat Gemini 3.5 Pro nog in partner-testen zit voorafgaand aan een volledige release. De pre-training voor de volgende Gemini 4-architectuur is al aan de gang. ### Gemini 3.5 Flash Cyber: een beperkt model voor het patchen van code Geautomatiseerde kwetsbaarheidsscanners ontdekken nu sneller fouten dan de meeste beveiligingsteams kunnen oplossen. Dit model is specifiek ontworpen om die kloof te dichten door zich te richten op het herstellen van codekwetsbaarheden. ### Wat betekent dit voor Nederlandse bedrijven? Deze nieuwe modellen bieden aanzienlijke voordelen voor Nederlandse bedrijven die AI-agents inzetten. De lagere tokenkosten maken het economisch haalbaar om continu draaiende agents te implementeren voor taken zoals: - Klantenservice automatisering - Documentverwerking - Code review en beveiliging - Data-analyse De verbeterde prestaties op benchmarks zoals DeepSWE en MLE Bench laten zien dat deze modellen niet alleen goedkoper zijn, maar ook beter presteren dan hun voorgangers. Dit betekent dat Nederlandse ontwikkelteams meer waarde kunnen halen uit hun AI-investeringen.