Google's nieuwe AI-modellen verlagen kosten voor enterprise agents flink

·
Luister naar dit artikel~4 min
Google's nieuwe AI-modellen verlagen kosten voor enterprise agents flink

Google lanceert Gemini 3.6 Flash en 3.5 Flash-Lite om latentie en tokenkosten voor enterprise AI-agents te verlagen. Ontdek de prestaties, prijzen en toepassingen.

Google heeft zojuist twee nieuwe AI-modellen gelanceerd: Gemini 3.6 Flash en Gemini 3.5 Flash-Lite. Deze modellen zijn speciaal ontworpen om de latentie en tokenkosten voor enterprise AI-agents te verlagen. De economie van het draaien van autonome software-agents in een productieomgeving komt neer op een vaste vergelijking die weinig leveranciers direct adverteren. Een model moet een meerstapstaak competent kunnen beredeneren, maar elke extra token die het daarbij genereert, voegt kosten en vertraging toe aan een workflow die duizenden keren per uur kan draaien. Teams die achtergrond-agents bouwen in plaats van chatinterfaces, hebben eerst doorvoer nodig en pas daarna parametergrootte. Google's antwoord, deze week aangekondigd, splitst die afweging over drie modellen: Gemini 3.6 Flash voor codering en multimodaal redeneren, Gemini 3.5 Flash-Lite voor hoogvolume, lage-latentiewerk, en een beperkte Gemini 3.5 Flash Cyber-variant voor kwetsbaarheidsherstel. ### De wiskunde achter Gemini 3.6 Flash Google's ontwikkelaarsdocumentatie voor 3.6 Flash draait om één cijfer: 17 procent minder outputtokens dan de vorige 3.5 Flash-versie, gebaseerd op metingen van de Artificial Analysis Index. In specifieke synthetische tests, waaronder de Datacurve DeepSWE-benchmark, rapporteert Google een daling van het tokenverbruik tot 65 procent. De prijzen liggen op €1,38 per 1 miljoen invoertokens en €6,90 per 1 miljoen uitvoertokens, waarmee het model is gepositioneerd voor redeneercycli die continu draaien in plaats van op aanvraag. Op DeepSWE noteert het bedrijf een slagingspercentage van 49 procent voor 3.6 Flash tegen 37 procent voor zijn voorganger. Op MLE Bench gaat de score van 49,7 procent naar 63,9 procent, en op Google's GDPval-AA v2-test – die probeert echte kenniswerk te meten in plaats van codeerpuzzels – scoort 3.6 Flash 1421 tegen 1349 voor het oudere model. ### Figma, Hebbia en Harvey zetten het model aan het werk Figma heeft 3.6 Flash geïntegreerd in zijn prototyping-infrastructuur. Volgens Matt Colyer, de directeur van Product Engineering van het bedrijf, geeft het model ontwikkelaars een snellere route door ontwerpiteraties zonder verlies van uitvoerkwaliteit. Juridisch technologieplatform Harvey en onderzoekstool Hebbia leiden gegevens door het model voor multimodaal documentwerk: het verwerken van ruwe financiële deponeringen, het ontleden van documentstructuur, het lezen van ingebedde grafieken en het produceren van conceptrapporten ter beoordeling. Google heeft ook een client-side computer-use tool direct in de Gemini API en Gemini Enterprise platforms gevouwen, waarmee de aangepaste tussenliggende software wordt verwijderd die ingenieurs eerder bouwden om modellen te laten werken bovenop een besturingssysteem. Het bedrijf rapporteert een OSWorld-Verified score van 83,0 procent, tegen 78,4 procent, en zegt dat bijgewerkte beveiligingen tegen chemisch, biologisch, radiologisch en nucleair misbruik de weerstand tegen jailbreaken verbeteren zonder de weigeringspercentages voor goedaardige verzoeken te verhogen. ### Een goedkopere laag voor hoogvolume achtergrondagents Gemini 3.5 Flash-Lite richt zich op een andere taak: documentverwerking en agentisch zoeken op volume in plaats van redeneerdiepte. De Artificial Analysis Index mat het model op 350 outputtokens per seconde, de snelste in de 3.5-serie volgens Google. De prijzen liggen op €0,28 per 1 miljoen invoertokens en €2,30 per 1 miljoen uitvoertokens, goedkoop genoeg dat technische teams eenvoudige, hoogvolume subagentverzoeken naar een minimaal denkniveau kunnen sturen en hogere denkniveaus kunnen reserveren voor meerstapswerk. Op Google's GDM-MRCR v2 long-context test noteerde Gemini 3.5 Flash-Lite een slagingspercentage van 72,2 procent tegen 60,1 procent voor zijn voorganger, en de GDPval-AA v2-score verdubbelde bijna, van 642 naar 1140. Het model heeft dezelfde native computer-use tool als 3.6 Flash. ### Gemini 3.5 Flash Cyber: Een beperkt model voor het patchen van code Automatische kwetsbaarheidsscanners vinden nu sneller fouten dan de meeste beveiligingsteams kunnen repareren. Google's Gemini 3.5 Flash Cyber is een speciaal getraind model dat is ontworpen om beveiligingslekken te identificeren en te patchen, zonder toegang te geven tot bredere AI-capaciteiten. Afzonderlijk zegt Google dat Gemini 3.5 Pro nog in partnertests zit voorafgaand aan een volledige release, en dat de pre-training voor de volgende Gemini 4-architectuur al aan de gang is.