Google DeepMind en Isomorphic Labs lanceren een bioresilience-programma om AI-misbruik in de biologie te voorkomen. Het initiatief heeft al meer dan 15 partnerschappen opgebouwd en richt zich op preventie, detectie en respons.
Google DeepMind en Isomorphic Labs hebben een bioresilience-programma gelanceerd om AI-misbruik in de biologie te voorkomen en tegelijkertijd de respons op uitbraken te versnellen. Dit initiatief, dat stilletjes begon, heeft in het afgelopen jaar meer dan 15 partnerschappen opgebouwd met overheidsinstanties, biosecurity-organisaties en onderzoeksgroepen.
### Het dubbele mandaat van AI in de biologie
Frontier-modellen zoals Gemini hebben een steeds gedetailleerdere kennis van de biologie. DeepMind erkent dat het combineren van deze systemen met gespecialiseerde biologie-modellen, agents zoals Antigravity en externe databases, die capaciteit alleen maar zal verscherpen. Maar dezelfde kennis die een onderzoeker helpt bij het in kaart brengen van een vaccindoelwit, kan in principe ook een kwaadwillende helpen om gaten in diens begrip te dichten. DeepMind en Isomorphic noemen dit een dubbel mandaat: de wetenschappelijke vooruitgang mogelijk maken die frontier AI mogelijk maakt, terwijl dezelfde tools uit handen blijven van mensen die ze zouden misbruiken.
### De drie pijlers van het programma
Het programma rust op drie pijlers: het voorkomen van misbruik, het sneller detecteren van uitbraken en het reageren zodra een uitbraak of aanval gaande is. De meer dan 15 partnerschappen die het afgelopen jaar zijn opgebouwd, raken alle drie deze pijlers. Hoewel de update beperkte details geeft over welke organisaties betrokken zijn, worden enkele namen genoemd: Lawrence Livermore National Laboratory, het UK AI Security Institute, CEPI en het Francis Crick Institute.
DeepMind zegt van plan te zijn om deze relaties in de komende zes tot twaalf maanden uit te breiden. De focus zal liggen op threat intelligence, evaluatiemethoden voor AI-agents en jailbreak-mitigaties. Ook coördineert het bedrijf met het Frontier Model Forum over vragen zoals hoe om te gaan met risicovollere categorieën van trainingsdata. Viroloog-datasets worden als voorbeeld genoemd.
### Hoe Gemini wordt beveiligd zonder legitieme wetenschap te blokkeren
Het preventiewerk is gebaseerd op dreigingsmodellen die zijn ontworpen om te identificeren welke actoren het meest waarschijnlijk misbruik zullen proberen te maken en welke knelpunten hen momenteel stoppen. DeepMind gebruikt een mix van expert red-teaming en gerandomiseerde gecontroleerde onderzoeken om te beoordelen of Gemini iemand zou kunnen helpen bij het overwinnen van die knelpunten.
Post-training methoden zijn bedoeld om het model te leren schadelijke vragen te weigeren, terwijl wordt voorkomen wat het bedrijf 'over-weigering' van legitieme wetenschapsvragen noemt. Deze balans is in de hele industrie moeilijk gebleken, niet alleen voor DeepMind. Classifiers en probes worden ingezet om risicovolle activiteiten in real-time te markeren. Het bedrijf voert ook gerichte loganalyse uit om subtielere misbruikpatronen te onderscheppen die geautomatiseerde filters mogelijk missen.
Geen van deze mitigaties wordt beschreven als opgelost. DeepMind beschouwt ze als een doorlopend proces in plaats van een afgerond systeem. Dit is belangrijk voor elke onderneming of overheidsinstantie die overweegt om op de beveiligingen te vertrouwen zoals ze nu zijn geconfigureerd. Een classifier die is afgestemd op bekende jailbreak-patronen in een gecontroleerde evaluatie, garandeert geen gelijkwaardige prestaties tegen nieuwe aanvalsmethoden die in live-gebruik opduiken. En DeepMind beweert ook niet anders.
### Het DNA-synthese screening probleem
Een van de meer concrete risico's die worden onderzocht, betreft DNA-synthese. Bedrijven binnen de International Gene Synthesis Consortium screenen momenteel bestellingen tegen lijsten van bekende schadelijke pathogenen en toxines, met behulp van screeningsalgoritmen. DeepMind stelt duidelijk dat deze aanpak begint te haperen, omdat AI nu kan helpen bij het ontwerpen van DNA-sequenties die qua functie lijken op een gevaarlijk pathogeen, zonder dat de sequentie precies genoeg overeenkomt om bestaande schermen te activeren.
De voorgestelde oplossing leunt op DeepMinds bestaande watermerksysteem, SynthID, dat volgens het bedrijf een industriestandaard is geworden voor het markeren van AI-gegenereerde afbeeldingen en tekst. Het aanpassen ervan aan biologische sequenties wordt gepresenteerd als verkennend werk, niet als een afgeronde oplossing.
### Wat dit betekent voor de toekomst
Het is duidelijk dat AI een tweesnijdend zwaard is in de biologie. Aan de ene kant kunnen we sneller vaccins ontwikkelen en uitbraken detecteren. Aan de andere kant moeten we waakzaam blijven om misbruik te voorkomen. DeepMind's aanpak is een stap in de goede richting, maar het is geen wondermiddel. Het is een doorlopende strijd die constante aanpassing vereist.
- **Preventie**: Dreigingsmodellen en red-teaming helpen om risico's in kaart te brengen.
- **Detectie**: Classifiers en probes signaleren verdachte activiteiten in real-time.
- **Respons**: Partnerschappen met overheidsinstanties en onderzoeksgroepen versnellen de reactie bij uitbraken.
De komende maanden zullen uitwijzen of deze aanpak effectief is. Voor nu blijft het een boeiend experiment in het balanceren van innovatie en veiligheid.