Google DeepMind en Isomorphic Labs hebben een bioresilience-programma aangekondigd om AI-misbruik in de biologie te voorkomen. Met meer dan 15 partnerschappen en een focus op preventie, detectie en respons, zetten ze in op een veilige toekomst voor AI in de wetenschap.
Google DeepMind en Isomorphic Labs hebben een bioresilience-programma aangekondigd om AI-misbruik in de biologie te beperken en tegelijkertijd de respons op uitbraken te verbeteren. Dit initiatief, dat stilletjes begon, heeft in het afgelopen jaar meer dan 15 partnerschappen opgebouwd met overheidsinstanties, biosecurity-organisaties en onderzoeksgroepen. Maar waarom is dit zo belangrijk? Laten we het eens bekijken.
### De dubbele uitdaging van AI in de biologie
Frontier-modellen zoals Gemini hebben een steeds gedetailleerder begrip van biologie. DeepMind geeft toe dat het combineren van deze systemen met gespecialiseerde biologische modellen, agents zoals het Antigravity-platform, en externe databases deze capaciteit alleen maar zal verscherpen. Het probleem is dat dezelfde kennis die een onderzoeker helpt een vaccindoelwit in kaart te brengen, in principe ook een kwaadwillende kan helpen om gaten in hun eigen begrip te dichten. DeepMind en Isomorphic noemen dit een duaal mandaat: de wetenschappelijke vooruitgang mogelijk maken die frontier AI biedt, terwijl diezelfde tools uit handen worden gehouden van mensen die ze willen misbruiken.
### De drie pijlers van het programma
Volgens de bedrijven rust het programma op drie pijlers:
- **Voorkomen van misbruik:** Door middel van dreigingsmodellen identificeren ze welke actoren het meest waarschijnlijk misbruik zullen proberen en welke knelpunten hen momenteel stoppen.
- **Sneller detecteren van uitbraken:** Partnerschappen met organisaties zoals Lawrence Livermore National Laboratory en het UK AI Security Institute helpen bij het opzetten van systemen om uitbraken eerder te herkennen.
- **Reageren op uitbraken of aanvallen:** Zodra een uitbraak of aanval gaande is, wordt er samengewerkt met instanties zoals CEPI en het Francis Crick Institute om snel te kunnen handelen.
### Hoe Gemini wordt beveiligd zonder legitieme wetenschap te blokkeren
Het preventiewerk is gebaseerd op dreigingsmodellen die ontworpen zijn om te identificeren welke actoren het meest waarschijnlijk misbruik zullen proberen en welke knelpunten hen momenteel stoppen. DeepMind gebruikt een mix van expert red-teaming en gerandomiseerde gecontroleerde onderzoeken om te beoordelen of Gemini iemand zou kunnen helpen die knelpunten te overwinnen. Post-training methoden zijn bedoeld om het model te leren schadelijke vragen te weigeren, terwijl over-weigering van legitieme wetenschappelijke vragen wordt vermeden. Dit is een balans die in de hele industrie moeilijk te vinden is, niet alleen voor DeepMind.
Classifiers en probes worden ingezet om risicovolle activiteiten in realtime te signaleren, en het bedrijf voert gerichte loganalyse uit om subtielere misbruikpatronen te ontdekken die geautomatiseerde filters mogelijk missen. Geen van deze mitigaties wordt als opgelost beschreven. DeepMind ziet ze als een doorlopend proces in plaats van een afgerond systeem. Dit is cruciaal voor elke onderneming of overheidsinstantie die overweegt te vertrouwen op de beveiligingsmaatregelen in hun huidige configuratie. Een classifier die getraind is op bekende jailbreak-patronen in een gecontroleerde evaluatie, garandeert geen gelijkwaardige prestaties tegen nieuwe aanvalsmethoden die in de praktijk opduiken. Het bedrijf beweert ook niet anders.
### Het DNA-synthese screening probleem
Een van de meer concrete risico's die worden onderzocht, heeft te maken met DNA-synthese. Bedrijven binnen het International Gene Synthesis Consortium screenen momenteel bestellingen tegen lijsten van bekende schadelijke pathogenen en toxines, met behulp van screeningalgoritmen. DeepMind stelt duidelijk dat deze aanpak begint te haperen, omdat AI nu kan helpen bij het ontwerpen van DNA-sequenties met een vergelijkbare functie als een gevaarlijk pathogeen, zonder dat de sequentie nauw genoeg overeenkomt om bestaande screens te activeren.
De voorgestelde oplossing leunt op DeepMinds bestaande watermerksysteem, SynthID, dat volgens het bedrijf een industrienorm is geworden voor het markeren van AI-gegenereerde afbeeldingen en tekst. Het aanpassen ervan aan biologische sequenties wordt gepresenteerd als verkennend werk, maar het laat zien hoe innovatie kan worden ingezet om nieuwe dreigingen het hoofd te bieden.
### Wat dit betekent voor de toekomst
DeepMind zegt de komende zes tot twaalf maanden deze relaties te willen uitbreiden, met aandacht voor dreigingsinformatie, evaluatiemethoden voor AI-agents en jailbreak-mitigaties. Het coördineert ook met het Frontier Model Forum over vragen zoals hoe om te gaan met risicovollere categorieën trainingsdata, waarbij virologie-datasets als voorbeeld worden gegeven. Dit is een spannende ontwikkeling die de balans laat zien tussen vooruitgang en veiligheid. Het is een herinnering dat AI niet alleen krachtig is, maar ook verantwoordelijk moet worden beheerd.
> "Dezelfde kennis die een onderzoeker helpt een vaccindoelwit in kaart te brengen, kan in principe ook een kwaadwillende helpen."
Dit citaat vat de kern van het probleem samen. Het is een uitdaging die we alleen kunnen aangaan met samenwerking, innovatie en een gezonde dosis realisme.