OpenAI's nieuwe rapport toont hoe AI-codeagenten acht wetenschappelijke projecten versnelden, van 31% snellere simulatoren tot volledige Rust-ports. Ontdek wat dit betekent voor onderzoekssoftware.
OpenAI heeft een nieuw veldrapport gepubliceerd waarin acht wetenschappelijke computerprojecten worden gevolgd waar AI-codeagenten de rekentijd aanzienlijk hebben verkort. Het is een opvallend document, want het laat zien hoe geautomatiseerde hulpmiddelen niet alleen code schrijven, maar ook bestaande software kunnen optimaliseren en zelfs volledig kunnen herschrijven.
Belangrijk om te weten: dit is een leverancier die een enquête publiceert over de toepassing van het eigen product in onderzoeksomgevingen, gebaseerd op casestudy's die door de betrokken bijdragers zijn geschreven. Dat neemt niet weg dat het onderliggende patroon het bekijken waard is.
### Waarom wetenschappelijke software vaak achterblijft
Onderzoekssoftware heeft een bekend onderhoudsprobleem. Tools die zijn gebouwd voor één enkele paper, vaak gecodeerd door kleine academische teams zonder toegewijde technische ondersteuning, verzamelen technische schuld die niemand het budget of de opdracht heeft om af te lossen. Het resultaat? Software die na publicatie langzaam maar zeker veroudert en uiteindelijk onbruikbaar wordt.
Het rapport van OpenAI stelt dat AI-agenten deze schuld kunnen aanpakken. De acht genoemde projecten bestrijken uiteenlopende terreinen: genomica, immunologie, statistiek en RNA-sequencing. Dat is een breed scala, wat suggereert dat de toepassing niet beperkt blijft tot één niche.
### Wat de agenten precies deden
De taken vallen grofweg in drie categorieën uiteen:
- **Verpakking en build-systeem opruimen**: verouderde systemen vervangen door modernere, uniforme processen.
- **Prestatieoptimalisatie**: bestaande code sneller maken zonder de output te wijzigen.
- **Volledige taal- of backend-ports**: software migreren naar een andere programmeertaal of framework.
Een goed voorbeeld is cyvcf2, een Python-bibliotheek voor het lezen van genomische variantbestanden. Bijdrager Brent Pedersen liet het verouderde build- en verpakkingssysteem vervangen door een nieuwer, uniform proces. Hij merkte daarbij op dat snel gaan met agenten één ding is, maar dat wetenschap nog steeds 'deskundige begeleiding, begrip, smaak en zorg' nodig heeft.
### Indrukwekkende resultaten, maar met een kanttekening
HI.SIM, een DNA-sequencing read-simulator, onderging twee grotendeels autonome optimalisatieslagen met GPT-5.2 en GPT-5.6. Bijdrager Andrew Ho zegt dat dit de rekentijd met 31 procent verminderde over een representatieve testset, zonder de output te veranderen. Ho, die zichzelf omschrijft als noch een genomica-specialist noch een C-programmeur, noemt het resultaat 'ronduit magisch' vanuit het perspectief van een eindgebruiker.
Hifiasm, gebruikt voor genoomassemblage uit PacBio HiFi-reads, kreeg een rekentijdvermindering van 25 procent op het optimalisatiedoel en ongeveer 15 procent op afzonderlijke menselijke sequencingdata. Bijdrager Suyash Shringarpure beschrijft hoe de agent zelf een benchmarkomgeving opzette en zelfstandig kandidaten voorstelde. Toch benadrukt hij dat het aanleveren van profileringsresultaten en het bijsturen van het model bij herhaalde foutpatronen werk blijft dat alleen een mens kan doen.
### Migraties en ports: een nieuwe kans voor verwaarloosde software
MHCflurry, dat eiwitfragmenten voorspelt die aan T-cellen worden gepresenteerd, kreeg een migratie van de TensorFlow/Keras-backend naar PyTorch, terwijl de compatibiliteit met eerder uitgebrachte modelgewichten behouden bleef. Bijdragers Alex Rubinsteyn, Sergey Feldman en Timothy O'Donnell omschrijven dit als het soort 'onglamoureuze, arbeidsintensieve onderhoud' dat open-source wetenschappelijke projecten in leven houdt in plaats van ze te laten vervallen.
bayesm-rs, een Rust-port van statistische modellen uit R's bayesm-pakket, kwam binnen een vooraf ingestelde tolerantie overeen met de schattingen van de originele software. Op een enkele processorthread draaide het 2,3 tot 2,7 keer sneller; over acht threads zelfs 4,4 tot 9,5 keer sneller. Bijdragers Andrew Bai en Andrew Ho melden dat de agenten alles met een directe referentie snel en correct afhandelden, maar dat uitbreidingen die statistisch inzicht vereisten, directe menselijke validatie nodig hadden.
### Een fundamentele verandering in wat de moeite waard is
Drie verdere projecten – rustar-aligner, svb en kuva – betroffen Rust-builds met codeagenten, waaronder een volledige recreatie van STAR, een veelgebruikt RNA-sequentie-uitlijningsinstrument dat geen actief onderhoud meer had.
Bijdrager James M. Ferguson zegt dat agenten veranderen wat de moeite waard is om te proberen: het met de hand herschrijven van een uitlijningsprogramma van 20.000 regels is geen verstandig gebruik van tijd, maar met een agent wordt het weken van gestuurd werk. Verificatie, voegt hij toe, is een heel ander verhaal. Een model kan veel, maar uiteindelijk blijft de menselijke controle essentieel.
De boodschap is duidelijk: AI-codeagenten kunnen een grote rol spelen in het onderhoud en de modernisering van wetenschappelijke software. Maar ze vervangen de expert niet – ze versterken diegene die weet waar hij op moet letten.