OpenAI's nieuwe rapport toont aan dat AI-codeeragents de rekentijd van wetenschappelijke software drastisch verkorten. Acht projecten in genomics, immunologie en statistiek laten runtime-verlagingen zien tot 9,5x. Ontdek wat dit betekent voor de toekomst van onderzoekssoftware en technische schuld.
OpenAI heeft een nieuw rapport uitgebracht waarin acht wetenschappelijke computerprojecten worden gevolgd. Daarin blijkt dat codeeragents de rekentijd drastisch kunnen verkorten. Dit is geen standaard persbericht, maar een veldstudie die laat zien wat er gebeurt als je AI loslaat op verouderde onderzoekssoftware.
Het rapport beschrijft projecten die in vijf gevallen alleen Codex gebruikten en in drie gevallen een combinatie van Codex en Anthropic's Claude Code. Eerlijk is eerlijk: dit is een leverancier die een overzicht publiceert van de toepassing van zijn eigen product in onderzoeksomgevingen, gebaseerd op casestudy's van de betrokken bijdragers. Dat neemt niet weg dat het onderliggende patroon de moeite van het onderzoeken waard is.
### Het probleem met onderzoekssoftware
Onderzoekssoftware heeft een bekend onderhoudsprobleem. Tools die bij één artikel horen, geprogrammeerd door kleine academische teams zonder toegewijde technische ondersteuning, stapelen vaak technische schuld op. Niemand heeft het budget of de opdracht om die schuld in te lossen. Het gevolg: code die langzaam draait, moeilijk te hergebruiken is en uiteindelijk in de vergetelheid raakt.
OpenAI's rapport stelt dat AI-agents deze schuld kunnen aanpakken. De acht projecten bestrijken uiteenlopende gebieden zoals genomics, immunologie, statistiek en RNA-sequencing. Het gaat niet om luchtige beloften, maar om concrete resultaten.
### Wat de agents precies deden
De taken vielen grofweg in drie categorieën:
- Opschonen van verpakkings- en buildsysteem
- Prestatieoptimalisatie van bestaande code
- Volledige taal- of backend-migraties
Neem cyvcf2, een Python-bibliotheek voor het lezen van genomische variantbestanden. Bijdrager Brent Pedersen verving het verouderde bouw- en verpakkingssysteem door een nieuwer, uniform proces. Zijn opmerking: snel gaan met agents is één ding, maar ver komen in de wetenschap vereist nog steeds "expertbegeleiding, begrip, smaak en zorg."
HI.SIM, een DNA-sequencing-leessimulator, onderging twee grotendeels autonome optimalisatierondes van GPT-5.2 en GPT-5.6. Bijdrager Andrew Ho zegt dat de runtime met 31 procent daalde op een representatieve tests, zonder de output te wijzigen. Ho, die zichzelf omschrijft als noch genomics-specialist noch C-programmeur, noemde het resultaat "niets minder dan magisch" vanuit een eindgebruikersperspectief.
Hifiasm, gebruikt voor genoomassemblage van PacBio HiFi-lezingen, kreeg een runtime-verlaging van 25 procent op het optimalisatiedoel en ongeveer 15 procent op aparte menselijke sequencingdata. Bijdrager Suyash Shringarpure beschrijft hoe de agent zelfstandig benchmarkinfrastructuur opzette en kandidaten voorstelde. Maar hij benadrukt dat het aanleveren van profileringsresultaten en het sturen van het model weg van herhaalde faalwijzen werk blijft dat alleen een mens kan doen.
### Van TensorFlow naar PyTorch en de kracht van Rust
MHCflurry, dat eiwitfragmenten voorspelt die aan T-cellen worden gepresenteerd, migreerde zijn TensorFlow/Keras-backend naar PyTorch. De compatibiliteit met eerder uitgebrachte modelgewichten bleef behouden. Bijdragers Alex Rubinsteyn, Sergey Feldman en Timothy O'Donnell noemen dit het soort "onglamoureus, arbeidsintensief onderhoud" dat open-source wetenschappelijke projecten levend houdt in plaats van ze te laten wegkwijnen.
bayesm-rs, een Rust-port van statistische modellen uit R's bayesm-pakket, evenaarde de schattingen van de originele software binnen een vooraf ingestelde tolerantie. Op één processorthread draaide het 2,3 tot 2,7 keer sneller, op acht threads zelfs 4,4 tot 9,5 keer sneller. Volgens bijdragers Andrew Bai en Andrew Ho verwerkten de agents alles met een directe referentie snel en correct. Uitbreidingen die statistisch oordeel vereisten, hadden directe menselijke validatie nodig.
Drie verdere projecten – rustar-aligner, svb en kuva – gebruikten Rust-builds met codeeragents. Daaronder valt een volledige recreatie van STAR, een veelgebruikte RNA-sequentie-aligneringstool die actief onderhoud had verloren.
Bijdrager James M. Ferguson zegt dat agents veranderen wat de moeite waard is om te proberen: het met de hand herschrijven van een aligner van 20.000 regels code is geen zinvolle tijdsbesteding, maar met een agent wordt het weken van gestuurd werk. Wel voegt hij toe: verificatie is een aparte zaak. Een model kan code genereren, maar of die code correct is, blijft mensenwerk.