Wetenschappelijke doorbraken zijn gebouwd op inzichten uit goede data, maar soms liggen deze verborgen onder een oceaan van een te grote hoeveelheid daarvan. Precies dit probleem heeft het California Institute for Regenerative Medicine (CIRM) besloten aan te pakken door een nieuw infrastructuurprogramma goed te keuren.
Onlangs heeft het CIRM investeringen goedgekeurd voor het creëren van instrumenten die zullen helpen bij het begrijpen van de enorme en complexe biologische datasets die zijn verkregen tijdens door het instituut gefinancierd onderzoek. Het programma is gericht op de ontwikkeling van nieuwe software voor de integratie van data uit de regeneratieve geneeskunde en het extraheren van nieuwe inzichten daaruit.
“Onze missie drijft ons vooruit,” merkte Jenny Bayram, senior wetenschappelijk medewerker bij het CIRM, op tijdens een bestuursvergadering. “We ontwikkelen instrumenten en strategieën om de waarde van de investeringen van het CIRM te maximaliseren, door de wetenschap te bevorderen en nieuwe manieren te creëren om met data te werken.”
Het nieuwe programma trekt 10 miljoen dollar uit voor 15–20 subsidies van elk 500 duizend dollar. Elk project zal een specifiek probleem op het gebied van data-integratie aanpakken. Sommige instrumenten zullen verschillende datatypen koppelen, andere zullen veelgebruikte open-source software verbeteren of ondersteunen die is aangepast aan de behoeften van de regeneratieve geneeskunde. Een deel van de projecten zal bestaande oplossingen vernieuwen zodat ze voldoen aan moderne berekeningen en de mogelijkheden van kunstmatige intelligentie.
De Data Science and Software Engineering Awards zijn gericht op het creëren van open-source instrumenten die verschillende soorten biomedische data integreren. Het op een handige manier samenbrengen van deze data zal, volgens het plan van het CIRM, de identificatie en validatie van nieuwe medicijndoelen en biomarkers voor de behandeling van ziekten versnellen.
Het gaat om het creëren van een infrastructuur die onderzoekers in staat stelt sneller met datasets te werken. Bijzondere aandacht wordt besteed aan software die in staat is de diversiteit aan data die wordt gegenereerd in onderzoek en klinische proeven in de regeneratieve geneeskunde, te vertalen naar een gemakkelijk uitwisselbaar formaat.
Enkele jaren geleden lanceerde de NIH een soortgelijk initiatief — het Biomedical Data Translator-programma voor de integratie van petabytes aan biomedische data uit federaal onderzoek. Het CIRM bouwt ook voort op zijn eigen eerdere investeringen in data-uitwisseling, waaronder het instrument Data Explorer, dat al meer dan 800 datasets van het CIRM bevat en deze toegankelijker maakt voor onderzoekers.
Het probleem van het begrijpen van complexe data speelt al lang bij overheidsonderzoek. Al in 2014 waarschuwde voormalig NIH-directeur Francis Collins het Congres dat de groeiende golf aan data onderzoekers zou kunnen overbelasten. Sindsdien zijn de schaal en complexiteit van data alleen maar toegenomen. De projecten en klinische proeven van het CIRM hebben al meer dan 1200 datasets opgeleverd, wat de noodzaak voor software-instrumenten om deze te verbinden heeft vergroot.
Sommige instrumenten combineren al verschillende soorten biomedische data, maar veel open-source systemen vereisen updates om te voldoen aan moderne berekeningen en AI. Nieuwe of verbeterde software beantwoordt beter aan de behoeften van onderzoekers in de regeneratieve geneeskunde. Het doel van het integreren van verschillende datatypen is om onderzoek te versnellen en de initiële investeringen van het CIRM maximaal te benutten, benadrukte Bayram.
Open, transparante, herbruikbare en uitbreidbare software kan de infrastructuur bieden die nodig is om deze barrières te overwinnen. Het CIRM vereist van aanvragers dat ze niet alleen nadenken over het creëren van het instrument, maar ook over de inzet, het gebruik, het onderhoud en de verbetering ervan in de loop van de tijd. Het instituut zoekt naar projecten met een brede impact — instrumenten die werken in verschillende systemen, datatypen en onderzoekscontexten.
Datawetenschap ontwikkelt zich snel en zelfs populaire instrumenten hebben regelmatig updates nodig. Deze investering helpt onderzoekers om de vooruitgang in berekeningen en AI bij te houden, evenals het voortdurend veranderende landschap van nieuwe onderzoeksdata. Ontwikkelaars van open-source oplossingen die ondersteuning ontvangen, zullen gefragmenteerde data kunnen omzetten in zinvolle ontdekkingen.

