Los avances científicos se construyen sobre la base de conocimientos extraídos de buenos datos, pero a veces estos se encuentran ocultos bajo un océano de información excesiva. Precisamente este es el problema que el Instituto de Medicina Regenerativa de California (CIRM) ha decidido abordar al aprobar un nuevo programa de infraestructura.
Recientemente, el CIRM aprobó inversiones para la creación de herramientas que ayuden a comprender los enormes y complejos conjuntos de datos biológicos obtenidos durante las investigaciones financiadas por el instituto. El programa tiene como objetivo desarrollar nuevo software para la integración de datos de medicina regenerativa y la extracción de nuevos conocimientos a partir de ellos.
«Nuestra misión nos impulsa hacia adelante», señaló Jenny Bayram, investigadora principal del CIRM, durante una reunión de la junta. «Estamos desarrollando herramientas y estrategias para maximizar el valor de las inversiones del CIRM, promoviendo la ciencia y creando nuevas formas de trabajar con los datos».
El nuevo programa asigna 10 millones de dólares para entre 15 y 20 subvenciones de 500 mil dólares cada una. Cada proyecto abordará una tarea específica de integración de datos. Algunas herramientas conectarán diferentes tipos de datos, mientras que otras mejorarán o mantendrán software de código abierto ampliamente utilizado, adaptado a las necesidades de la medicina regenerativa. Parte de los proyectos actualizará soluciones existentes para que se ajusten a la computación moderna y a las capacidades de la inteligencia artificial.
Los premios Data Science and Software Engineering Awards tienen como objetivo crear herramientas de código abierto que integren diversos tipos de datos biomédicos. La conexión de estos datos de una forma accesible, según el plan del CIRM, acelerará la identificación y validación de nuevas dianas terapéuticas y biomarcadores para el tratamiento de enfermedades.
Se trata de crear una infraestructura que permita a los investigadores trabajar más rápidamente con los conjuntos de datos. Se presta especial atención al software capaz de traducir la diversidad de datos generados en las investigaciones y ensayos clínicos de medicina regenerativa a un formato fácilmente intercambiable.
Hace unos años, los NIH lanzaron una iniciativa similar: el programa Biomedical Data Translator para la integración de petabytes de datos biomédicos procedentes de investigaciones federales. El CIRM también se apoya en sus propias inversiones anteriores en el intercambio de datos, incluida la herramienta Data Explorer, que ya contiene más de 800 conjuntos de datos del CIRM y los hace más accesibles para los investigadores.
El problema de dar sentido a datos complejos ha sido un reto constante para la investigación pública. Ya en el año 2014, el ex director de los NIH, Francis Collins, advirtió al Congreso que la creciente ola de datos podría sobrecargar a los investigadores. Desde entonces, la escala y la complejidad de los datos no han hecho más que aumentar. Los proyectos y ensayos clínicos del CIRM ya han generado más de 1200 conjuntos de datos, lo que ha intensificado la necesidad de herramientas de software para conectarlos.
Algunas herramientas ya combinan diferentes tipos de datos biomédicos, sin embargo, muchos sistemas de código abierto requieren actualizaciones para cumplir con la computación moderna y la IA. El software nuevo o mejorado responde mejor a las necesidades de los investigadores de medicina regenerativa. El objetivo de integrar diferentes tipos de datos es acelerar la investigación y maximizar las inversiones iniciales del CIRM, subrayó Bayram.
Un software abierto, transparente, reutilizable y ampliable puede proporcionar la infraestructura necesaria para superar estas barreras. El CIRM exige a los solicitantes que piensen no solo en la creación de la herramienta, sino también en su despliegue, uso, mantenimiento y mejora a lo largo del tiempo. El instituto busca proyectos con un impacto amplio: herramientas que funcionen en diferentes sistemas, tipos de datos y contextos de investigación.
La ciencia de datos evoluciona rápidamente, e incluso las herramientas populares necesitan actualizaciones periódicas. Esta inversión ayuda a los investigadores a mantenerse al día con el progreso en computación e IA, así como con el panorama en constante cambio de los nuevos datos de investigación. Los desarrolladores de soluciones de código abierto que reciban apoyo podrán transformar datos fragmentados en descubrimientos significativos.

