NVIDIA, Google DeepMind y EMBL-EBI publican una base de datos abierta con estructuras 3D de más de 2.800 virus para la prevención de pandemias

La alianza global ha generado mediante IA la predicción de complejos proteicos virales, incluyendo un 30% de interacciones totalmente inéditas para la ciencia, con el fin de acelerar el desarrollo de vacunas y tratamientos.

Guardar
Compartir
Photo by CDC / Unsplash

    En el marco de la reunión de la Asamblea General de las Naciones Unidas sobre preparación frente a pandemias en Nueva York, NVIDIA ha anunciado una alianza estratégica con Google DeepMind, el Instituto Europeo de Bioinformática (EMBL-EBI) y diversas instituciones académicas globales para publicar un conjunto de datos en abierto con las estructuras tridimensionales predichas de los complejos proteicos de más de 2.800 virus.

    El proyecto busca dotar a la comunidad científica internacional de herramientas estructurales avanzadas antes de la aparición de emergencias sanitarias globales. La iniciativa cobra relevancia ante las estimaciones del Center for Global Development, que señalan un 50% de probabilidades de que el mundo enfrente hacia 2050 una pandemia de severidad similar a la del COVID-19.

    Inferencia a gran escala con AlphaFold2 y NVIDIA BioNeMo

    Las estructuras tridimensionales incluidas en la actualización fueron calculadas mediante el modelo de aprendizaje profundo AlphaFold2, optimizado técnicamente a través de la infraestructura NVIDIA BioNeMo Inference Runtime.

    Esta aceleración mediante GPU permitió escalar el procesamiento informático a miles de proteomas virales completos, prediciendo no solo proteínas aisladas, sino las interacciones complejas que forman cuando se ensamblan dentro del virus.

    Paralelamente a los datos, NVIDIA ha liberado en código abierto el flujo de trabajo denominado BioNeMo Structure Prediction Pipeline, permitiendo a laboratorios independientes ejecutar predicciones 3D a partir de secuencias genéticas primarias de sus propios objetivos de investigación.

    Risha Patel, responsable de alianzas en ciencias de la vida de Google DeepMind, valoró el alcance de la iniciativa:

    "Nuestra ambición con la base de datos AlphaFold siempre ha sido democratizar el acceso a la biología fundamental a gran escala. Esta colaboración para incorporar miles de complejos virales equipará a los científicos de todo el mundo con el conocimiento necesario para prepararse ante futuros brotes."

    Descubrimiento de interacciones inéditas para la ciencia

    Los métodos experimentales tradicionales para determinar estructuras moleculares (como la cristalografía de rayos X) requieren años de trabajo y costes elevados por cada proteína. El uso de la IA generativa en bioinformática reduce este tiempo de cómputo a cuestión de minutos.

    El análisis inicial de la nueva base de datos revela avances cuantitativos clave para la biología digital:

    • Interacciones novedosas: Aproximadamente el 30% de las interacciones proteicas identificadas son completamente nuevas para la ciencia, no habiendo sido documentadas previamente en el Protein Data Bank.
    • Rango de patógenos: El muestreo abarca desde familias de virus causantes del resfriado común hasta amenazas emergentes como el virus de la viruela del mono (Mpox).
    • Acceso universal: Al integrarse en el portal de preparación ante pandemias de la AlphaFold Database, la información queda disponible para investigadores en entornos de bajos recursos o zonas endémicas que enfrentan brotes en primera línea.

    Con esta incorporación, la base de datos de AlphaFold supera los 260 millones de predicciones de estructuras y complejos proteicos, consolidándose como la mayor biblioteca digital de biología estructural del mundo.