
O investigador, catedrático da Universidade de Pensilvania e director do Machine Biology Group, lidera o desenvolvemento de ApexFold, un novo modelo de intelixencia artificial que aprende como a estrutura dos péptidos se modifica en función das condicións químicas nas que se atopan.
A estrutura das moléculas biolóxicas non é necesariamente fixa. Algúns péptidos poden permanecer desordenados nun medio acuoso e adoptar estruturas máis organizadas cando entran en contacto con determinadas interfaces, como as membranas. Esta capacidade de modificar a súa conformación pode resultar determinante para a función que desempeñan, polo que predicir o seu comportamento require ter en conta algo máis que a súa secuencia.
É o problema que aborda ApexFold, un marco de intelixencia artificial desenvolvido por un equipo da Universidade de Pensilvania liderado polo científico galego César de la Fuente. O investigador, catedrático da institución estadounidense e director do Machine Biology Group, é o autor principal do estudo, no que tamén participaron Marcelo D. T. Torres e Hanqun Cao.
ApexFold recibe como entrada a secuencia dun péptido e información fisicoquímica sobre o medio no que se atopa para predicir como se distribúen as súas diferentes estruturas secundarias. Así, unha mesma secuencia pode producir predicións distintas cando se analiza en auga, en determinados disolventes orgánicos ou en micelas que reproducen experimentalmente algunhas características dun ambiente similar ao dunha membrana.
«A maioría dos métodos de predición estrutural toman unha secuencia e devolven un único modelo. Pero a bioloxía non funciona nun contexto único e estático. ApexFold comeza a capturar esta dimensión que faltaba ao aprender como a secuencia e o contorno determinan conxuntamente a resposta estrutural», explica de la Fuente.

Para desenvolver o sistema, o equipo reuniu o que considera o maior conxunto de datos estruturais de péptidos xerado experimentalmente ata o momento, con máis de 1.500 péptidos e máis de 5.000 observacións realizadas en diferentes condicións. As medicións obtivéronse mediante espectroscopia de dicroísmo circular e incluíron a análise dos mesmos péptidos en auga, mesturas de metanol e auga, mesturas de trifluoroetanol e auga e micelas de SDS.
Esta aproximación permitiu estudar directamente como respondían as mesmas moléculas ao cambiar o seu medio. O modelo combina representacións aprendidas por grandes modelos de proteínas con características biofísicas a nivel de residuo e unha descrición continua do medio circundante, de maneira que pode identificar tanto as tendencias estruturais dunha secuencia como a súa sensibilidade aos cambios ambientais.
A capacidade de xeneralización de ApexFold comprobouse posteriormente con dous paneis de 206 e 161 secuencias peptídicas. Nas diferentes condicións experimentais, o sistema superou os modelos de referencia que non teñen en conta o disolvente e os baseados na composición, ademais de ofrecer predicións dependentes do contorno que non poden proporcionar os modelos estruturais estáticos.
AlphaFold 3 e Boltz-2 empregáronse como referencias complementarias. Estes sistemas non están deseñados para predicir conxuntos de conformacións dependentes do ambiente, polo que os seus resultados serven para ilustrar precisamente a limitación que pretende abordar ApexFold: unha única conformación non pode representar adecuadamente un péptido cuxas proporcións estruturais cambian ao modificar as condicións.
As probas permitiron ademais cuantificar a capacidade do modelo para identificar a plasticidade estrutural dos péptidos. As correlacións entre as puntuacións de plasticidade previstas e as medidas experimentalmente foron de 0,79 no conxunto de proba interno e de 0,92 e 0,87 nos dous paneis de avaliación posteriores.
O sistema tamén pode sinalar posicións concretas das secuencias relacionadas cos cambios estruturais mediante análises computacionais de alanina e estudos de motivos. Os investigadores advirten, con todo, de que estas asociacións son correlacionais e deben considerarse hipóteses que posteriormente terán que ser comprobadas mediante experimentos específicos.
ApexFold non pretende simular o proceso de pregamento dunha molécula a resolución atómica. O modelo predí proporcións xerais das diferentes estruturas secundarias e está condicionado polas limitacións das medicións de dicroísmo circular empregadas para o seu adestramento. As mesturas de conformacións e os estados ricos en estruturas beta resultan máis difíciles de resolver, mentres que os xiros e outras estruturas irregulares quedan agrupados nunha categoría ampla de estados non estruturados.
O traballo de de la Fuente e o seu equipo apunta así cara a unha utilización da intelixencia artificial que teña en conta non só que estrutura adopta unha biomolécula, senón tamén como esa estrutura pode cambiar segundo o medio. Esta capacidade podería axudar a seleccionar os péptidos máis prometedores para sintetizar, determinar que condicións experimentar ou identificar candidatos que merezan unha caracterización estrutural máis detallada.
«O noso obxectivo a longo prazo é utilizar máquinas para comprender e, en última instancia, deseñar non só as estruturas que adoptan as biomoléculas, senón tamén como se reorganizan nos ambientes biolóxicos nos que deben funcionar», sinala de la Fuente.

