← Volver al inicio

La IA aprende del historial de las farmacéuticas a programar ensayos y supera a los agentes generalistas en la predicción del desarrollo clínico oncológico

El equipo de investigación convirtió el desarrollo de fármacos en una tarea de aprendizaje centrada en «qué ensayos deberían iniciarse en los próximos seis meses»; el modelo entrenado específicamente aventajó claramente a la IA generalista, pero predecir decisiones históricas no equivale a haber encontrado la estrategia óptima.

By SURL BioNews

Un nuevo estudio intenta responder a una de las preguntas más costosas y difíciles de estandarizar del desarrollo de fármacos: ante las señales de eficacia, el panorama competitivo y los recursos limitados, ¿qué ensayos clínicos deberían incorporarse a continuación a la cartera? Los investigadores no pidieron a una IA generalista que razonara sobre la marcha, sino que hicieron que el modelo aprendiera directamente estrategias de desarrollo a partir de las decisiones históricas y los resultados posteriores de decenas de programas de fármacos oncológicos.

William Bolton y Philip Torr dividieron cada programa farmacológico en ventanas de decisión de seis meses y pidieron al modelo que, basándose en la información pública disponible en ese momento, predijera los ensayos que el patrocinador iniciaría a continuación. El conjunto de datos abarca 45 programas de fármacos oncológicos y 881 segmentos de decisión, compilados a partir de 31.700 registros públicos, incluidos registros de ensayos, revisiones regulatorias, declaraciones corporativas, datos sobre el uso de medicamentos y datos epidemiológicos del cáncer; cada predicción también debía completar 14 campos, entre ellos indicación, fase, estrategia del ensayo, grupo comparador, región y criterio de valoración.

El modelo con mejor desempeño fue el de «clonación de comportamiento ponderada por recompensa»: no solo imita las decisiones que las farmacéuticas tomaron en el pasado, sino que también aumenta durante el entrenamiento el peso de los ensayos que posteriormente obtuvieron la aprobación de la FDA y generaron ingresos, al tiempo que reduce la influencia de los ensayos fallidos o finalizados. En el conjunto de prueba posterior a agosto de 2025, que en teoría tenía menos probabilidades de estar contaminado por datos de entrenamiento preexistentes, el modelo alcanzó una puntuación F1 de indicación del 46,2% y una F1 estricta del 14,2%; el mejor agente generalista con herramientas en cada métrica obtuvo solo el 25,0% y el 2,1%, respectivamente. La F1 estricta exige hacer coincidir simultáneamente la indicación, la fase y la estrategia del ensayo, por lo que se aproxima más a una decisión completa de desarrollo.

Este trabajo ya había sido seleccionado por separado para una presentación destacada y un póster en dos talleres de ICML 2026. La versión publicada en mayo utilizó un conjunto de datos de la misma escala; en ese momento, el modelo entrenado sin conexión obtuvo una F1 de indicación del 39,9% en la prueba con división temporal, frente al 11,2% del agente con herramientas. El preprint de agosto incorporó más métodos de entrenamiento y evaluaciones, e informó el resultado actualizado del 46,2%. El estudio también constató que, al proporcionar al modelo especializado los datos con restricción temporal recuperados por el agente con herramientas, la F1 de indicación y la F1 estricta podían aumentar aún más, hasta el 59,0% y el 18,6%, respectivamente, aunque esta prueba híbrida también se basó en una muestra muy pequeña.

Tras estas cifras sigue existiendo un límite fundamental: el modelo aprendió «qué hicieron posteriormente los patrocinadores en la historia», no que una decisión determinada fuera necesariamente mejor desde el punto de vista causal. La calidad del propio fármaco, el precio, los recursos de la empresa y la información no pública influyen en la aprobación y los ingresos; además, el conjunto de prueba más reciente utilizado por el estudio para aislar la memoria preexistente de los modelos solo contenía 24 ventanas de decisión. Aunque el 46,2% superó a los grupos de comparación, también significa que más de la mitad de las asignaciones de indicaciones no coincidieron con las respuestas históricas, y el valor absoluto de la F1 estricta fue aún menor.

Además, los registros públicos de desarrollo están sesgados hacia las grandes farmacéuticas, los tipos de cáncer frecuentes y los activos comercializados con éxito, lo que puede hacer que el modelo reproduzca las orientaciones existentes de la industria e ignore áreas de investigación como los cánceres raros, la pediatría o aquellas con menor atractivo comercial. Por ello, este preprint resulta más apropiado como prueba de concepto para el análisis de escenarios asistido por IA que como herramienta para formular automáticamente estrategias de ensayos, inversión o regulación; antes de incorporarlo realmente a los procesos de decisión de las farmacéuticas, todavía serán necesarias la validación prospectiva, la auditoría de sesgos y la supervisión conjunta de equipos clínicos, estadísticos y regulatorios.

References

  1. arXiv
  2. OpenReview — ICML 2026 GenBio Workshop