Inteligencia artificial biomédica · us
Hacer que las historias clínicas electrónicas «ejecuten» primero el ensayo clínico: cinco agentes de IA colaboran para diseñar y reproducir efectos terapéuticos
EmulatRx distribuye la planificación del ensayo, la selección de pacientes, la revisión clínica y el análisis causal entre cinco agentes de IA, y simuló 20 estudios en dos conjuntos de datos del mundo real; los resultados indican que podría acelerar la toma de decisiones preliminares, pero todavía no puede sustituir a los ensayos aleatorizados ni a la supervisión profesional.
Antes de que un ensayo clínico comience realmente a reclutar pacientes, el equipo de investigación debe revisar reiteradamente los criterios de inclusión, los indicadores de eficacia y los métodos estadísticos. EmulatRx, desarrollado por un equipo de Weill Cornell Medicine, busca que la inteligencia artificial «ensaye» primero este proceso utilizando historias clínicas electrónicas desidentificadas, para ayudar a los investigadores a estimar qué diseños son viables y si los datos médicos existentes pueden reproducir efectos terapéuticos conocidos.
Este sistema no depende de un único chatbot, sino de la colaboración de cinco agentes especializados basados en modelos de lenguaje de gran tamaño: uno genera el protocolo del ensayo, otro crea la cohorte de estudio a partir de historias clínicas electrónicas, otro realiza una revisión de la plausibilidad clínica, otro ejecuta el análisis causal y el último supervisa el flujo de trabajo completo. El objetivo de esta división de tareas es conservar un registro de los datos de entrada, los juicios y las correcciones de cada etapa, de modo que los investigadores puedan rastrear cómo se obtuvieron los resultados, en lugar de limitarse a recibir una respuesta difícil de verificar.
Los investigadores evaluaron en total 20 «emulaciones de ensayos objetivo». Diez estudios sobre enfermedades agudas utilizaron MIMIC-IV, una base de datos de cuidados intensivos, mientras que los otros 10, sobre enfermedades crónicas, emplearon datos de la red de investigación clínica INSIGHT, que abarca cinco sistemas de salud de la ciudad de Nueva York. Según el artículo, EmulatRx reprodujo en varios análisis los efectos terapéuticos comunicados en estudios anteriores, lo que indica que podría utilizarse para evaluar la viabilidad antes de un ensayo y comparar protocolos; sin embargo, esta concordancia no significa que el sistema haya demostrado la eficacia del tratamiento.
En la etapa de interpretación del protocolo del ensayo, el agente «Trialist», basado en GPT-4o, obtuvo una puntuación F1 del 95,4 %. La comparación de modelos incluida en el estudio también mostró que GPT-4o superó a los modelos locales evaluados en relevancia clínica, razonamiento y generación de consultas SQL. No obstante, este resultado mide el desempeño en tareas específicas y no puede interpretarse directamente como una exactitud clínica del 95,4 % para todo el proceso; tampoco demuestra que la misma ventaja se extienda a otros hospitales, formatos de historias clínicas o ámbitos de enfermedad.
El uso más realista de este tipo de herramienta podría consistir en detectar con antelación problemas como criterios de reclutamiento demasiado restrictivos, tamaños de muestra insuficientes, datos faltantes o desequilibrios entre covariables, y en generar a partir de registros existentes análisis preliminares que los expertos puedan revisar. El equipo ha archivado el código de EmulatRx versión 1.0.0 en Zenodo y lo ha vinculado a un repositorio público de código, ofreciendo así a investigadores externos una vía para examinar y reproducir la implementación; los datos de transferencia tecnológica de Cornell University indican, además, que se ha presentado una solicitud de patente provisional para la tecnología relacionada.
Sin embargo, los datos del mundo real contienen sesgos derivados de las decisiones clínicas, la calidad de los registros y las diferencias entre pacientes. Aunque los métodos de inferencia causal pueden ajustar los factores medidos, no pueden garantizar que se eliminen las variables de confusión no registradas; además, la generación por parte del modelo de lenguaje de criterios o código de consulta erróneos también podría modificar silenciosamente la cohorte del estudio. El equipo de investigación reconoce asimismo que actualmente faltan parámetros de evaluación estandarizados de extremo a extremo y que todavía es necesario validar el sistema en más bases de datos médicas.
Por tanto, EmulatRx resulta más adecuado como herramienta auxiliar de diseño y auditoría para los equipos de investigación clínica que como árbitro que determina automáticamente la eficacia. Para incorporarlo a la planificación habitual de ensayos, además de mantener la supervisión humana, será necesario establecer validación entre instituciones, gestión de versiones y auditorías, gobernanza de la privacidad de las historias clínicas y estándares de evidencia aceptables para los organismos reguladores; los verdaderos ensayos prospectivos aleatorizados siguen siendo un componente fundamental para responder preguntas sobre la eficacia y la seguridad de los tratamientos.