← Volver al inicio

La IA médica llega a las consultas multidisciplinarias: un estudio de cien casos muestra su utilidad, aunque la concordancia de sus recomendaciones sigue siendo limitada

Ante enfermedades inflamatorias complejas, OpenEvidence puede aportar información que los médicos consideran útil; sin embargo, la proporción de respuestas que coincide plenamente con las conclusiones de la consulta ronda el 40–50 %, y las respuestas a una misma pregunta también cambian con el tiempo.

By SURL BioNews

Cuando las enfermedades inflamatorias afectan a distintos órganos, la elección del tratamiento suele requerir una valoración conjunta de médicos de varias especialidades. ¿Puede la inteligencia artificial, capaz de sintetizar la literatura médica en tiempo real, ayudar a aclarar estas cuestiones difíciles? Un estudio publicado el 2 de octubre en *Scientific Reports* incorporó el modelo de lenguaje de gran tamaño para uso médico OpenEvidence a un proceso real de consulta multidisciplinaria y obtuvo una respuesta prudente: la información es útil, pero la concordancia de las recomendaciones sigue siendo limitada.

Este estudio observacional prospectivo, realizado en un solo centro, incluyó 100 casos consecutivos de enfermedades inflamatorias complejas. Los médicos primero debatieron por su cuenta y registraron sus recomendaciones preliminares; después revisaron las respuestas de la IA y, tras un debate adicional, confirmaron las recomendaciones finales. Un total de 21 médicos de siete especialidades completaron 759 evaluaciones de casos; estas evaluaciones reflejan la experiencia de uso de los expertos, y no los resultados del tratamiento de 759 pacientes.

En general, los médicos valoraron positivamente la utilidad de la IA. En una escala de cinco puntos, el criterio «proporcionar información clínica pertinente para el caso» obtuvo una puntuación media de 4,06, mientras que la recomendación de seguir utilizándola en el futuro alcanzó 3,95. Esto indica que puede integrarse en el debate, pero considerar útil la información y aceptar sus recomendaciones diagnósticas y terapéuticas siguen siendo dos juicios distintos.

Dos médicos evaluaron por separado 97 casos interpretables y determinaron que las respuestas de la IA coincidían plenamente con las recomendaciones finales de la consulta en el 40,2 % y el 50,5 % de los casos, respectivamente. También hubo discrepancias entre sus evaluaciones. Por tanto, estas cifras deben entenderse como el grado de concordancia con las conclusiones de los expertos y no pueden considerarse directamente una tasa de acierto diagnóstico y terapéutico de la IA; en particular, las recomendaciones finales se confirmaron después de que los médicos hubieran visto las respuestas de la IA, por lo que tampoco constituyen una referencia de comparación completamente independiente.

A continuación, el equipo de investigación modificó la forma de plantear las preguntas para que el modelo comprobara primero si la información era suficiente y después formulara recomendaciones. La concordancia de las respuestas mostró una tendencia a mejorar, pero no alcanzó significación estadística. Dado que las dos rondas de pruebas estuvieron separadas por varios meses y la plataforma se actualizó continuamente durante ese período, el estudio tampoco pudo distinguir claramente el efecto de la mejora en las preguntas del de los cambios en el sistema.

Las diferencias debidas al paso del tiempo también merecen atención: al introducir de nuevo las mismas preguntas, el estudio observó cambios tanto en el contenido de las respuestas como en la bibliografía citada. Para el uso clínico, una respuesta que funciona bien una vez no garantiza que pueda reproducirse en el futuro; además, cuánto conoce el modelo sobre el estado del paciente depende de la información que el médico haya proporcionado previamente.

Este estudio respalda la viabilidad de la IA como herramienta de apoyo a la consulta multidisciplinaria, pero todavía no demuestra que pueda mejorar el pronóstico de los pacientes. El estudio no evaluó los daños clínicos ni examinó de forma sistemática las «alucinaciones»: contenido generado que parece razonable, pero que en realidad es incorrecto. Además, al proceder los casos de un único centro, la posibilidad de generalizar los resultados sigue teniendo límites. Cómo validar de manera continua el sistema después de sus actualizaciones y cómo lograr que los expertos identifiquen las omisiones en las respuestas son cuestiones que aún deben resolverse para avanzar hacia su uso en la práctica médica cotidiana.

References

  1. Scientific Reports