Inteligencia artificial médica · global
Cuando la IA médica sabe ceder el relevo: la brecha clínica detrás del 98.9% de precisión diagnóstica
Permitir que la IA solo atienda los casos en los que tiene mayor confianza podría ser una vía hacia el diagnóstico autónomo. Pero cuando más de la mitad de los casos se devuelve a los médicos, la pregunta aún sin respuesta es si el proceso completo puede mejorar la atención.
Que la IA médica se detenga y pida a un médico que tome el relevo ante un caso incierto parece una medida de seguridad razonable. Sin embargo, una cifra de precisión impresionante no responde por sí sola si esa transferencia realmente reduce los errores diagnósticos ni si los pacientes reciben atención a tiempo. Un comentario publicado en *Nature Medicine* el 2 de octubre centra la atención en esta parte del proceso clínico que aún no se ha validado: la IA puede seleccionar diagnósticos más fiables, pero siguen faltando pruebas empíricas sobre los resultados tras remitir los casos a revisión humana.
El comentario aborda un estudio publicado el 15 de septiembre en la misma revista. Un equipo de investigación de Dresde hizo interactuar a dos agentes de IA, que asumían los papeles de médico y paciente, en un entorno de simulación ejecutado localmente; el «médico» podía formular preguntas adicionales sobre los síntomas, solicitar información de pruebas y después proponer un diagnóstico y su justificación. Los casos procedían de historias clínicas electrónicas existentes e incluían enfermedades como neumonía, infección urinaria y apendicitis. El sistema y el procesamiento de los datos permanecían en los equipos de la propia institución, lo que facilita el control del flujo de datos, las versiones del modelo y los permisos de acceso, pero estas ventajas de gestión no garantizan por sí mismas la seguridad diagnóstica.
En dos conjuntos de pruebas derivados de los datos clínicos de MIMIC-IV, el sistema alcanzó una precisión diagnóstica del 90.04% en 551 casos de siete enfermedades; en otro conjunto, con 2,400 casos de cuatro enfermedades abdominales, la precisión fue del 83.8%. El estudio también evaluó su rendimiento en un ámbito más amplio con 990 casos de VivaBench que abarcaban diez especialidades. Todas estas pruebas fueron simulaciones retrospectivas que permiten medir la capacidad con datos y tareas específicos, pero aún no pueden representar la efectividad en la atención hospitalaria cotidiana.
El elemento más decisivo del diseño del estudio fue hacer que el sistema procesara repetidamente el mismo caso para comprobar si el diagnóstico se mantenía estable. Al fijar el umbral de consistencia diagnóstica en 0.90, se retuvo el 49.4% de los casos de la prueba principal, y la precisión de este subconjunto aumentó al 98.9%; los demás se derivaron al grupo pendiente de revisión. En otras palabras, la elevada precisión vino acompañada de una reducción del alcance de los casos atendidos, y no todos los casos alcanzaron el mismo rendimiento; ofrecer repetidamente respuestas similares también puede dejar errores persistentes.
La comprobación humana aportó otra capa de evaluación. Según la explicación del Centro de Salud Digital de Dresde, después de que los médicos revisaran 181 casos seleccionados al azar, la concordancia entre la evaluación automática y el consenso médico superó el 90%. Este resultado respalda que el método de evaluación tiene cierto grado de fiabilidad, pero no puso a prueba si los médicos podían corregir los errores al hacerse cargo de los casos en la práctica. Ahí reside la brecha señalada por el nuevo comentario: remitir los casos difíciles solo completa la derivación, sin demostrar todavía que todo el proceso asistencial sea más seguro.
Las condiciones de implementación también pueden modificar el rendimiento de este método. El estudio encontró que el umbral de consistencia debe recalibrarse según el modelo y la configuración técnica, y que no puede trasladarse directamente a otro entorno de despliegue. El equipo de Dresde también señaló que el rendimiento era peor en los casos simulados de pacientes de mayor edad, por razones que aún deben esclarecerse; el coste de los cálculos repetidos también llevó al equipo a buscar formas más eficientes de comprobar la fiabilidad. Estas cuestiones afectan a qué pacientes tienen más probabilidades de ser derivados y a si las instituciones sanitarias tienen capacidad para realizar estas comprobaciones de forma sostenida.
Por ello, el siguiente paso debe incorporar a los médicos y los flujos de trabajo reales en estudios prospectivos. Tanto los autores del estudio como la cobertura de ICT&health sobre el mismo asunto subrayan la necesidad de evaluar la dependencia de los médicos respecto de la IA, la carga de revisión, la seguridad de los pacientes y los resultados clínicos. Desde la perspectiva asistencial, lo que realmente debe medirse son los resultados conjuntos de los casos retenidos y los casos transferidos: si el tiempo que ahorra la IA permite a los médicos atender mejor los casos difíciles y si, con ello, mejora la calidad global del diagnóstico y el tratamiento.