← Volver al inicio

La IA generativa aún muestra una brecha en el diagnóstico radiológico: un metaanálisis de 48 estudios sitúa la precisión de los expertos 13 puntos porcentuales por encima

¿Cuánto le falta a la IA generativa para ser un asistente clínico fiable al formular diagnósticos a partir de imágenes e historias clínicas? Un nuevo estudio señala que el formato de respuesta y la información de entrada influyen en su desempeño, mientras que los resultados medios entre estudios aún no bastan para determinar si puede utilizarse de forma segura en la consulta.

By SURL BioNews

Una anomalía en una imagen suele necesitar la historia clínica y otras pistas para traducirse en un diagnóstico. La inteligencia artificial generativa ya se ha puesto a prueba en esta tarea, pero redactar respuestas fluidas no implica que sus juicios sean fiables. Una revisión sistemática y un metaanálisis publicados el 3 de octubre en *Japanese Journal of Radiology* muestran que, en los estudios de diagnóstico radiológico incluidos, la precisión de la IA generativa sigue siendo inferior a la de los médicos expertos.

El análisis reunió 48 estudios identificados mediante búsquedas realizadas hasta marzo de 2025 y se registró previamente en PROSPERO; el resumen del mismo artículo recogido en PubMed también confirma el alcance del estudio y sus principales resultados. La evaluación abarcó entradas de texto, imágenes y combinaciones de ambos formatos para comprobar si los modelos podían formular el diagnóstico correcto. Por tanto, el estudio no midió únicamente la capacidad de interpretar imágenes directamente, sino también la de inferir enfermedades a partir de descripciones textuales.

El formato de respuesta influye en los resultados: cuando se pidió a los modelos que redactaran el diagnóstico por sí mismos, la precisión combinada fue del 42.9%; cuando se les ofrecieron opciones, fue del 58.1%. La comparación mediante un modelo estadístico entre estudios estimó que la precisión de los médicos expertos superaba a la de la IA en aproximadamente 13.0 puntos porcentuales, con un intervalo de confianza del 95% de 0.9 a 25.2 puntos porcentuales y un valor de P de 0.038. Se trata de una diferencia absoluta de precisión y no puede interpretarse como si la IA quedara siempre por detrás en esa misma magnitud en cada tipo de examen o enfermedad.

La base de la comparación también tiene límites. De los 48 estudios, solo 12 incluyeron un grupo de comparación de médicos; la diferencia mencionada procede de una estimación mediante un modelo entre estudios, y no de una comparación en la que todas las IA y todos los médicos se enfrentaran a los mismos casos en las mismas condiciones. Las diferencias en la composición y la dificultad de los casos pueden influir en los resultados, y estas puntuaciones tampoco pueden convertirse directamente en tasas de error del diagnóstico cotidiano en los hospitales.

Otro resultado que puede malinterpretarse es que las entradas de solo texto obtuvieron mejores resultados que las de solo imágenes o las que combinaban imágenes y texto. Los autores advierten que el texto a veces ya contiene hallazgos de imagen redactados y organizados por personas, lo que equivale a proporcionar de antemano pistas importantes; además, la dificultad de las tareas puede variar entre los grupos. Esta asociación respalda la investigación adicional de usos de apoyo mediante texto, pero no demuestra que eliminar las imágenes permita obtener diagnósticos más precisos.

La calidad de la evidencia también limita el alcance de las conclusiones: solo 1 estudio se consideró de bajo riesgo de sesgo, mientras que la mayoría de los demás presentaba un riesgo incierto o elevado. Los materiales de las pruebas también estaban casi íntegramente en inglés, y todavía no existe una base suficiente para establecer su aplicabilidad en entornos médicos en chino. Además, dado que la búsqueda bibliográfica terminó en marzo de 2025, este análisis refleja la evidencia sobre los modelos y los métodos de evaluación de aquel momento y no puede representar las capacidades de todas las versiones nuevas posteriores.

En el ámbito clínico, el siguiente paso es aclarar en qué etapas del trabajo la IA puede prestar una ayuda fiable. Los autores plantean que pueden seguir evaluándose usos como las sugerencias de diagnóstico diferencial para que los médicos las revisen, pero que antes de su implementación deben realizarse pruebas estandarizadas, contar con muestras suficientes y presentar informes metodológicos transparentes. Para determinar si estas herramientas pueden mejorar la atención, aún es necesario evaluar el desempeño y la seguridad de los médicos al utilizar IA en condiciones cercanas a la práctica real.

References

  1. Japanese Journal of Radiology
  2. PubMed