Inteligencia artificial médica · global
De las imágenes torácicas a las preguntas sobre historias clínicas: un estudio de MedGemma muestra avances en los modelos especializados en medicina
Nature Medicine publica una evaluación de MedGemma en múltiples tareas que muestra que el entrenamiento con datos médicos puede mejorar la interpretación de imágenes y el razonamiento. Los resultados principales ya se habían divulgado el año pasado y ahora se publican tras la revisión por pares; su aplicación en la atención real aún requiere una validación específica para cada uso.
Una radiografía de tórax, un pequeño fragmento de una muestra histopatológica y años de historia clínica contienen pistas médicas en distintos formatos. Si un mismo sistema de IA pudiera procesar estos datos, los investigadores podrían reducir la carga de desarrollar herramientas nuevas para cada tarea. El estudio de MedGemma publicado el 6 de octubre en Nature Medicine aporta evidencia de evaluación sobre esta vía de desarrollo, pero aún quedan aspectos por resolver entre los resultados de las pruebas y un desempeño fiable en la consulta.
MedGemma se basa en Gemma 3 y utiliza entrenamiento con datos médicos para que el modelo procese imágenes y texto. Esta publicación en la revista no es la primera presentación del modelo: el equipo de investigación ya había divulgado un informe técnico en julio de 2025, cuya revisión más reciente es de abril de 2026. Los avances principales, como la clasificación de radiografías de tórax, ya figuraban en el informe inicial; la novedad ahora es la publicación formal de la investigación tras la revisión por pares.
El informe del estudio señala que, en tareas «fuera de distribución», en las que el conjunto de datos de prueba no se utilizó para entrenar ni ajustar el modelo, el desempeño de MedGemma en la clasificación de hallazgos en radiografías de tórax mejoró entre un 15.5 y un 18.1% respecto al modelo base, y entre un 2.6 y un 10% en preguntas y respuestas sobre imágenes médicas. Estas pruebas permiten explorar la capacidad del modelo ante datos diferentes, pero no permiten inferir directamente que mantendrá el mismo desempeño al pasar a otro hospital o a otro grupo de pacientes.
Cómo interpreta el modelo las imágenes es otro aspecto central de este trabajo. Google Research explica que su codificador de imágenes, MedSigLIP, tiene 400 millones de parámetros y fue ajustado con radiografías de tórax, muestras histopatológicas e imágenes de la piel y del fondo de ojo para convertir las imágenes en información que el modelo pueda procesar. El informe técnico inicial también señala que, tras un ajuste fino adicional, el modelo puede alcanzar un desempeño cercano al de métodos especializados en la clasificación de neumotórax y de muestras histopatológicas, mientras que los errores en la recuperación de información de las historias clínicas se redujeron un 50%; estos resultados corresponden a tareas específicas y no pueden considerarse una tasa de exactitud común a todos los usos médicos.
La evaluación de la generación de informes de radiografías de tórax se aproxima más a un posible flujo de trabajo. El estudio utilizó el conjunto de datos MIMIC-CXR; Google había explicado anteriormente que, en una evaluación sin enmascaramiento, un radiólogo con certificación de especialidad en Estados Unidos consideró que el 81% de los informes generados por MedGemma 4B tenían una exactitud suficiente para orientar un manejo del paciente similar al derivado de los informes originales. Se trata del juicio de un experto sobre las consecuencias de los informes, no de una demostración, mediante el seguimiento real de pacientes, de que los resultados de la atención fueran iguales; el evaluador conocía el origen de los informes, lo que también limita la interpretación de la evidencia.
La capacidad de razonamiento también debe entenderse dentro del contexto de las pruebas. La mejora del 10.8% en tareas de agente que recoge el informe técnico procede de interacciones clínicas simuladas, no de un ensayo en consultas reales. Aunque el modelo haya mejorado en preguntas y respuestas y en clasificación, eso no significa que ya pueda asumir de forma segura la entrevista clínica, el diagnóstico o las decisiones terapéuticas.
El uso que estos resultados respaldan de forma más directa es como punto de partida para la investigación en IA médica y el desarrollo de aplicaciones. Google señala expresamente que el modelo necesita ajustes y validación para usos concretos, y que sus respuestas no deben utilizarse directamente para el diagnóstico clínico ni para las decisiones terapéuticas. Para las instituciones que se preparan para incorporarlo, el siguiente paso debe ser determinar cómo puede equivocarse el modelo con sus propios datos, poblaciones de pacientes y flujos de trabajo, y si esos errores afectan a la atención; la publicación en una revista facilita el examen de sus capacidades, mientras que la fiabilidad clínica debe establecerse mediante validaciones posteriores.