IA biomédica · global
Un modelo para interpretar una lámina histopatológica completa: PRISM2 alcanza a los sistemas especializados de detección del cáncer
PRISM2 aprendió el lenguaje diagnóstico a partir de 2,3 millones de imágenes de láminas completas e informes anatomopatológicos y, sin volver a entrenarse para cada tarea de detección, igualó a productos especializados en pruebas de cáncer de próstata, cáncer de mama y metástasis en ganglios linfáticos mamarios; sin embargo, los datos retrospectivos, el uso de una única fuente de escaneo y los errores en la generación de informes todavía limitan su incorporación directa a la práctica clínica.
El reto de la patología digital nunca ha consistido únicamente en lograr que una computadora reconozca unas cuantas células, sino en conseguir que, como un patólogo, interprete una imagen de lámina completa con miles de millones de píxeles como un caso clínico integral. Un estudio publicado en *Nature Medicine* muestra que el modelo fundacional multimodal PRISM2 ya puede responder directamente preguntas relacionadas con el cáncer y que, en varias pruebas, ha alcanzado a sistemas de calidad clínica diseñados para tipos específicos de cáncer, aportando evidencia más concreta de que «un solo modelo puede respaldar múltiples tareas de patología».
PRISM2 fue desarrollado conjuntamente por Paige y Microsoft Research y se entrenó con más de 2,3 millones de imágenes de láminas completas teñidas con hematoxilina y eosina, correspondientes a aproximadamente 685.000 informes de muestras. El equipo de investigación convirtió los informes en unos 14 millones de pares de preguntas y respuestas clínicas; primero alineó las representaciones visuales generadas por Virchow2 con los textos diagnósticos y después realizó un entrenamiento para conversaciones clínicas con el modelo lingüístico Phi-3 Mini. De este modo, el modelo no solo produce características de imagen, sino que también puede responder preguntas de sí o no, preguntas de opción múltiple y preguntas abiertas, además de generar informes.
Sin entrenamiento adicional para tareas de detección de cáncer concretas, PRISM2 alcanzó mediante preguntas de sí o no la exactitud equilibrada de los productos clínicos especializados de Paige en las pruebas de cáncer de próstata y cáncer de mama, y superó al sistema de comparación en la detección de cáncer en ganglios linfáticos mamarios. Estas pruebas utilizaron datos de evaluación que el modelo no había visto durante el entrenamiento. No obstante, los investigadores evitaron expresamente describir esto como una capacidad estricta de «cero ejemplos», porque los conceptos de las enfermedades correspondientes ya aparecían en los informes de entrenamiento; una formulación más precisa es que el modelo puede realizar inferencias mediante instrucciones sin necesidad de crear un clasificador especializado para cada tarea.
Las aplicaciones de PRISM2 tampoco se limitan a detectar el cáncer. Sus representaciones de láminas se utilizaron para determinar el subtipo y el grado del cáncer, establecer el estadio ganglionar y predecir determinados biomarcadores y la supervivencia; en varias evaluaciones mediante sondeos lineales, su rendimiento no fue significativamente inferior al de los modelos fundacionales de patología existentes. Tras un ajuste fino adicional para la predicción de supervivencia, también superó a un modelo especializado entrenado desde cero. En el futuro, esta arquitectura podría ayudar a clasificar casos, completar previamente informes estructurados o señalar los casos que requieren más pruebas de inmunohistoquímica y secuenciación.
Sin embargo, alcanzar el nivel de productos de calidad clínica en pruebas de referencia no significa que el propio modelo haya obtenido la misma habilitación clínica. El estudio realizó un análisis retrospectivo con datos desidentificados, y tanto las láminas vistas por PRISM2 como las utilizadas por el modelo visual subyacente fueron escaneadas por el mismo centro oncológico; las diferencias entre hospitales en tinción, escáneres, composición de los casos y flujos de trabajo todavía podrían provocar variaciones de rendimiento. El modelo carece de razonamiento espacial global completo y utiliza una sola resolución, lo que podría limitar el recuento de lesiones, la medición de su tamaño y determinadas tareas de estadificación.
Los resultados lingüísticos requieren aún más cautela. La revisión por muestreo del estudio mostró que las preguntas y respuestas de entrenamiento derivadas de los informes contenían ruido; cuando el modelo genera resúmenes diagnósticos, todavía produce hallazgos inventados, omisiones y errores de gradación, y algunos campos de los informes deben calibrarse previamente para mejorar la interpretación. Paige ya ofrece PRISM2 para licencias e integración empresarial y lo ha incorporado a Alba, su asistente clínico aún en fase de pruebas, pero la empresa también indica expresamente que el contenido generado no puede sustituir el diagnóstico ni el tratamiento médicos.
El verdadero próximo umbral consiste en demostrar, dentro de flujos clínicos prospectivos y multicéntricos, que el modelo puede mantener un rendimiento seguro, estable y trazable, así como aclarar la revisión humana, la responsabilidad por los errores y su encaje regulatorio. La importancia de PRISM2 no radica en proclamar que la IA patológica de uso general ya está madura, sino en mostrar que la combinación a gran escala de imágenes y lenguaje diagnóstico sí podría reducir la distancia entre los modelos fundacionales generales y las herramientas clínicas especializadas.