← 返回首頁

病理AI不是愈大愈準:32款基礎模型大考揭開泛化落差

橫跨41項癌症病理任務的比較顯示,專為病理影像訓練的模型整體表現強勁,但沒有單一贏家;離開熟悉資料後,排名會變,模型規模也不是可靠的選擇指南。

By SURL BioNews

數位病理的真正難題,不只是讓AI在一批切片上取得高分,而是換一家醫院、另一種組織或不同臨床問題後,還能不能看得準。一項刊於《Nature Communications》的大型基準研究比較32款基礎模型,結果顯示:病理專用模型雖然普遍強勢,表現卻會隨資料與任務改變,並不存在放諸四海皆準的冠軍。

研究涵蓋41項全切片與局部影像任務,資料來自癌症基因體圖譜TCGA、臨床蛋白質體腫瘤分析聯盟CPTAC,以及外部和跨領域資料集。任務包括腫瘤分類、分子亞型、腫瘤分期與生物路徑預測;換言之,AI不只要辨認組織長相,也被要求從染色切片推測與診斷、預後或精準治療相關的資訊。

團隊把模型分成通用視覺、通用視覺語言、病理專用視覺,以及病理專用視覺語言四類。在TCGA任務中,Virchow2、Prov-GigaPath、H-optimus-0與UNI等病理專用視覺模型經常名列前茅。整體而言,這類模型優於病理視覺語言模型,並可與通用視覺模型競爭;但頂尖模型之間的差異往往很小,而且取決於具體任務。

一旦評估轉向CPTAC及分布不同的外部資料,模型排序便出現幅度不大、但持續可見的移動。這反映病理AI常見的「域偏移」問題:染色流程、掃描設備、病人組成與組織來源稍有變化,都可能改變影像特徵,讓原本領先的模型失去優勢。因此,只在單一常用資料庫獲得高分,不能直接等同於跨醫院的臨床可靠性。

研究也削弱了「模型愈大、看過的資料愈多,就一定愈好」的直覺。模型參數規模與預訓練資料量,均無法穩定預測下游任務表現,尤其在TCGA以外更是如此。訓練資料涵蓋哪些組織、病例是否多樣、模型架構如何處理病理影像,可能比單純堆高規模更重要;不過,這項比較尚不能拆解各因素的因果影響。

較務實的線索來自模型組合。研究以晚期融合方式整合多個優秀模型的預測,在外部資料集與不同組織類型上提高整體表現,顯示各模型學到的視覺訊息具有互補性。代價則是部署更複雜、運算需求增加,醫療機構還得釐清模型意見衝突時如何追溯與解釋結果。

這項研究從2025年的31模型預印本擴充為最終論文的32模型比較,配套程式碼、模型資料與評估環境亦已公開並版本化保存,增加重現與後續檢驗的可能。然而,回溯性公開資料上的基準成績不是前瞻性臨床驗證。若要進入診療流程,模型仍須在目標醫院與病人族群接受獨立測試,持續監測資料漂移,並建立品質控制、責任歸屬與監管所需的證據。

References

  1. Nature Communications
  2. PubMed
  3. Gevaert Lab GitHub
  4. Zenodo