生醫AI · global
一個模型讀懂整張病理切片:PRISM2癌症偵測追上臨床專用系統
PRISM2以230萬張全切片影像與病理報告學習診斷語言,無須針對個別偵測任務再訓練,便在前列腺癌、乳癌及乳房淋巴結轉移測試中匹敵專用產品;但回溯性資料、單一掃描來源與報告生成錯誤,仍限制它直接走進診間。
數位病理的難題,從來不只是讓電腦辨認幾個細胞,而是如何像病理醫師一樣,把一張包含數十億像素的全切片影像讀成完整病例。刊登於《Nature Medicine》的研究顯示,多模態基礎模型PRISM2已能直接回答癌症相關問題,並在數項測試中追上為特定癌別打造的臨床級系統,為「一個模型支援多種病理工作」提供了較具體的證據。
PRISM2由Paige與Microsoft Research合作開發,以超過230萬張蘇木精—伊紅染色全切片影像訓練,涵蓋約68.5萬份檢體報告。研究團隊將報告轉換為約1,400萬組臨床問答,先讓Virchow2產生的影像表徵與診斷文字對齊,再以Phi-3 Mini語言模型進行臨床對話訓練。模型因而不只輸出影像特徵,也能回答是非題、多選題、開放式問題及生成報告。
在未針對個別癌症偵測任務額外訓練的情況下,PRISM2透過是非問答,在前列腺癌與乳癌測試中達到Paige專用臨床產品的平衡準確率,並在乳房淋巴結癌症偵測上超越比較系統。這些測試使用模型訓練時未見的評估資料。不過,研究者特別避免把這稱為嚴格的「零樣本」能力,因為相關疾病概念已在訓練報告中出現;較準確的說法,是模型不必為每項任務另建專用分類器即可進行提示式推論。
PRISM2的用途也不止於篩出癌症。其切片表徵被用於癌症分型、分級、淋巴結分期、部分生物標記與存活預測;在多項線性探測評估中,表現未顯著落後於既有病理基礎模型。針對存活預測再微調後,它也勝過從頭訓練的專用模型。這種架構未來可能協助病例分流、預先填寫結構化報告,或為需要進一步免疫組織化學與定序的個案提供提示。
然而,基準測試達到臨床級產品水準,不等於模型本身已取得相同的臨床資格。研究採用去識別化資料進行回溯分析,而且PRISM2與底層影像模型所見切片都由同一癌症中心掃描;不同醫院的染色、掃描器、病例組成與工作流程,仍可能造成效能偏移。它缺乏完整的全域空間推理,也只使用單一解析度,對病灶計數、尺寸測量及部分分期工作可能形成限制。
語言輸出更需要審慎看待。研究抽查顯示,由報告衍生的訓練問答本身含有雜訊;模型生成診斷摘要時,仍會出現虛構發現、遺漏與分級錯誤,某些報告欄位也必須先校準才能改善判讀。Paige已提供PRISM2授權與企業整合,並將其納入仍處測試階段的Alba臨床助理,但公司也明示其生成內容不能取代醫療診斷或治療。
真正的下一道門檻,是在多中心、前瞻性臨床流程中證明模型能維持安全、穩定且可追溯的表現,並釐清人類覆核、錯誤責任與監管定位。PRISM2的重要性不在於宣告通用病理AI已經成熟,而是顯示大規模影像與診斷語言的結合,確實可能縮短通用基礎模型與專科臨床工具之間的距離。