← 返回首頁

不只給答案,還攤開判斷依據:CLEAR讓胸部X光AI接受概念稽核

以逾87萬組影像與報告訓練的新模型,把預測拆解為臨床可辨識的放射學概念;跨美國、西班牙與越南資料的測試顯示,透明度也能成為找出偏誤、修正模型的工具。

By SURL BioNews

胸部X光人工智慧即使答對,醫師仍可能不知道它究竟看見了病灶,還是抓住資料中碰巧共存的線索。賓夕法尼亞大學醫學院等機構的研究團隊提出CLEAR模型,試圖把這道黑箱拆開:除了輸出疾病機率,也呈現哪些放射學觀察推動了判斷,讓錯誤有機會被追查,而非只能接受或否決一個分數。

研究團隊以MIMIC-CXR、CheXpert-Plus與ReXGradient資料訓練CLEAR,共納入873,342組胸部X光與報告,涵蓋239,391名病人。系統從報告整理出368,294項觀察,包括心臟擴大、主動脈鈣化或特定部位陰影等描述,再讓影像與文字編碼器把X光所呈現的特徵對應到這個概念空間。

這種設計使CLEAR能在未針對個別疾病重新訓練的「零樣本」情境下,判斷肺炎、肺結節、胸腔積液及骨骼或血管異常,同時列出各概念對結果的貢獻。研究在美國、西班牙與越南的外部醫師標註資料上測試;在VinDr-CXR中,CLEAR跨多項發現的平均AUROC為0.782,高於次佳比較模型的0.750;在PadChest則為0.700,高於比較模型的0.668。不同資料集與病灶的表現仍有落差,不能把平均值視為所有臨床情境下的準確率。

可稽核性最具體的價值,出現在模型犯錯之時。團隊發現,用監督式分類器辨識「心縱膈擴大」時,模型竟高度依賴肺不張相關概念,反映訓練資料中兩種標籤經常同時出現。研究人員只保留與縱膈真正相關的概念並重新配適輕量分類器,不必重訓影像編碼器,便把AUROC由0.727提高至0.784。這項實驗顯示,概念解釋不只是事後展示,也可能用於定位混雜因子並介入修正。

不過,「說得出理由」並不等於已具備臨床安全性。概念庫來自既有報告,仍可能承接報告習慣、標註偏差與族群差異;研究也未窮盡所有攝影協定、病人族群及實際工作流程。論文中的統計比較部分未校正多重比較,而外部基準測試也不能取代前瞻性臨床試驗,尤其無法單獨證明模型能改善病人結果。

團隊已公開模型權重、程式與概念詞彙,讓其他研究者重現概念評分及稽核流程;但公開說明明確指出,CLEAR目前僅供研究,並非醫療器材,也未經驗證可用於診斷、治療或分流。若要走進醫院,監管與採購者除了檢查整體準確度,還必須確認概念歸因是否穩定、能否跨院所重現,以及人類該如何處理模型提出的理由與臨床判斷相衝突的情況。

References

  1. Perelman School of Medicine at the University of Pennsylvania
  2. Nature Biomedical Engineering
  3. GitHub
  4. Hugging Face