醫療人工智慧 · global
生成式AI判讀放射診斷仍有差距:48項研究統合分析,專家準確率高出13個百分點
從影像與病史提出診斷,生成式AI距離可靠的臨床助手還有多遠?新研究指出,答題形式與輸入資訊會牽動表現,而跨研究的平均成績,還不足以回答它在診間是否安全可用。
一張影像上的異常,往往要連同病史與其他線索,才能轉化為診斷。生成式人工智慧已被用來測試這項能力,但能寫出流暢答案,並不代表判斷可靠。10月3日刊於《Japanese Journal of Radiology》的系統性回顧與統合分析顯示,在納入的放射診斷研究中,生成式AI的準確率仍落後專家醫師。
這項分析彙整截至2025年3月搜尋取得的48項研究,並事先登錄於PROSPERO;PubMed收錄的同篇論文摘要也確認了研究範圍與主要結果。評估涵蓋文字、影像及兩者合併的輸入,測試模型能否提出正確診斷。因此,研究衡量的不全是直接「看圖」的能力,也包括根據文字描述推論疾病。
答題方式會影響成績:要求模型自行寫出診斷時,合併準確率為42.9%;提供選項時則為58.1%。跨研究的統計模型比較估計,專家醫師準確率高出AI約13.0個百分點,95%信賴區間為0.9至25.2個百分點,P值為0.038。這是準確率的絕對差距,不能解讀為AI在每一種檢查或疾病上都固定落後相同幅度。
比較基礎也有邊界。48項研究中,只有12項納入醫師對照;上述差距來自跨研究模型估計,並非所有AI與醫師都在相同病例、相同條件下交手。病例組成與難度的差異可能影響結果,這些答題成績也不能直接換算成醫院日常診斷的錯誤率。
另一個容易誤讀的結果,是純文字輸入的表現優於只給影像或同時給圖文。作者提醒,文字有時已包含人員撰寫、整理過的影像發現,相當於先提供了重要線索;各組任務難度也未必一致。這個關聯支持進一步研究文字輔助用途,卻不能證明拿掉影像就能讓診斷更準。
證據品質同樣限制了結論的延伸:僅1項研究被評為低偏差風險,其他研究多為風險不明或偏高。測試材料也幾乎全為英文,對中文醫療情境的適用性尚無充分依據。加上文獻搜尋止於2025年3月,這份分析呈現的是當時模型與評估方法的證據,無法代表其後所有新版本的能力。
對臨床而言,下一步是釐清AI在哪些工作環節能提供可靠協助。作者提出,供醫師審閱的鑑別診斷建議等用途可繼續評估,但部署前應有標準化測試、足夠樣本及透明的方法報告。要判斷這類工具能否改善照護,還需要在貼近實際工作的條件下,檢驗醫師使用AI後的表現與安全性。