← 返回首頁

會解釋的皮膚科AI更可信,也可能更會誤導:研究揭開自動化偏誤

623名一般民眾與153名基層醫師的實驗顯示,兼顧膚色公平性的診斷AI可提升整體表現;但當模型答錯,流暢的LLM解釋反而最容易把非專業使用者帶向錯誤答案。

By SURL BioNews

醫療AI若不只給答案,還能說出一套看似合理的理由,理應更容易讓人判斷是否可信。然而,一項刊於《Nature Medicine》的皮膚科研究指出,解釋也可能成為說服力的放大器:模型正確時協助判斷,模型出錯時卻讓缺乏專業知識的人更難抗拒錯誤建議。

研究團隊進行兩項線上實驗。623名無醫療背景的參與者辨認黑色素瘤與良性痣;153名基層醫師則針對異位性皮膚炎、玫瑰糠疹、萊姆病與皮膚T細胞淋巴瘤提出鑑別診斷。每人評估12張深、淺膚色各半的臨床影像,並被隨機分配至四種AI輔助方式之一:只顯示預測與信心分數、標示影像區域的熱圖、呈現相似病例,或由多模態大型語言模型生成文字解釋。研究另納入320名醫學生,協助比較經驗差異。

底層診斷模型採用公平性約束訓練。用於黑色素瘤與痣分類的模型,將深、淺膚色之間的平衡準確率差距由基準模型的9.1個百分點縮至2.1個百分點;AI輔助也讓一般民眾的平均準確率由69.7%升至75.8%。醫師接受AI建議後,四種主要皮膚病的診斷表現同樣改善,原有的膚色差距亦縮小。結果顯示,降低不公平不能只靠介面上的解釋,更關鍵的是模型本身是否在不同膚色上維持相對均衡的效能。

風險出現在AI犯錯之時。對一般民眾而言,LLM文字解釋在預測正確時帶來13.4個百分點的進步,高於另外三種呈現方式;但預測錯誤時,準確率也下降21.1個百分點,跌幅同樣最大。研究者認為,語句流暢、援引皮膚特徵的理由即使建立在模糊或不完整的影像線索上,仍可能使使用者把「說得像真的」誤當成「判斷正確」。

基層醫師對錯誤建議較有抵抗力,各種解釋方式下的最終表現幾乎未受錯誤AI預測拖累;LLM解釋也未帶來最大的準確率增益,主要好處反而是讓醫師的信心程度與實際答對情形更一致。醫學生比有經驗的醫師更傾向跟隨AI,暗示專業訓練可能提供一道防線,但並非絕對保障。當系統在使用者自行判斷前先顯示AI答案時,兩組受試者的依從傾向多半增加,醫師面對LLM解釋時也出現較明顯的錨定效應。

這些結果尚不能直接等同真實診間成效。兩項實驗的任務並不相同,因此一般民眾與醫師的數字不能直接對比;每位參與者只看12張影像,也沒有年齡、病史與症狀等臨床背景。測試病例還經刻意抽樣,以控制AI答對與答錯的比例,而LLM解釋受到特定提示語及單次生成方式影響。研究因此支持的不是「多寫一段解釋就更安全」,而是醫療AI介面應讓使用者先形成自己的判斷、清楚提示不確定性,並在AI大幅改變原始判斷時引入第二位專業人員覆核。

References

  1. Nature Medicine
  2. arXiv