醫療人工智慧 · eu
醫療AI走進跨科會診:百例研究顯示有用,建議一致性仍有限
面對複雜發炎性疾病,OpenEvidence能提供醫師認為有用的資訊;但與會診結論完全一致的比例約四至五成,同一問題的回答也會隨時間改變。
當發炎性疾病牽涉不同器官,治療選擇往往需要多科醫師共同權衡。能即時整理醫學文獻的人工智慧,能否幫忙釐清這些難題?10月2日刊於《Scientific Reports》的一項研究,把醫療大型語言模型OpenEvidence帶進真實會診流程,得到一個審慎的答案:資訊有用,建議的一致性卻仍有限。
這項單中心、前瞻性觀察研究納入100個連續收案的複雜發炎性疾病病例。醫師先自行討論並記錄初步建議,再查看AI回答,補充討論後確認最終建議。來自七個專科的21名醫師共完成759份病例評分;這些評分反映專家的使用感受,並非759名患者的治療結果。
醫師整體上肯定AI的實用性。在滿分五分的量表中,「提供與病例相關的臨床資訊」平均獲得4.06分,推薦未來繼續使用則為3.95分。這顯示它能融入討論,但覺得資訊有幫助,與接受其診療建議,仍是兩種不同的判斷。
兩名醫師另行評估97個可判讀病例,各自認定AI回答與最終會診建議完全一致的比例,分別為40.2%及50.5%。兩人的評分也有分歧。因此,這些數字應理解為與專家結論的吻合程度,不能直接當成AI診療的正確率;尤其最終建議是在醫師看過AI回答後確認,也不是完全獨立的比較基準。
研究團隊接著調整提問方式,讓模型先檢查資訊是否足夠,再提出建議。回答的一致性有改善趨勢,卻未達統計顯著。由於兩輪測試相隔數月,期間平台持續更新,研究也無法把提問改善的效果與系統變動清楚分開。
時間帶來的差異同樣值得留意:研究將相同問題再次輸入後,回答內容與引用文獻都發生變化。對臨床使用而言,一次表現良好的回答,不能保證往後仍能重現;而模型掌握多少病情,也取決於醫師事先提供了哪些資訊。
這項研究支持的是AI作為會診輔助工具的可行性,尚未證明它能改善患者預後。研究沒有評估臨床傷害,也未系統檢驗「幻覺」——看似合理、實際錯誤的生成內容;加上病例來自單一中心,結果能否推廣仍有界限。如何持續驗證更新後的系統,並讓專家辨識回答中的缺漏,是走向日常醫療仍須回答的問題。