醫療人工智慧 · global
醫療AI懂得交棒之後:98.9%診斷準確率背後的臨床缺口
讓AI只處理較有把握的病例,可能是通往自主診斷的一條路。但當超過半數病例交回醫師,整套流程能否改善照護,才是尚未回答的問題。
醫療AI遇到不確定的病例,懂得停下來請醫師接手,聽來是合理的安全設計。然而,交棒之後是否真的減少誤診、病人能否及時獲得處置,並不會由一個漂亮的準確率自動回答。《Nature Medicine》10月2日刊出的評論,將焦點放在這段尚未驗證的臨床流程:AI可以篩出較可靠的診斷,但轉交人工審查後的結果,仍缺乏實測證據。
評論討論的是9月15日刊於同一期刊的一項研究。德勒斯登研究團隊讓扮演醫師與病人的兩個AI代理,在本地運行的模擬環境中互動;「醫師」可以追問症狀、要求檢驗資訊,再提出診斷與理由。病例取自既有電子病歷,涵蓋肺炎、泌尿道感染、闌尾炎等疾病。系統與資料處理留在機構自己的設備內,有助掌握資料流向、模型版本與存取權限,但這些管理優勢本身不能保證診斷安全。
在源自MIMIC-IV臨床資料的兩組測試中,系統對551例、七種疾病的診斷準確率達90.04%;另一組包含2,400例、四種腹部疾病的測試,準確率為83.8%。研究另以涵蓋十個專科的990例VivaBench病例測試延伸表現。這些都是回溯性模擬,能衡量特定資料與任務下的能力,卻尚不能代表醫院日常照護中的成效。
研究更關鍵的設計,是讓系統反覆處理同一病例,檢查診斷是否穩定。當診斷一致性門檻設為0.90,主測試中有49.4%的病例被保留,這個子集的準確率升至98.9%,其餘則被分流至待審查組。換句話說,高準確率伴隨的是處理範圍縮小,並非所有病例都達到同樣表現;反覆給出相近答案,也仍可能留下穩定的錯誤。
人工核對提供了另一層檢驗。依德勒斯登數位健康中心的說明,醫師審閱181個隨機選出的病例後,自動評估與醫師共識的一致程度超過九成。這項結果支持評估方法具有一定可信度,卻沒有測試醫師實際接手後能否修正錯誤。新評論指出的缺口正在這裡:把疑難病例交出去,只完成分流,尚未證明整段照護流程更安全。
落地條件也會改變這套方法的表現。研究發現,一致性門檻須隨模型與技術設定重新校準,不能直接搬到另一套部署環境。德勒斯登團隊亦指出,涉及較年長病人的模擬病例表現較差,原因還待釐清;重複運算所需的成本,也促使團隊尋找更有效率的可靠度檢查方式。這些問題關係到哪些病人容易被分流,以及醫療機構是否有能力持續執行檢查。
下一步因此要把醫師與真實工作流程納入前瞻性研究。研究作者及ICT&health的同事件報導都強調,需要評估醫師對AI的依賴、審查負擔、病人安全與臨床結果。從照護角度看,真正要衡量的是保留病例與轉交病例的共同結果:AI省下的時間,能否讓醫師更妥善處理疑難個案,而整體診療品質是否隨之提升。