醫療人工智慧 · us
AI看懂精神科模擬問診,臨床推理仍有落差
一項以標準化病人影片進行的研究,展現多模態AI輔助精神狀態評估的可能;但辨認言語與行為之後,如何理解妄想等主觀經驗,仍是走向臨床的關鍵考驗。
精神科問診的線索,藏在病人說了什麼,也藏在語調、動作與思緒如何展開。AI若能協助整理這些訊息,可能為臨床教學提供新的工具。UTHealth Houston與耶魯大學合作的一項研究,便以模擬問診影片測試這種能力:整體診斷表現獲研究團隊肯定,細項評估卻揭露了尚未跨越的推理落差。
研究刊於《npj Mental Health Research》,使用Qwen3-Omni多模態模型搭配團隊開發的軟體,分析影片中的言語、聲音與行為,並產生精神狀態評估的文字說明。測試對象是演出思覺失調症、強迫症與雙相情緒障礙的標準化病人,涵蓋不同症狀嚴重程度;這是受控的模擬情境,尚不能代表真實門診中的表現。
AI與兩所機構的精神科專家團隊,分別就情緒、外觀、言語、知覺及思考過程等十個面向進行分類。論文摘要指出,396項分類中,專家彼此的一致性指標Gwet’s AC1為0.87,模型與專家的對齊程度則為0.70至0.72。這些數字衡量的是評估一致性,不能直接解讀為診斷正確率,也顯示AI與專家判斷之間仍有距離。
UTHealth Houston的公告及Medical Xpress刊載的校方報導,強調模型整體診斷持續準確,但也提及外觀與細微動作判讀的錯誤。論文摘要進一步指出,模型容易將言語、情感表現等可觀察線索判為異常,卻較容易漏掉妄想等需要理解主觀經驗的徵象;隨症狀加重,模型與專家的判斷一致性也下降。
這使研究的教育用途更為具體。團隊提出,學生可把AI評估與資深醫師的判斷並列,追查錯誤如何發生,再練習從病人的敘述推導臨床意義。研究者也希望未來能支援年輕醫師或缺乏精神科訓練的臨床人員,而改善各項評估能力是下一步工作。
從模擬影片走進診間,仍須以真實病人驗證。此次結果提供了可供檢驗的能力與錯誤模式,尚未證明工具能改善照護結果。對精神科AI而言,能擷取影音線索只是起點;能否可靠地理解病人的經驗,並讓醫師辨識其判斷盲點,才決定這類系統可以承擔多少臨床責任。