← 返回首頁

近1.4萬人實測AI問診:會追問症狀,比直接回答更接近臨床思考

Google以Fitbit招募近1.4萬人測試五種對話代理;主動追問的系統在鑑別診斷上優於一般聊天模式,但關鍵結果只建立在少數自述就醫診斷者身上,尚不足以取代醫師。

By SURL BioNews

當生成式AI開始回答頭痛、咳嗽或胸悶等健康疑問,真正的考驗不只是它「知道多少」,而是能否像問診一樣,從零散敘述中追問病程、伴隨症狀與風險訊號。Google研究團隊的大型實地研究顯示,經過設計、會主動蒐集病史的對話代理,確實比讓使用者自行引導的一般聊天模型更能提出接近後續臨床判斷的鑑別診斷;然而,這項結果距離證明AI能安全獨立看診,仍有明顯距離。

研究透過Fitbit應用程式招募13,917名同意參與者,隨機分派至五種以Gemini Flash 2.0為基礎的SymptomAI代理。四種代理分別依固定問題、彈性問題或動態推理方式主導訪談,另一組則採接近一般聊天機器人的使用者主導模式。每段對話結束後,系統列出數個可能病因及下一步建議;所有內容僅供研究分析,並非正式醫療診斷。

真正可用來核對結果的樣本遠少於總參與人數。兩週後,只有1,228人回報醫療人員提供的診斷,其中517例進入超過250小時的臨床專家評閱。具專科認證的醫師在盲態下檢視同一批對話文字,提出自己的鑑別診斷,再由臨床評閱者比較AI與醫師名單。最新版預印本報告,SymptomAI的鑑別診斷命中後續自述診斷的勝算約為對照醫師的2.56倍,差異達統計顯著;這一數值與較早版本所列的2.47倍略有不同。

研究最清楚的訊息,未必是「AI勝過醫師」,而是主動詢問的重要性。四種由代理帶領、會追問更多病史的策略表現相近,且均明顯優於基本的使用者主導聊天模式。換言之,醫療對話系統的價值不只取決於最後生成答案的模型,也取決於它是否知道該問什麼、何時追問,以及如何把不完整的日常語言整理成可判讀的臨床資訊。

團隊也把對話結果與逾50萬天的穿戴裝置資料配對,涵蓋近400種病況。被AI歸入急性呼吸道感染者,在接近症狀對話當日之前,心血管、呼吸、皮膚溫度與睡眠等指標出現群體層級變化。這種時間上的相符可作為生理關聯證據,卻不能反過來證明AI對個別參與者的診斷正確;穿戴訊號本身也多半缺乏疾病專一性。

研究限制集中在「標準答案」與比較方式。後續診斷由參與者自行填報,可能受到記憶、就醫意願與選擇偏差影響;近1.4萬名參與者中,只有517例納入主要專家評閱。獨立醫師也只能閱讀由AI提問所形成的文字紀錄,無法自行追問、檢查病人或調閱病歷,因此不能把這項比較等同於AI對上完整臨床看診。獨立分析另指出,其前五名診斷命中率約為七成,仍留下不可忽視的錯誤空間。

SymptomAI目前是實驗性研究原型,而非獲准使用的臨床診斷產品。若此類系統未來進入照護流程,除了需要前瞻性臨床試驗與外部族群驗證,還必須回答錯誤分流、緊急症狀漏判、責任歸屬與健康資料治理等問題。這項研究較可信的貢獻,是把醫療AI的評估從整理過的病例題,推向人們真正會使用的含糊、零碎對話;它展示了更好的問法,尚未交出可以放心交棒的診斷工具。

References

  1. Google Research
  2. arXiv
  3. Evidence Triage