← 返回首頁

醫療AI接手三次複診推演,疾病管理表現不遜於基層醫師

在100組跨科、連續多次的模擬診療中,Google的AMIE能提出更精準、較貼近指引的照護計畫;但文字情境裡的勝出,尚不能證明它能安全照顧真實病人。

By SURL BioNews

慢性病照護的難處,往往不在一次答對診斷,而在數月間反覆調整檢查、藥物與追蹤安排。發表於《Nature》的研究顯示,Google開發的醫療AI系統AMIE,在模擬這類連續決策時,整體管理推理能力不遜於基層醫師,並在計畫精準度及遵循臨床指引方面取得較高評分。

研究採隨機、盲法的虛擬臨床技能測驗設計,納入21名基層醫師、21名扮演病人的參與者,以及100組橫跨五個專科、各含三次看診的文字諮詢情境。這些案例依據英國NICE指引與BMJ Best Practice設計,背後資料庫合計包含627份文件,讓評估不只考驗單次問診,也涵蓋後續檢查、治療調整與疾病進展後的應對。

AMIE並非單一聊天機器人。依Google說明,系統由即時對話代理與管理推理代理協作:前者向病人蒐集資訊並解釋計畫,後者則查閱臨床指引和藥品處方集,整理可能的檢查、治療與追蹤選項。專科醫師在不知道答題者身分的情況下評分,結果認為AMIE的整體疾病管理推理達到相對於基層醫師的非劣性標準。

差異主要出現在計畫的取捨。AMIE在治療及檢查建議的精準度、與指引的對應程度上得分較高,意味它較能把建議收斂到情境所需的項目,而不是堆疊大量可能選項。研究另以RxQA藥物推理基準測試困難用藥問題;當系統可調用外部藥品資訊時,表現也優於受測醫師。

不過,這項比較衡量的是受控文字情境中的推理品質,而非病人的健康結果。模擬病人不會完整重現真實診間裡含糊的敘述、共病交互作用、檢查延誤、服藥困難與突發惡化;三次虛擬看診,也不足以驗證長期照護中的安全性、責任歸屬及醫病關係。研究作者來自Google Research與Google DeepMind,系統仍需接受獨立且更貼近臨床現場的檢驗。

若要成為臨床決策支援工具,AMIE還必須證明它在不同醫療制度、族群與病歷資料品質下仍然可靠,並建立醫師覆核、錯誤攔截、隱私保護與持續監測機制。尤其「不遜於醫師」是針對特定評分指標與預先設定界值的統計結論,不能解讀為可取代醫師或自主開立治療。

Google表示已展開全國性的真實世界虛擬照護研究,探索系統在臨床環境中的用途;這將是更關鍵的一關。現階段,研究證明的是醫療AI已能在多次看診之間維持較有結構的疾病管理推理,而《Nature》論文與獨立評論均明確指出:AMIE尚未準備好投入實際臨床照護。

References

  1. Nature
  2. Google
  3. arXiv
  4. PubMed
  5. Nature Medicine