醫療科技 · global
臨床AI搶進診間,採用速度正把驗證制度甩在身後
從病歷對話即時提示診療依據,到供醫師查詢文獻答案,專用臨床AI正爭奪決策入口;然而使用率、內部安全評分與真正改善患者結果,仍是三件不同的事。
醫師與患者交談時,AI不再只在背景整理病歷,還可能根據對話與患者資料,當場提出藥物、鑑別診斷或治療方向。這種臨床決策支援正在從搜尋工具變成診療流程的一部分,也讓一個問題變得迫切:產品進入診間的速度,是否已超過證據生成與監督制度能跟上的程度?
《Nature Medicine》指出,美國市場已有Abridge、Atropos Health與OpenEvidence等專用系統角逐,通用聊天機器人也同時被醫師使用。競爭焦點不只是誰能回答問題,而是誰能占據醫師最常使用的介面;一旦建議直接出現在病歷或看診畫面旁,省下的每一次搜尋,都可能轉化為產品黏著度與臨床影響力。
Abridge正是這種轉變的代表。這家公司原以環境式臨床紀錄工具聞名,後來加入決策支援功能,依據看診對話、患者紀錄及包括UpToDate在內的資訊來源,在原有介面中呈現情境化證據。醫師可選擇系統建議的提問或自行輸入問題,答案不會自動寫入病歷,但已被放在最接近決策的位置。
為證明產品足以進入醫療機構,Abridge表示已使用逾1,000套由醫師制定的評分規準,並加入有害提示、越權要求、歧視性情境與繞過安全限制等對抗測試。公司另稱,在逾1,000個案例的臨床安全評估中得分99.5%,並採內部測試、小規模合作醫師試用、指定部門部署的漸進方式擴大使用。然而這些數字出自公司本身,尚不能取代獨立研究,更沒有回答AI是否降低誤診、改善治療結果或減少患者傷害。
OpenEvidence則以醫學文獻問答切入。公司公布的NOHARM研究資料涵蓋101名美國專科認證醫師、45個大型語言模型、4套臨床AI系統、12,747項專家標註與4,249個潛在臨床行動;在可自由選用工具的研究組別中,醫師有22.3%的回答使用OpenEvidence,其他外部AI聊天機器人合計為19.8%。但這項基準研究尚未同儕審查,資料又由業者透過新聞稿發布;選用頻率可以反映偏好,不能直接證明診療品質較佳。
兩家公司也呈現不同的信任路徑。Abridge強調多層次測試與部署後回饋,OpenEvidence則推出EvidenceGrade,嘗試依GRADE架構標示每個回答所依據證據的品質。前者著重答案是否通過安全檢查,後者強調讓醫師看見證據強弱;但即使引用可靠文獻,系統仍可能錯配患者情境,而良好的離線評分也未必能重現繁忙診間中的時間壓力、資料缺漏與自動化偏誤。
下一階段的關鍵,因此不是再增加一個漂亮的準確率,而是建立可比較、可持續追蹤的臨床證據:系統在哪些患者、科別與工作流程中使用,錯誤如何被發現與通報,模型更新後是否需要重新驗證,以及最終是否改變患者結果。臨床AI已開始參與證據的選擇與呈現;若評估方法仍停留在業者各自定義的尺度,市場可能先決定醫師看見什麼,科學才在後面追問這些建議是否真的可靠。