生醫AI · us
臨床AI輸給通用模型?兩場評測得出相反答案,醫療聊天機器人的信任考題浮上檯面
一項獨立比較顯示,專為醫師打造的臨床AI未必勝過前沿通用模型;另一項醫師評測卻讓OpenEvidence大幅領先。分歧不只關乎排行榜,更暴露資料來源、評分方式與利益關係如何左右「可靠」的定義。
醫師愈來愈常向AI詢問診斷線索、治療選項與最新文獻,但一套掛著「臨床專用」標籤的系統,是否真的比通用聊天模型更可靠?近期兩項評測給出近乎相反的答案,使爭論從模型能力延伸到更根本的問題:現有測驗能否證明一項工具足以進入真實醫療決策。
刊於《Nature Medicine》的主要研究,把OpenEvidence與UpToDate Expert AI,和GPT-5.2、Gemini 3.1 Pro及Claude Opus 4.6放在同一場比較。測試包含500題MedQA、500項HealthBench題目,以及100個真實臨床查詢;後一部分由12名不知道答案來源的臨床醫師完成共1,800項評註。結果顯示,三款通用模型形成表現較高的一群,兩套臨床工具則整體落後。
差距並非單純等同於「通用模型更安全」。研究在有害內容與幻覺方面沒有發現模型間的顯著差異;較明顯的問題出現在可用性上,例如UpToDate Expert AI約有19%的拒答率,OpenEvidence的清晰度評分最低。對忙碌的臨床現場而言,回答是否完整、易懂且能直接支援判斷,可能與答對知識題同樣重要。
然而,這項評測也有不容忽略的盲點。作者承認,公開醫學題庫可能曾進入模型訓練資料,造成基準污染;HealthBench部分又由前沿模型參與評分,可能偏向與其表達方式相近的答案。臨床工具透過瀏覽器介面接受測試,也未必等同其正常工作流程。研究更沒有比較引用文獻的品質、答案可追溯性與回應速度,而這些正是醫師選用專業工具的重要理由。
爭議之所以升高,還因另一篇arXiv研究得出相反結論。該評測使用620個醫師實際提交給OpenEvidence的問題、187項HealthBench題目,並邀請149名執業醫師依專科配對評估。在盲化的兩兩比較中,醫師在準確性、臨床實用性、來源品質、可驗證性與完整度上,都較偏好OpenEvidence,而非GPT-5.5、Gemini 3.1 Pro或Claude Opus 4.8;其一對其餘模型的優勢約為25至39個百分點。
這個反轉同樣需要放回研究設計中解讀。第二項研究的問題來自OpenEvidence既有使用者,OpenEvidence也參與資料蒐集規畫與醫師招募;這可能讓題目分布更貼近該產品擅長的使用情境。另一方面,它對來源品質與臨床效用的評估,又補上了第一項研究未處理的關鍵面向。因此,兩項結果未必能簡化成誰對誰錯,更可能顯示不同題庫、模型版本、使用介面與評分標準會產生不同贏家。
真正缺少的,是更接近臨床後果的共同驗證框架:由獨立機構使用未公開、具時效性的病例與問題,預先登錄分析方法,檢查引用是否支持主張,並追蹤錯誤是否會改變診療決策。醫學考題上的高分只是起點;在這些條件具備之前,不論專用或通用模型,都不宜僅憑一次排行榜便取得醫療信任。