← 返回首頁

從心電圖到病歷一次推理:QoQ-Med3測試跨模態醫療AI

研究團隊讓同一套模型處理醫學影像、心電訊號與臨床文字,並在跨資料集測試中展現可轉移性;然而,回溯性基準的領先表現,距離真實診療決策仍有關鍵落差。

By SURL BioNews

臨床判斷很少只依靠一張影像或一段病歷。醫師往往必須把心電圖、放射影像、檢驗紀錄與文字報告拼在一起,辨認彼此呼應或矛盾之處。刊登於《npj Digital Medicine》的研究提出QoQ-Med3,試圖讓單一基礎模型跨越這些資料形式,而不是每種檢查各用一套AI。

研究團隊建立QoQ-Med3與加入MIMIC-IV資料訓練的QoQ-Med3-MIMIC兩個版本,公開模型則以Qwen3-VL-8B-Instruct為基礎,規模約90億參數。模型採用針對臨床領域與資料難度調整獎勵的強化學習方法,希望避免常見影像或疾病主導訓練,讓超音波、乳房攝影等資料較少的領域也能得到足夠學習訊號。

一般版使用CLIMB資料集的約261萬筆樣本,涵蓋心電圖,以及胸部X光、乳房攝影、皮膚鏡、病理、眼底、超音波、磁振造影與電腦斷層等二維、三維資料。MIMIC版則進一步納入去識別化的加護病房與急診電子病歷,使模型能在較長的臨床脈絡中,綜合心電訊號、胸部X光與文字紀錄回答問題。

論文報告,QoQ-Med3在彙整多項任務後取得71.3%的平衡準確率,F1分數為0.349,整體超過研究納入的開源與封閉模型,包括GPT-4o;進步在超音波與乳房攝影尤其明顯。不過,這些數字來自不同資料集與分類任務的綜合評估,不能直接解讀為模型在臨床現場具有71.3%的診斷正確率,F1分數也顯示少數類別與複雜任務仍有相當改善空間。

跨院資料測試是這項工作的另一重點。僅以公開資料訓練的版本,仍能轉移至保留未參與訓練的MIMIC-IV資料,以及約翰霍普金斯醫院的私人PMAP資料;研究也報告,訓練後由外部資訊不足所引發的幻覺率下降44.4%。這些結果支持模型學到部分可轉移表徵,但跨資料集表現與面對真實病人、設備差異和不完整紀錄時的可靠度,仍不是同一件事。

兩個約90億參數的模型版本已依MIT授權公開,並提供多種推論框架與容器化執行方式,方便其他團隊重現及檢驗。研究團隊同時把它們明確定位為研究預覽:現有證據主要來自回溯性資料與預先定義的問答或分類任務,尚缺前瞻性臨床試驗、與醫師協作的工作流程評估,以及對校準、族群偏差、隱私和失誤責任的完整驗證,因此不適合直接用於臨床部署。

References

  1. npj Digital Medicine
  2. Hugging Face
  3. Hugging Face