醫療人工智慧 · global
從胸腔影像到病歷問答:MedGemma研究呈現醫療專用模型的進展
《Nature Medicine》刊出MedGemma的跨任務評估,顯示醫療資料訓練能改善影像判讀與推理表現。核心成果去年已公開,如今經同儕審查發表;距離實際照護應用,仍須逐項驗證。
一張胸部X光、一小塊病理切片,加上多年病歷,承載的是不同形式的醫療線索。若同一套AI能處理這些資料,研究者便可能減少為每項任務重新打造工具的負擔。10月6日刊於《Nature Medicine》的MedGemma研究,提供了這條開發路徑的評估證據,但測試成績與診間的可靠表現之間,仍有需要補上的環節。
MedGemma以Gemma 3為基礎,透過醫療資料訓練,讓模型處理影像與文字。這次期刊發表並非模型首次亮相:研究團隊早在2025年7月公開技術報告,最近一次修訂為2026年4月。胸部X光分類等核心進步已見於早期報告;此次進展,是相關研究經同儕審查後正式刊出。
研究報告指出,在未使用該測試資料集進行訓練或調校的「分布外」任務中,MedGemma的胸部X光所見分類表現較基礎模型提升15.5至18.1%,醫療影像問答提升2.6至10%。這類測試用來探查模型面對不同資料時的能力,卻不能直接推論它換到另一家醫院、另一群病人後,也能維持相同表現。
模型如何看懂影像,是這項工作的另一個重點。Google Research說明,其影像編碼器MedSigLIP具有4億個參數,曾以胸部X光、病理切片、皮膚及眼底影像調校,將影像轉換成模型可處理的資訊。早期技術報告也指出,進一步微調後,模型在氣胸與病理切片分類上可達到接近專用方法的表現,病歷資訊檢索錯誤則減少50%;這些都是特定任務的成果,不能視為所有醫療用途的共同準確率。
生成胸部X光報告的評估,則更貼近可能的工作流程。研究使用MIMIC-CXR資料集;Google先前說明,在一項未採盲法的評估中,一名具美國專科認證的放射科醫師認為,81%的MedGemma 4B生成報告,其準確程度足以導向與原始報告相近的病人處置。這是專家對報告後果的判斷,並非實際追蹤患者後證明照護結果相同;評估者知道報告來源,也限制了證據的解讀。
推理能力同樣需要放回測試情境理解。技術報告所列的10.8%代理任務進步,來自模擬臨床互動,而非真實門診試驗。即使模型在問答與分類上有所進步,也不代表它已能安全承擔問診、診斷或治療決策。
這些結果較直接支持的用途,是作為醫療AI研究與應用開發的起點。Google明確指出,模型需要針對具體用途調整與驗證,輸出不應直接用於臨床診斷或治療決策。對準備導入的機構而言,下一步必須確認模型在自己的資料、病人族群與工作流程中會如何出錯,以及這些錯誤是否影響照護;期刊發表讓能力更容易被檢視,臨床可信度則要靠後續驗證建立。