生醫人工智慧 · us
從524萬組立體影像學會看腦:NeuroVFM跨進臨床分診測試
這套以20多年醫療現場資料訓練的模型,在156項診斷任務與一週前瞻性測試中勝過多個基準;但漏掉21名帶有關鍵影像發現的患者,顯示它距離獨立上線仍有一段路。
醫療影像AI的瓶頸,往往不是模型看得不夠多,而是沒有看過真正醫院裡那些品質參差、掃描協定各異,又夾雜罕見病灶的日常檢查。刊於《Nature Medicine》的研究提出NeuroVFM,嘗試直接從大型醫療體系累積的腦部與頭頸影像中,建立可支援多種診斷、報告生成和急迫度分流的通用視覺模型。
研究團隊彙整密西根醫學中心逾20年的566,915次檢查,涵蓋腦、頭頸、顏面與眼眶的CT及MRI,共形成524萬組三維影像。NeuroVFM採用名為Vol-JEPA的自監督方法:遮住立體掃描的一部分,要求模型在抽象特徵空間預測缺失區域,藉此學習解剖位置與病理變化;預訓練本身不需要診斷標籤或放射科報告。
在時間上獨立保留的臨床資料中,研究人員為模型接上涵蓋82項CT與74項MRI診斷的分類模組。156項任務的整體平均AUROC,CT為92.68%、MRI為92.49%,並普遍優於使用相同院內資料、但採報告監督或影像重建方式訓練的基準模型。這項比較顯示,成效不只來自資料量,也與模型如何從三維影像學習有關。
團隊進一步把NeuroVFM的影像編碼器與Qwen3-14B語言模型結合,生成結構化的放射影像重點,再交由推理模型判定檢查屬於正常、一般或緊急。在300件經專家核實的CT與MRI測試中,NeuroVFM生成內容的關鍵發現錯誤率約為10%,GPT-5比較組則為20%;盲測專家選擇前者報告的次數超過後者兩倍。這裡測量的是特定影像輸入與流程下的表現,不能解讀成對所有通用模型能力的全面比較。
較貼近現場的一關,是2026年1月進行的一週「靜默」前瞻性可行性研究:模型處理1,155名患者的例行影像,但結果並未用於實際醫療決策。NeuroVFM流程的平衡分診準確率為92.6%,高於GPT-5流程的71.2%;在155名具有至少一項關鍵發現的患者中,敏感度為86.5%。
這個數字也劃出了安全邊界。NeuroVFM漏掉21名具有關鍵發現的患者,主要問題出在影像病灶未被寫入生成報告,而不是後續分診推理失準。對急性出血、腫塊效應等不可延誤的情況而言,這類漏失足以排除現階段將模型當成自主篩檢工具的可能。
此外,訓練資料主要來自單一美國學術醫療體系,模型可能承接當地患者組成、設備與臨床流程的偏差;接上語言模型後也仍可能產生不存在的發現。研究團隊公開的模型與程式碼均標示僅供研究、並非醫療器材。下一步不只是到更多醫院驗證準確度,還包括資料治理、持續監測、責任歸屬與監管審查;在這些問題釐清前,臨床醫師覆核仍不可取代。