← 返回首頁

AI讀癌症論文逼近專家,但最難的仍是看出研究破綻

四款大型語言模型接受24篇乳癌與病毒研究的結構化評讀測試;GPT-5系列的整體一致性分布接近領域專家,但方法學判讀、全文矛盾與小模型幻覺,劃出了自動化證據審查的邊界。

By SURL BioNews

醫學文獻快速增長,真正稀缺的已不只是閱讀時間,而是判斷證據能否支撐結論的專業注意力。一項已獲同儕審查、並同步登上arXiv的研究顯示,大型語言模型在高度結構化的癌症文獻評讀中,部分表現可逼近領域專家;然而,一旦任務深入研究設計與內部矛盾,機器的弱點便更清楚地浮現。

研究以「類小鼠乳腺腫瘤病毒」(MMTV-like virus)是否與乳癌相關為案例,選取24篇論文,設計77項證據擷取與批判性評讀題目,涵蓋選擇題、量表、多選及自由文字回答。接受測試的模型包括Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5與GPT-5 Nano,研究團隊再比較專家彼此之間,以及專家與模型之間的答案一致程度。

結果顯示,GPT-5與GPT-5 Nano所得的一致性分數分布,與專家間的分布在統計上無法區分。這並不代表模型逐題等同專家,更不能解讀為已具備獨立裁決醫學證據的能力;它表示在這套限定主題、預先結構化的評讀框架內,兩款模型的整體答題模式落在專家差異所形成的範圍之中。

模型之間也呈現不同偏差。兩款Gemini模型在套用微生物致癌判準時較為寬鬆,可能使證據不足的關聯較容易通過門檻。虛構內容整體少見,但在較小型模型中較常發生;即使總體一致性看似理想,少數錯誤若落在關鍵研究或核心判準上,仍可能扭曲系統性綜述的方向。

最持續的困難集中在方法學評估,以及辨認同一篇全文內互相牴觸的敘述。這兩項工作需要理解實驗設計、對照是否恰當、推論是否越界,並把分散在方法、結果與討論段落的資訊串連起來,正是生醫證據審查中最難被簡化成資料擷取的部分。

這項研究支持把大型語言模型用作初步篩選、欄位擷取或第二位評讀者,協助處理人力難以全面追蹤的文獻量;但它尚未證明模型能取代專家。測試只涵蓋單一微生物—癌症問題與24篇論文,也未回答模型在其他疾病、不同品質文獻或持續更新的真實審查流程中能否維持表現。研究者提出多模型策略的可能性,但在投入生醫決策前,仍需更廣泛的外部驗證、錯誤追蹤與人工覆核機制。

References

  1. arXiv
  2. Frontiers in Cellular and Infection Microbiology