生醫人工智慧 · global
AI會挑分子,卻還沒證明能造出更好的藥:製藥評測須跨出排行榜
《Nature Reviews Drug Discovery》觀點文章指出,模型準確率的進步尚未轉化為清楚的臨床效益;下一代評測應追問AI是否真的改善研發決策。
人工智慧已能預測蛋白質結構、篩選化合物、設計新分子,也常被寄望縮短漫長而昂貴的製藥流程。然而,真正攸關病人的問題不是模型能否在測試集上多拿幾分,而是它是否讓研究團隊更早排除失敗候選、選出更安全有效的藥,並加快送達臨床。《Nature Reviews Drug Discovery》最新觀點文章認為,這道關鍵證據目前仍相當有限。
文章檢視過去十多年AI藥物探索的發展,指出模型開發、應用與基準測試雖已大量增加,卻還缺少足以證明病人因此更快獲得更安全或更有效藥物的臨床相關成果。這不是說AI毫無作用,而是現行證據多半停留在預測表現、運算速度或單一研發環節,與新藥最終能否成功之間仍隔著多重關卡。
其中一項難題來自生命科學資料本身。化合物活性、毒性與藥物動力學結果,往往會隨實驗條件、細胞系、劑量及資料來源改變;模型即使善於擬合既有資料,也未必能處理新化學空間或臨床情境。若訓練任務定義得不夠精確,數個在排行榜上表現相近的模型,到了真實研發流程中可能做出截然不同的判斷。
作者也區分了由技術能力推動的「技術推力」與由生物醫學問題牽引的「科學拉力」。前者容易從新演算法出發,再尋找可套用的資料;後者則先界定研發團隊必須做出的決策,以及錯判會造成的成本。文章主張,AI工具若要產生實際影響,問題設定、資料生成與驗證方式都應從具體使用情境反向設計。
這也意味著評測標準必須改變。與其只比較模型在固定資料集上的準確率,研究者更應衡量AI是否提高候選化合物的命中率、減少不必要實驗、改善後續候選排序,或更早辨識安全性與轉譯風險。這類前瞻性、嵌入實際流程的驗證較慢也更昂貴,卻更接近藥廠、監管機關與病人真正需要的答案。
這篇文章屬於跨領域觀點整理,並非針對單一AI藥物、臨床試驗或病人資料所做的新研究,也未提出足以量化整體產業效益的統一數字。因此,它不能證明個別計畫成功或失敗;更精確的結論是,現有評測尚不足以支撐產業最宏大的臨床承諾。AI製藥接下來的考驗,不只是能否設計出看似新穎的分子,而是能否留下可追蹤、可比較的決策紀錄,證明它確實改變了藥物走向病人的路徑。