生醫AI · global
AI從藥廠歷史學會排試驗,腫瘤臨床開發預測勝過通用代理
研究團隊把藥物開發轉化為「下一個半年該啟動哪些試驗」的學習任務;專門訓練的模型明顯領先通用AI,但預測貼近歷史決策,不等於找到了最佳策略。
一項新研究試圖回答藥物開發最昂貴、也最難標準化的問題:面對療效訊號、競爭格局與有限資源,下一步究竟該把哪些臨床試驗排進組合?研究人員沒有要求通用AI臨場推理,而是讓模型從數十個腫瘤藥物計畫的歷史決策與後續結果中,直接學習開發策略。
William Bolton與Philip Torr將每項藥物計畫切成六個月的決策窗口,要求模型根據當時已公開的資訊,預測贊助商接下來會啟動的試驗。資料集涵蓋45項腫瘤藥物計畫、881個決策片段,由31,700筆公開紀錄整理而成,包括試驗登錄、監管審查、公司申報、藥物使用與癌症流行病學資料;每項預測還須填入適應症、期別、試驗策略、比較組、地區與終點等14個欄位。
表現最佳的是「獎勵加權行為複製」模型:它不只模仿藥廠曾經做過的決定,也提高後來取得FDA核准、帶來營收之試驗在訓練中的權重,並降低失敗或終止試驗的影響。在2025年8月後、理論上較不易被既有訓練資料污染的測試集中,模型的適應症F1分數達46.2%,嚴格F1為14.2%;各項指標中最強的通用工具代理分別只有25.0%與2.1%。嚴格F1必須同時配對適應症、試驗期別及策略,因此更接近完整開發決策。
這項工作先前已分別獲ICML 2026兩場工作坊選為焦點報告與海報。5月公開的版本使用相同規模資料,當時離線訓練模型在時間切割測試中的適應症F1為39.9%,工具代理為11.2%;8月預印本則納入更多訓練方法與評估,並報告更新後的46.2%結果。研究還發現,把工具代理檢索到的限時資料交給專門模型,適應症與嚴格F1可進一步升至59.0%及18.6%,但這項混合測試同樣建立在很小的樣本上。
數字背後仍有一道關鍵界線:模型學到的是「歷史上的贊助商後來怎麼做」,不是某項決策在因果上必然更好。藥物本身品質、定價、公司資源與未公開資訊都會影響核准和營收;而研究用來隔離既有模型記憶的最新測試集只有24個決策窗口。即使46.2%領先比較組,也代表超過一半的適應症配置未能吻合歷史答案,嚴格F1的絕對值更低。
此外,公開開發紀錄偏向大型藥廠、常見癌別與成功上市的資產,可能讓模型複製既有產業取向,忽略罕見癌症、兒科或商業吸引力較弱的研究方向。這項預印本因此較適合作為AI輔助情境分析的概念驗證,而非自動制定試驗、投資或監管策略的工具;真正走入藥廠決策流程前,仍需前瞻驗證、偏差稽核,以及由臨床、統計與法規團隊共同把關。