← 返回首頁

讓電子病歷先「跑一遍」臨床試驗:五個AI代理人協作設計與重現療效

EmulatRx把試驗規畫、病人篩選、臨床審查與因果分析拆給五個AI代理人,並在兩套真實世界資料中模擬20項研究;結果顯示它可能加快前期決策,卻還不能取代隨機試驗與專業把關。

By SURL BioNews

一項臨床試驗真正招募病人以前,研究團隊必須反覆推敲納入條件、療效指標與統計方法。威爾康奈爾醫學院團隊開發的EmulatRx,試圖讓人工智慧先利用去識別化電子健康紀錄「排演」這套流程,協助研究者估算哪些設計可行,以及既有醫療資料能否重現已知治療效果。

這套系統不是由單一聊天機器人包辦,而是由五個專責的大型語言模型代理人協作:分別產生試驗方案、建立電子病歷研究族群、進行臨床合理性審查、執行因果分析,以及監督整體工作流程。如此分工的目的,是把每一步的輸入、判斷與修正留下紀錄,讓研究者可以追查結果如何形成,而非只接收一個難以檢驗的答案。

研究人員共評估20項「目標試驗模擬」。其中10項急性疾病研究使用重症照護資料庫MIMIC-IV,另外10項慢性病研究則採用INSIGHT臨床研究網絡、涵蓋紐約市五個醫療系統的資料。論文指出,EmulatRx在多項分析中重現了過去研究所報告的治療效應,顯示它有機會用於試驗前的可行性評估與方案比較;但這種一致性並不代表系統已證明治療有效。

在試驗方案解析環節,採用GPT-4o的「Trialist」代理人取得95.4%的F1分數。研究中的模型比較也顯示,GPT-4o在臨床相關性、推理與SQL查詢生成方面優於受測的本地模型。不過,這項成績衡量的是特定工作表現,不能直接解讀為整套流程有95.4%的臨床正確率,也未證明相同優勢能延伸至其他醫院、病歷格式或疾病領域。

這類工具最現實的用途,可能是提早發現招募條件過窄、樣本數不足、資料缺漏或共變項失衡等問題,並從既有紀錄中產生可供專家檢查的初步分析。團隊已將EmulatRx 1.0.0版程式封存於Zenodo並連結公開程式碼庫,為外部研究者檢視與重現實作提供入口;康乃爾大學的技術移轉資料則顯示,相關技術已提出臨時專利申請。

然而,真實世界資料帶有診療選擇、紀錄品質與病人差異造成的偏差。即使因果推論方法能調整已量測的因素,也無法保證排除未被記錄的混雜變項;語言模型生成錯誤條件或查詢程式碼,也可能悄悄改變研究族群。研究團隊並承認,目前缺少標準化的端到端評測基準,且仍須在更多醫療資料庫中驗證。

因此,EmulatRx較適合被視為臨床研究團隊的設計與稽核輔助工具,而不是自動核定療效的裁判。若要進入常規試驗規畫,除了持續的人類監督,還需建立跨機構驗證、版本與稽核管理、病歷隱私治理,以及監管單位可接受的證據標準;真正的前瞻性隨機試驗,仍是回答治療效果與安全性問題的關鍵環節。

References

  1. Weill Cornell Medicine
  2. Nature Communications
  3. Zenodo
  4. Cornell Flintbox