生醫AI · global
AI看得懂蛋白質,卻還找不準抗體落點:EpiBench揭開表位推理缺口
一套涵蓋1,609個實驗與結構證據樣本的新評測顯示,通用大型語言模型能捕捉粗略表位訊號,卻難以把特定抗體、胺基酸位置與免疫逃脫連成可靠判斷。
抗體能否成為好藥,不只取決於它會不會黏上抗原,更取決於它究竟黏在哪裡。這個被稱為「表位」的區域,可能左右阻斷效果、治療專一性與突變後的免疫逃脫;然而一項新評測顯示,即使大型語言模型已能回答複雜生醫問題,要它直接從蛋白質序列找出這個關鍵落點,能力仍相當有限。
研究團隊建立的EpiBench收錄1,609個樣本,依據抗體—抗原複合體的結構接觸、整理過的B細胞功能實驗,以及深度突變掃描所測得的逃脫效應製作標籤。評測刻意移除抗體名稱、抗原名稱、蛋白質結構資料庫編號與論文資訊,只保留抗原和抗體序列、殘基位置或突變資料,藉此降低模型靠記憶題目作答的機會。
題目沿著抗體研發流程分成五類:從抗原序列尋找可能被鎖定的區域、判斷特定抗體對應的表位、將結合位置重疊的抗體分組、辨認具有功能作用的表位,以及預測單點突變是否會讓抗體失效。這些任務分別對應候選區域選擇、作用機制釐清、抗體組合設計與抗藥性風險評估,而不只是一般的生物知識問答。
九款通用模型接受統一的零樣本測試後,沒有任何一款全面領先。部分模型能把預測範圍大致放在可能的表位附近,但在逐一區分表位與非表位殘基時,表現仍接近隨機;需要配合特定抗體判斷結合位置或逃脫效應的題目,也暴露出序列對應與結構推論不足。可直接比較的任務中,專用表位模型整體仍優於通用大型語言模型。
長序列尤其容易讓模型迷失位置。在尚未提供特定抗體的區域探索任務中,九款模型的平均前50個候選殘基召回分數,從抗原短於200個胺基酸時的81.3,降至抗原超過800個胺基酸時的12.8。要求模型寫出明確推理過程也沒有穩定改善結果;錯誤答案常依賴看似合理的序列基序、一般理化性質或抗體序列相似度,卻未真正扣住所問的抗體—表位關係。
這項結果較適合被視為診斷工具,而非對AI抗體設計能力的最終裁決。EpiBench採封閉式、僅序列輸入與可自動計分的設定,沒有直接模擬結構建模、實驗回饋及人工判讀共同參與的真實研發流程;部分已知表位也可能不完整。研究目前僅以預印本形式公開,尚未經同儕審查,但它清楚劃出一道界線:通用模型可以提供粗略線索,距離獨立支撐抗體候選選擇與逃脫風險判斷,仍缺少殘基定位、抗體專一性及生物機制上的可靠基礎。