← 返回首頁

不只替換胺基酸:Raygun讓AI學會縮放天然蛋白質

這套生成式AI從已有功能的蛋白質出發,同時改寫序列與長度;細胞實驗證明部分縮小版本仍能發光或催化,但大幅刪減也暴露功能流失的界線。

By SURL BioNews

蛋白質工程常像在精密機械上換零件:單點替換已不容易,若要整段增刪胺基酸,又不破壞摺疊與功能,難度更高。《Nature》發表的生成式AI框架Raygun,嘗試把這項工作變成可控制的設計問題,讓研究者從可信的天然蛋白質出發,指定要改多少序列、把成品縮短或拉長到何種程度。

Raygun建立在ESM-2蛋白質語言模型的表徵之上。它把長短不一的胺基酸序列壓縮成固定維度的機率分布,再依目標長度重建序列,因此能在一次生成中同時完成替換、插入與刪除。研究所用模型約以8萬條UniRef50蛋白質訓練;較早公開封存的預訓練版本則記載使用9.5萬條樣本,顯示論文實驗與公開模型版本並非完全相同。

最直觀的測試是縮小兩種常用螢光蛋白eGFP與mCherry。團隊先各生成7萬個候選序列,再用蛋白質家族、演化合理性與亮度預測等條件篩選,最後把8個候選放入HEK293細胞。當中6個出現高於背景的螢光;最短的成功版本分別只有199與206個胺基酸,短於FPbase資料庫中96%的螢光蛋白。不過它們的亮度低於原始模板,現階段更接近可供後續演化優化的骨架,而非即插即用的替代品。

縮小蛋白質的實際價值,在於降低它對實驗或遞送系統的負擔。較短的螢光標記可能減少融合後對小型蛋白質的干擾,也可能協助基因治療載體容納原本過大的編碼序列。研究人員因此另以鄰近標記酵素TurboID測試Raygun:11個候選中有6個能在細胞表現,但只有縮短1%與6%的兩個版本呈現顯著生物素連接酶活性;被削減約一半、僅165個胺基酸的版本雖能表現,催化活性卻不顯著。

Raygun也能反向把蛋白質拉長。研究團隊以53個胺基酸的表皮生長因子(EGF)為模板,生成55至57個胺基酸的候選,再用ProTrek模型篩選EGFR結合能力。送交實驗的4個候選均能表現,其中兩個與EGFR的解離常數分別為0.274與0.561微莫耳,優於野生型EGF的0.759微莫耳。這套Raygun加ProTrek流程也在外部EGFR結合蛋白設計競賽中名列前十,提供了獨立於團隊內部篩選的比較情境。

這些結果說明,從既有蛋白質向外探索,可能比完全從零設計更容易保留一部分成熟功能;但「預測結構仍相似」不能等同「生物功能完整」。螢光蛋白變暗、極度縮小的TurboID失去顯著活性,正顯示語言模型學到的演化規律未必能保存人工強化過的催化性能。EGF結果也只證明體外結合較強,尚未回答受體活化、細胞效應、穩定性或治療安全性。

Raygun目前較像蛋白質工程的候選產生器,而非自動交付成品的系統。真正走向研究工具或藥物,仍須接上功能篩選、定向演化、免疫原性評估與動物實驗;長蛋白和多結構域蛋白也可能需要額外微調。它的意義不在於AI已能任意縮放生命分子,而是首次把大規模序列增刪納入模板導向設計,並以細胞與結合實驗勾勒出能力及失敗邊界。

References

  1. Nature
  2. Nature News
  3. Duke University School of Medicine
  4. Zenodo
  5. Adaptyv Bio