生物科技 · asia
只量一層分子,也能補出組織全貌?NicheTrans用空間資訊推估缺失資料
跨模態AI模型從較容易取得的單一體學資料推估蛋白質等分子訊號,並保留細胞在組織中的鄰里關係;它已在癌症與腦部資料集展現研究價值,但計算重建仍不能取代實際測量。
空間多體學不只要知道細胞表現了哪些基因,還要看清它們身在何處、與哪些細胞為鄰。然而,同一片組織若要同步測量RNA、蛋白質、代謝物或染色質狀態,往往需要昂貴設備與複雜實驗。蒙納許大學與復旦大學團隊開發的NicheTrans,試圖從較容易取得的一種分子資料,推估另一種尚未測量的訊號,同時保留組織的空間結構。
這套發表於《Nature Methods》的模型採用Transformer架構。它學習不同體學層次之間的對應關係時,不把每個細胞視為彼此孤立的資料點,而會納入周遭細胞與微環境資訊;例如,可由空間基因表現推估蛋白質標記,再用推估結果分析細胞群在組織中的排列方式。
研究團隊在多種既有資料集上驗證模型,涵蓋乳癌、淋巴結、腦部疾病及不同空間多體學平台。論文指出,NicheTrans辨認出單一體學分析未能區分的空間分區,模型歸因分析也連結到多巴胺代謝相關基因程式,以及與類澱粉蛋白β相關的細胞狀態。這些結果顯示,加入「誰與誰相鄰」的資訊,可能補足只看分子濃度時遺失的生物脈絡。
在阿茲海默症腦組織資料中,團隊進一步把模型推估的蛋白質標記當作空間地標,量化不同神經膠細胞亞型的分布。這類分析未來可用於尋找與病程、治療反應或復發相關的細胞鄰里;在腫瘤研究中,研究人員也希望藉此辨識與治療抗性或復發相連的微環境特徵。不過,目前成果屬於研究資料分析,尚未證明模型能用於臨床診斷或替患者選擇治療。
NicheTrans的實作、訓練與視覺化流程已公開,並提供帕金森氏症、阿茲海默症、乳癌、淋巴結及MISAR-seq等案例的操作文件。開放程式碼有利於其他團隊重現與比較,也可能讓缺乏高階多體學設備的實驗室先從既有單體學資料提出假說,再決定哪些分子訊號值得投入實驗驗證。
但「補出」的資料終究是模型預測,不是對樣本的直接測量。其可靠度會受訓練資料、實驗平台、組織品質及疾病族群差異影響;若遇到訓練資料中罕見的細胞狀態,也可能產生看似合理卻不準確的結果。要走向患者分層或生物標記開發,仍須在獨立、前瞻性臨床樣本中與實測多體學結果逐項比對,並建立不確定性評估與跨平台驗證標準。