← 返回首頁

用「合成腫瘤」教AI辨識癌症突變:ClairS補上長讀長定序缺口

香港大學團隊以正常樣本組合出多種腫瘤情境,讓深度學習模型在真實癌症資料稀缺時仍能受訓;細胞株測試表現亮眼,但尚不能直接轉化為臨床診斷。

By SURL BioNews

癌症基因體分析的一道難題,是從大量定序雜訊中找出只存在於腫瘤、未見於正常細胞的體細胞突變。長讀長定序能跨越重複或難以定位的基因組區域,卻也帶來不同於短讀長資料的錯誤型態;香港大學團隊開發的深度學習工具 ClairS,試圖補上這項分析缺口。

ClairS針對成對的腫瘤與正常樣本,辨識單核苷酸變異(SNV)及較短的插入、缺失(indel)。它不只檢查某個鹼基是否異常,也利用長讀長提供的單倍型資訊,判斷候選突變能否合理歸屬於父系或母系染色體,藉此排除較可能源自定序錯誤的訊號。

真正棘手的是訓練資料。可供模型學習、又具有高可信度標記的癌症樣本遠少於生殖系變異資料。羅瑞邦教授領導的團隊因此混合兩名正常個體的真實定序讀段,把其中一人獨有的生殖系變異重新設定為模擬的腫瘤突變,並調整讀段比例,建立不同腫瘤純度、定序深度、變異等位基因頻率及正常細胞污染程度的訓練情境。

《Nature Methods》研究顯示,在六組腫瘤50倍、配對正常樣本25倍覆蓋度的Oxford Nanopore資料中,僅以合成資料訓練的模型,SNV F1分數介於87.98%至98.58%;F1是綜合精確率與召回率的指標。不過,各細胞株使用的真值集品質並不一致,部分基準答案也曾納入多種演算法的判讀,不能把這些數字直接視為臨床檢體上的正確率。

在具有較嚴格參考標準的三陰性乳癌細胞株HCC1395及其配對正常細胞HCC1395BL中,合成資料模型的SNV與indel F1分數分別為89.83%及73.38%。先以合成樣本預訓練、再加入真實癌症細胞株資料後,兩項數值提高至96.19%與79.67%,顯示合成資料能擴大訓練範圍,卻仍需要真實腫瘤特徵校準;插入與缺失的辨識尤其仍有落差。

這項工具已依BSD 3-Clause授權開放原始碼,Oxford Nanopore的配對腫瘤—正常體細胞變異流程也採用了拆解版本的ClairS。該流程目前只在特定R9與R10鹼基判讀模型下運作,短indel分析更限於R10模型,反映效能仍受到定序化學版本與分析設定影響。

距離臨床使用還有明確界線:現有驗證主要來自癌症細胞株,而非前瞻性病人檢體,也尚未證明結果能改善診斷或治療決策。研究程式庫與Oxford Nanopore文件均註明產品不供臨床診斷使用;論文並揭露羅瑞邦接受該公司研究經費。下一步須在更多癌別、腫瘤純度與真實臨床流程中獨立驗證,並釐清版本更新、品質控管與法規責任。

References

  1. Medical Xpress
  2. Nature Methods
  3. The University of Hong Kong
  4. Oxford Nanopore Technologies
  5. HKU-BAL GitHub