← 返回首頁

AI為甲狀腺超音波判讀加上一把尺:醫師準確率在探索研究中升至84.5%

依循C-TIRADS特徵逐項評分的模型,在303個結節影像上改善兩名醫師的良惡性判讀;但病例偏向惡性、讀片流程未充分盲化,距離臨床常規使用仍有關鍵驗證缺口。

By SURL BioNews

甲狀腺結節的超音波影像往往沒有截然分明的良惡性界線,細微的邊緣、回音與鈣化差異,卻可能影響病人接受追蹤、穿刺或進一步治療的路徑。一項發表於《Frontiers in Medicine》的研究顯示,把人工智慧放進這個判讀流程,或能協助醫師更一致地辨認高風險結節。

研究團隊以中國甲狀腺影像報告與資料系統C-TIRADS為骨架,建立先定位結節、再辨識超音波特徵的模型。系統不是直接吐出一個難以追溯的癌症答案,而是分析結節的組成、回音、形狀、邊緣及高回音灶,再依指引規則加總分數,形成良惡性風險類別。

模型開發使用三家醫院的資料:結節定位模組納入1,921張影像,特徵分類模組則使用6,469筆標註樣本。臨床驗證集與訓練病人在個案層級分開,共包含284名成人的303個結節;其中94個為良性、209個為惡性,判定依據是手術病理或符合特定Bethesda分類的細針穿刺細胞學結果。

在這批影像上,AI單獨判讀的整體準確率為86.2%。兩名接受過C-TIRADS訓練的超音波醫師在沒有AI時,準確率為70.5%;取得模型的特徵預測與風險分類後,準確率升至84.5%。惡性結節的召回率也從68.9%提高至81.9%,顯示改善並不只來自辨認良性病例。

不過,這14個百分點的差距不能直接視為已證實的臨床效益。兩名醫師先自行讀片,之後再看同一批影像並取得AI結果,而且事前已知模型表現,可能受到記憶與期待影響;研究也沒有充分盲化、隨機分派或預設洗脫期,最後僅以兩人共識形成判讀結果。

驗證集另有明顯的類別失衡:惡性結節約占69%,遠高於一般結節篩檢情境。研究只保留二元分類及彙總指標,未進行正式假設檢定,也無法評估ROC曲線、風險校準或臨床決策淨效益。因此,現有結果尚不能回答這套工具是否能減少不必要穿刺、避免漏診,或在不同醫院與設備上維持表現。

下一步需要較大型、多中心且前瞻性的多讀者研究,以盲化或平行讀片設計比較有無AI輔助,並納入更貼近日常門診的疾病比例。這項工作目前較適合被理解為一個具體的臨床決策支援訊號:AI可能幫醫師把C-TIRADS用得更一致,但它仍是風險分層工具,不能取代病理診斷。

References

  1. Frontiers in Medicine