人工智能诊断乳腺癌乳腺全周期系统综述与荟萃分析

荟萃分析:十年 AI 乳腺钼靶筛查证据支持其作为「第二阅片人」 而非替代放射科医生 荟萃分析:十年 AI 乳腺钼靶筛查证据支持其作为「第二阅片人」 而非替代放射科医生

2026年9月20日 September 20, 2026 · 从 36 条资讯中筛选 · Filtered from 36 sources

深度学习进入乳腺钼靶筛查领域已满十年,从概念验证走到了随机试验。一项覆盖 2015 至 2025 年文献的系统综述与荟萃分析,对这段时间的诊断准确性与落地效果做了合并评估。[1]

方法

研究者在 PubMed 与 Europe PMC 中检索,并补充 ClinicalTrials.gov 及引文追踪。纳入标准是:在筛查人群中评估深度学习系统用于癌症检出或分流,并以组织病理学为参照标准。分析做了四组合并:独立判读的准确度、双变量灵敏度与特异度模型、人工智能整合读片相对标准读片的癌症检出率比,以及召回率比。偏倚风险用 QUADAS-2 与 QUADAS-C 评估,证据确定性用 GRADE 分级。[1]

准确度很高,但离散度也很大

在 14 项研究、共 121 万余次检查中,合并的独立判读曲线下面积为 0.890(95% 置信区间 0.858 至 0.915)。但 I² 高达 97.4%,95% 预测区间宽达 0.731 至 0.960。元回归显示,发表年份(p=0.79)与抽样方式(p=0.94)都无法解释这种离散。[1]

在真实筛查流程中的效果

双变量模型(9 项研究)给出汇总灵敏度 73.3%、特异度 92.4%。在随机与配对前瞻性试验中(3 项),合并的检出率比为 1.13(0.83 至 1.55)——置信区间跨过 1,未达显著。其中 MASAI 随机试验单独报告 1.29(1.09 至 1.51),并使阅片工作量减少 44%。而不含随机设计的实施类研究(5 项,含一项覆盖 46.3 万名女性的德国项目评估)合并为 1.22(1.08 至 1.37),且离散很小(I²=19.0%)。召回率整体变化不大(0.95,0.81 至 1.12)。[1]

作者最关键的提醒

非随机研究的增益更大、更精确,这恰恰是混淆因素会产生的模式——因此随机证据才是锚点。作者据此给出结论:十年证据支持把人工智能作为有组织筛查中的「第二阅片人」与分流工具,而不是放射科医生的自主替代。合并准确度在平均意义上很高,但离散程度大到无法直接迁移到新的筛查项目,部署前的本地验证仍是必需的。此外,准确度结局的证据确定性被评为极低,唯一随机试验的证据确定性为中等。[1]

还缺什么

要判断人工智能对筛查体系是否真正有益,关键指标不是准确度,而是间隔期癌症与死亡率,这些终点数据仍在等待中。在此之前,把 AI 定位为增效与减负工具、而非替代方案,是当前证据能支持的最稳健表述。[1]

来源

Sources

[1] PubMed