人工智能在检测、分类与报告生成中的应用:降低超声操作者间变异性
近期研究表明,用于超声检测、分类和测量的人工智能算法可以达到甚至超过放射科医生的平均准确率,并持续降低观察者间的变异性。
超声本质上是最依赖操作者的影像检查方式。与CT或MRI不同——那些检查通过自动化协议获取标准化容积数据,与操作者无关——超声要求持探头的人选择扫查切面、调整增益和深度、实时识别解剖结构,并决定捕获和测量哪一帧图像。这种对手动技巧和即时视觉判断的依赖,是文献中记录的操作者间与观察者间变异性的主要来源,影响范围从射血分数估测到甲状腺和乳腺结节分类。
正是这一特点使人工智能对超声尤为重要,甚至比对其他影像方式更为重要。算法不会在轮班结束时感到疲劳,其注意力不会随经验积累而波动,并且对第一例和第一千例检查采用完全相同的标准。近年来,越来越多发表于《放射学》(Radiology)、《欧洲心脏杂志-心血管影像》、《妇产超声》及《Gland Surgery》等期刊的研究,已经用具体的准确率、曲线下面积(AUC)和观察者间一致性(kappa或ICC)数据,量化了人工智能在多大程度上兑现了这一承诺。
甲状腺结节的检测与分类
《Gland Surgery》发表的一项系统综述与荟萃分析汇总了69项关于超声甲状腺结节恶性检测人工智能系统的研究,发现合并敏感度为89%(95% CI:87-91%)、特异度为84%(95% CI:80-88%)、AUC为0.93(95% CI:0.91-0.95)。在9项研究的直接配对分析中,人工智能与经验丰富的放射科医生相比,AUC为0.922对0.842(差异具有统计学意义,p<0.0001),敏感度相近(85.2%对85.8%),但特异度明显更高(83.6%对71.4%)——也就是说,人工智能更少将良性结节误判为可疑,从而减少不必要的活检。
《Radiology》发表的一项关于基于ACR TI-RADS分类的人工智能模型(MTI-RADS)的研究报告称,恶性诊断的AUC为0.91(95% CI:0.87-0.95),敏感度83%,特异度87%。与初级放射科医生相比,该模型在AUC(0.78,p<0.001)、敏感度和特异度方面均显著更优;与经验丰富的放射科医生相比,AUC和敏感度相当,但人工智能的特异度仍更高(87%对80%,p=0.02)。这体现了文献中反复出现的一个规律:人工智能倾向于拉高经验较少检查者的表现水平,如同一双第二只眼睛,缩小新手与专家之间的差距。
乳腺结节与BI-RADS分类辅助
在乳腺超声领域,商用决策辅助系统已积累了扎实的数据。S-Detect(三星)在一项纳入11项研究的荟萃分析中显示敏感度为0.82(95% CI:0.74-0.88)、特异度0.83(95% CI:0.78-0.88)、AUC为0.90。Koios DS系统单独使用时平均AUC为0.88;有趣的是,当放射科医生借助Koios辅助(超声+DS)时,阅片者平均AUC为0.87,而未借助辅助的常规超声为0.83——这是人类检查者准确率的一个虽温和但持续的提升。
然而,最显著的收益通常体现在观察者间一致性上,而非单纯的准确率。使用Koios DS后,观察者间一致性(Kendall's tau-b)从0.54提升至0.68,观察者内变异性从13.6%的不一致病例降至10.8%。在BU-CAD系统中,借助人工智能辅助,阅片者AUC从0.758提升至0.829,阅片时间减少约40%(从每例30.15秒降至18.11秒)。对于BI-RADS 4类病变——这是变异性最大、良性活检结果最多的类别——实时人工智能系统正被专门研究用于在不降低癌症敏感度的前提下降低不必要活检的比例。
自动化测量与定量变异性的降低
人工智能降低定量变异性的最成熟范例或许来自超声心动图。《European Heart Journal – Cardiovascular Imaging》发表的一项研究验证了一种自动测量心室容积和射血分数的人工智能方法,并将其与内部及外部数据库中的手动测量结果进行比较。射血分数的平均差异介于-5.5至0.3个百分点之间,95%-100%的检查分析成功。然而最重要的发现是方法学层面的:所有方差比的95%置信区间均低于1.0,表明人工智能的变异性低于两位人类心脏科医生之间的观察者间变异性——该方法在同一操作者的重复测试(test-retest)中也不逊色。
在产科领域,《BMC Pregnancy and Childbirth》发表的一项研究评估了一款孕中期自动胎儿生物测量软件(CUPID)。该人工智能的观察者内重复性几近完美(ICC = 1.0),而资深放射科医生为0.974-0.999,初级放射科医生为0.749-0.934。人工智能的平均绝对误差在各项生物测量指标中为0.36至2.53毫米,而初级放射科医生的误差为0.64至8.13毫米——这一显著差异恰恰出现在经验较少的检查者群体中,而这正是观察者间变异性最影响孕龄和胎儿体重估测准确性的地方。人工智能处理每项测量仅需0.05-0.07秒,而人工测量需要4.79-13.44秒。
颈动脉内中膜厚度(IMT)也有类似发现,这是亚临床心血管风险的经典指标,其绝对值在健康人和患病人群之间变化很小,因此对手动测量技术的微小差异极为敏感。自2000年代起研究、近年来通过神经网络(包括注意力/Transformer架构)不断改进的半自动及全自动主动轮廓边缘检测系统,正是致力于消除在内膜-管腔界面和中膜-外膜界面手动放置游标时的主观性,而这被认为是此类测量中操作者间变异性的主要来源。
实时图像质量引导
除了解读已获取的图像外,新一代工具还能在图像采集过程中实时运作,在图像被保存和测量之前就提示扫查切面、取景或增益是否适当。一项关于经阴道图像质量客观评分系统观察者内及观察者间一致性的研究——该系统正是为训练人工智能算法而设计——说明了这一步骤的重要性:如果输入图像的质量本身就因操作者而异,那么基于其构建的任何自动分类或测量都会继承部分这种变异性。完全自动化采集(即系统自身引导或执行扫查)将在本系列的另一篇文章中深入讨论;此处需要强调的是,确保输入图像质量如今已被公认为人工智能在检测和分类方面的准确率提升能够在临床实践中真正落地的前提条件。
人工智能辅助报告生成
一个快速发展的领域是将检测/分类人工智能的结构化发现与语言模型相结合,自动生成报告文本。近期文献中描述的系统——包括将放射科医生标注与深度学习分析相结合以合成结构化多模态乳腺超声报告的方法,以及利用大语言模型(LLM)将检查者在检查过程中口述的描述转化为结构化报告的工具——旨在减少打字时间、统一术语(例如确保所用描述符确实与所赋予的BI-RADS或TI-RADS分类相符),并减少转录错误。这些系统目前大多仍是半自动化的:人工智能根据影像学发现提出结构化草稿,但文本和临床处理意见的最终核准仍由负责的医生完成。
关于观察者间一致性的直接证据
有必要将本文中引用的一致性数据并列汇总,因为这一指标直接回答了关于变异性的临床问题。对于甲状腺结节,使用Koios DS系统的观察者间一致性从0.622提升至0.876(一致性系数量表),AI-SONIC系统达到Kendall系数0.995,超过人类检查者之间0.72至0.85的典型一致性水平。对于乳腺结节,使用Koios DS后一致性从0.54提升至0.68(Kendall's tau-b)。对于射血分数,人工智能的所有方差置信区间均低于人类观察者间变异性。综合来看,这些在不同人群、不同设备、不同软件厂商条件下获得的数据都指向同一个结论:人工智能能够以可测量、可重复的方式,降低当前取决于检查执行者或判读者身份的结果差异。
客观的局限性:偏倚、可推广性与监管
这些结果不应被解读为可以取代医生的判断。第一个局限是训练数据偏倚:大多数商用算法主要基于少数中心的人群和设备开发与验证,常见于东亚(甲状腺方面)或北美与欧洲(乳腺和心脏方面),当应用于疾病患病率、体型或设备特征与训练数据不同的人群时,其表现可能下降——这是关于人工智能影像设备监管文献中广泛讨论的可推广性问题。第二个局限是对设备和参数配置的依赖:在某一探头厂商图像上训练的模型,在其他品牌设备或不同增益/频率设置下可能出现准确率下降。
从监管角度看,批准状态因国家、预期用途和软件版本而异。在美国,近年来数十种含有人工智能/机器学习组件的影像算法已获FDA授权,其中大多数通过基于既往同类产品的510(k)途径获批——据《Radiology》及监管政策类期刊发表的综述指出,这引发了关于验证数据透明度、以及获批后软件更新是否持续获得充分监管等问题。在巴西,软件作为医疗器械(SaMD)的监管由ANVISA负责;在临床实践中采用任何人工智能工具之前,医生应核实该工具在其执业所在国是否已就预期适应症获得现行注册,而不仅仅是在其他市场获得批准。
最后,文献中逐渐形成的共识——并得到了讨论超声人工智能问责与治理的立场性文章的支持——是这些工具应作为决策辅助使用,而非替代医学评估。即便是准确率结果最好的研究,也建议在人工智能与检查者判断不一致的病例、超出算法范围的偶然发现,以及临床处理决定(活检、随访、转诊)方面,继续由医生承担责任并签字确认。人工智能能够降低变异性、提高一致性,但诊断和处理的最终责任仍在医生。
参考文献
- An Artificial Intelligence Model Based on ACR TI-RADS Characteristics for US Diagnosis of Thyroid Nodules — Radiology, 2022
- Artificial intelligence-based systems as auxiliary tools for thyroid nodule malignancy detection on ultrasound: a systematic review and meta-analysis of diagnostic accuracy — Gland Surgery, 2024
- Artificial intelligence in breast ultrasound: application in clinical practice — World Journal of Clinical Cases / PMC, 2023
- Automatic measurements of left ventricular volumes and ejection fraction by artificial intelligence: clinical validation in real time and large databases — European Heart Journal - Cardiovascular Imaging, 2024
- Artificial intelligence assistance for fetal development: evaluation of an automated software for biometry measurements in the mid-trimester — BMC Pregnancy and Childbirth, 2024
- Intra- and interobserver agreement of proposed objective transvaginal ultrasound image-quality scoring system for use in artificial intelligence algorithm development — Ultrasound in Obstetrics & Gynecology, 2025
本内容仅供健康教育与知识更新之用,不能替代个体化的医学评估。