从常规查体争议看医疗AI的临床价值验证
从NEJM关于健康成人常规查体的辩论出发,厘清死亡率证据、诊断能力与患者信任的边界,讨论医疗AI、三维重建和手术规划如何把技术性能转化为可验证的临床价值。
医工观察 · 阅读框架
从技术性能到患者获益
- 01
技术性能
准确性与可靠性 · 在哪些人群中成立
- 02
决策影响
是否改变合理处理 · 复核与后续工作
- 03
患者获益
结局改善与潜在伤害 · 实际净获益
从诊室里的问题谈起
医疗AI、医学三维重建和手术规划工具,最终都需要回答一个问题:技术带来的新增信息,能否帮助医生作出更合理的决策,并让患者受益?关于健康成人常规查体的讨论,为子殷科技思考这一问题提供了一个循证视角。
一位没有不舒服的人走进诊室,医生是否应该为他做一次完整查体?这个看似平常的问题,牵涉疾病发现、患者信任和有限诊疗时间如何分配,也触及医学的一项基本责任:解释每一次检查为什么值得做。
2026年9月3日,《新英格兰医学杂志》以一位60岁男性为例展开辩论。他自觉健康,已完成适龄癌症筛查和疫苗接种,数年未看基层医生。本次就诊已经测量生命体征,问题是还要不要做常规体格检查。文章属于正反观点讨论,立场由编辑分配,不能当作取消体检的新指南。[1]
本文主张保留预防保健和有目的的查体,同时重新审视无差别、重复性的全套检查。 判断价值时,既要看能否发现异常,也要追问异常如何被解释、怎样改变处理,以及患者最终得到什么。
先分清我们讨论的是哪一种检查
日常语言中的“体检”常把三件事混在一起:医生通过视、触、叩、听进行的体格检查;由化验、影像等组成的综合健康检查;以及包含风险评估、筛查安排、疫苗和健康咨询的预防保健就诊。三者可以重叠,却不能互相替代。
因此,减少一次没有明确目的的全身查体,并不等于取消这次就诊;否定某种综合检查套餐的死亡率获益,也不能否定每一项独立筛查。JAMA面向公众的说明同样指出,健康维护就诊不一定需要完整体格检查,也不一定必须每年进行。[2]
对健康人群,评估的是主动筛查的净获益;对已经出现不适、体征变化或既往异常的人,面对的则是诊断与随访问题。用前一种场景的研究结论解释后一种场景,很容易走向漏诊。讨论“健康人要不要查”,必须先守住这个适用范围。
死亡率没有改善是必须正视的证据
2019年Cochrane综述纳入17项随机试验,其中15项报告结局,共251,891人;全因死亡分析来自11项试验、233,298人。综合健康检查对全因死亡几乎没有影响,风险比为1.00,95%置信区间为0.97~1.03,证据确定性为高。[3]
这项研究比较的是一般成人接受综合健康检查安排与不接受这种安排,检查涉及多个疾病或风险因素、多个器官系统。其对照组并不意味着完全没有医疗服务;结果也不能拆解为每一种具体查体操作的独立效果。[3]
对这项结论,不能用“总能查出一点问题”轻轻带过。一个检查方案若增加了发现和诊断,却没有改善重要结局,就需要重新评估发现之后发生了什么。更多报告、更多复查与更多治疗,本身都不是健康获益的证明。
不过,评价也不应只剩下死亡率。2021年JAMA综述同样未发现一般健康检查与死亡率或心血管事件减少存在关联,但总结了慢性病识别、部分风险因素控制、预防服务使用及患者报告结局方面的改善。该综述同时纳入随机试验和有对照的观察性研究,相关结果应结合研究设计解读。[4]
两类证据放在一起,更合理的方向是识别谁有尚未满足的预防需求,以及哪一部分服务能补足这些需求。它们不支持承诺“每年全套检查就能延寿”,也没有要求切断健康人与基层医疗之间的联系。
两个广为传播的数字需要重新解释
第一组数字是“28%”。它常被转述为只有28%的体检阳性发现有临床价值,其余都是过度诊断。追溯NEJM引用的分析,作者汇总了涉及67种诊断的临床发现,获得250项阳性似然比数据,其中28%达到阳性似然比不低于5的阈值。[5]
阳性似然比描述一个发现对疾病可能性的影响。这里的28%,是达到特定诊断能力阈值的发现所占比例,不是体检异常人群中的真实患病比例,更不是“值得治疗”的患者比例。 分析还排除了多项发现组合及临床决策规则,不能据此评价医生综合问诊和查体的全部价值。[5]
第二组数字是8.20与4.44。退伍军人门诊问卷研究最终分析了414份有效答卷,对医生评价较好的患者,回忆起上次检查项目的数量更多。数字反映的是回忆项目数,而非满意度分数。[6]
这项调查呈现了患者体验与检查之间的关联,但没有证明增加检查必然增加信任。作者指出,原本更满意的患者也可能回忆起更多检查。把相关性写成因果性,就会把一项值得继续研究的观察变成缺乏依据的操作要求。[6]
这两个例子提醒我们:循证传播需要保留数字的分母、研究设计和适用情境。一个数字可以准确,围绕它形成的故事却可能偏离原意。
从发现异常走到患者获益
“没有症状,就没有需要验证的假设”,如果被当作普遍原则,会遗漏筛查的意义。年龄、家族史、暴露史与既往结果,都能构成风险评估的依据。例如,美国USPSTF推荐成人高血压筛查,也推荐适龄无症状人群进行结直肠癌筛查。这说明无症状并不是停止预防评估的理由;具体项目和间隔仍需结合当地指南与个人情况。[7][8]
真正困难的是低风险人群中的阳性结果。下面是一个纯教学假设,不代表任何具体疾病或设备的实际表现:如果10,000人中有1%患病,某检查的敏感度和特异度均为90%,预计会检出90名真正患病者,同时产生990名假阳性者。全部1,080个阳性结果中,真正患病者约占8.3%。
这个例子并不意味着检查没有价值。它说明,相同的检查性能,在不同基础风险的人群中,会产生不同的解释难度和后续工作量。阳性之后是否需要确认、多久复查、什么情况下可以停止追查,都应成为检查方案的一部分。
还应区分假阳性与过度诊断:前者是结果提示异常,后续证实目标疾病并不存在;后者是发现了真实病变,但该病变在患者一生中原本不会造成症状或死亡。两者不同,也不能把所有良性发现、暂不治疗或随访中的病变一概称为过度诊断。
因此,一项检查在被常规化之前,至少需要回答:它适用于谁,结果会改变什么,后续行动能否带来足够的净获益。检测能力只是这条证据链的起点。对于某种明确异常,临床人员仍须结合具体情境作出判断,不能因反对过度检查而机械忽略。
让查体与沟通共同承担临床责任
患者可能把认真查体理解为被重视,把省略检查理解为敷衍。退伍军人研究提示了这种期待,却没有规定应通过增加多少项目来满足它。[6] 本文认为,减少低价值检查时,解释本身应当成为医疗服务的一部分。
医生可以说明这次已经评估了哪些风险,为什么某项检查暂时不需要,哪些变化值得再次就诊。必要的查体也应说明目的和局限:一次正常结果能提供什么信息,又有哪些问题仍不能排除。这样,患者才有机会理解“没有加项目”背后的专业判断。
回到这位60岁男性,较稳妥的思路是先确认有无新的健康变化、既往预防服务是否到位、用药和个人风险是否需要处理,再决定进一步查体的范围。首次或久未就诊与连续多年重复检查,也不应自动使用完全相同的安排。
这种选择并非主张所有医生都采用同一份精简清单。它要求把有限时间分配给当次就诊最需要解决的问题,同时让患者知道下一步。对于已经出现症状或检查异常的人,应转入相应的诊断、复核或随访流程,而非继续套用“健康人常规体检”的讨论。
子殷的研发视角 让医疗AI接受临床价值验证
对围绕医疗AI、医学3D打印与医工转化开展工作的子殷科技而言,这场争论带来的研发启示是:技术价值的验证应延伸到发现之后。以下为本文提出的产品与研究评价思路,不代表相关产品已经获得相应临床结局证据。
如果系统识别出更多结节、更多影像细节或更多潜在风险,首先需要确认新增发现是否可靠,然后评估它们是否改变了合理决策,以及改变之后是否让患者受益。只报告发现数量或模型准确率,无法完整回答这些问题。
以影像辅助系统为例,除漏检与误报外,可在真实使用流程中记录每百例新增复查或转诊数量、医生复核耗时、建议的采纳情况,以及未采纳的原因。根据用途进一步选择患者结局,并同时追踪不必要干预。效率改善、诊断性能改善和健康结局改善,应分别报告。
这也适用于三维重建和手术规划。表面更贴合、空间误差更小,能够证明技术性能;若要证明临床价值,还需要围绕具体用途考察方案判断、操作时间、功能或并发症等结局。选哪些指标,取决于产品要解决的临床问题,而不能由最容易获得的漂亮数字决定。
我们认为,一款成熟的医疗AI应帮助医生解释不确定性,并支持合理的后续处理。对于暂不需要扩大检查的情形,它也应允许保留观察和停止追查的选项。这样的能力,需要和检测能力一起进入研发与验证。
把每一次检查的理由讲清楚
医学中的长期习惯值得尊重,也需要定期接受检验。患者信任是医疗质量的一部分,却不能单独证明某项筛查有效;没有死亡率获益是重要证据,也不能替代对其他结局、具体人群和服务内容的分析。
对医生而言,更有价值的改变,是为每项检查明确目的,为每个异常安排适度的后续行动;对患者而言,是知道自己为什么接受检查,结果意味着什么,以及何时需要再次寻求帮助;对研发者而言,是把评价延伸到患者实际经历的完整流程。
当一位健康人离开诊室,值得追求的结果是:该处理的风险得到了处理,该完成的预防服务有了安排,不必要的担忧没有被放大,而他清楚下一步应该做什么。是否完成了一套固定动作,应当服从这一目标。
阅读与应用范围
本文为基于公开文献的医学评论,采用叙述性文献梳理,不属于系统综述或临床实践指南。所引美国筛查建议用于说明无症状筛查的证据逻辑,不直接构成中国人群的体检清单。医疗AI部分为研发评价建议,不构成任何产品临床效果的承诺。
交流与讨论
欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。
公开讨论
正在加载讨论…