跳至主要内容
子殷科技
搜索
学术观点2026年9月26日 · 教材导读与研究述评

从深度学习原理到医工交付 子殷医疗AI研发的方法与验证

阅读Simon J. D. Prince的《Understanding Deep Learning》,对子殷最有价值的追问是:怎样让模型的优化目标对应真实任务,让人工修订成为可分析的证据,并用独立评价确认每一次改进。本文结合医学影像研究,讨论双下肢测量、跟骨复位和肺部三维重建的研发方法。

子殷医疗AI研发方法示意:明确任务后形成AI初稿,经人工修订与审核后交付;获准回流的修订资料经过独立验证再进入新版本。图为方法建议,不表示各项目已完成全部环节。
子殷医疗AI研发方法示意:明确任务后形成AI初稿,经人工修订与审核后交付;获准回流的修订资料经过独立验证再进入新版本。图为方法建议,不表示各项目已完成全部环节。

摘要

医学影像AI的技术指标与医工交付质量之间,存在需要用任务定义、工作流评价和独立验证连接的距离。本文以《Understanding Deep Learning》为理论线索,结合评价指标、泛化及人机协作的公开研究,提出面向子殷专科研发的方法框架:先明确输出将如何使用,再选择训练目标与评价指标;保存AI初稿、人工修订和最终审核之间的对应关系;通过独立数据与预先约定的研究设计判断改进是否成立。

围绕双下肢测量、跟骨复位和肺部三维重建,本文进一步提出专科评价维度与修订记录设计。核心观点是,研发应以完整任务的质量为目标,同时观察算法误差、人工负担和审核后的残余错误。本文属于叙述性研究述评与方法建议,不是系统综述或原始临床研究。

关键词:深度学习;医学三维重建;医工协同;泛化;人工修订;医疗AI评价

一 从教材建立可检验的研发问题

Simon J. D. Prince所著《Understanding Deep Learning》于2023年由MIT Press出版,覆盖神经网络、损失函数、模型拟合、性能评价、卷积网络、Transformer及生成模型等主题,并配有Python练习。第21章由Travis LaCroix与Prince共同讨论深度学习的伦理问题。[1][7]“MIT Press出版”是出版信息,不意味着书中方法或本文方案获得MIT的临床认可。

对子殷而言,可以把教材的概念组织成连续的研发追问:模型在学习什么目标,现有数据能否支持这个目标,评价是否覆盖真实使用条件,出现错误时谁能发现和修正。这样阅读,理论会落到数据、代码、界面和研究记录上。

以骨结构分割为例,输出的标签体积可能继续用于三维模型生成、解剖取点和角度计算。训练阶段优化的对象与最终用户关心的对象并不完全相同。研发团队需要把二者之间的关系写明,并通过实验检验,而不能仅凭三维外观推定任务已经完成。

深度学习与医学三维重建:从教材中的数学原理,走向可检验的重建任务。AI概念示意图,非真实病例或临床验证结果。
深度学习与医学三维重建:从教材中的数学原理,走向可检验的重建任务。AI概念示意图,非真实病例或临床验证结果。

二 将真实任务转化为训练目标与评价指标

损失函数决定训练过程依据什么信号更新参数,评价指标则决定研发团队怎样比较结果。两者可以不同,但都应与预期任务建立明确联系。图像分析评价研究指出,指标的选择和使用存在多种陷阱;忽略任务关注点、数据特性和指标局限,可能导致误导性结论。[2]

对子殷的双下肢研发,一个可检验的任务定义是:在指定影像类型、取点规则和测量平面下,输出能够复核的结构与角度。由此,评价可以分别覆盖结构分割、关键点定位、角度误差和最终报告一致性。对于较大骨结构,整体重合度较高仍可能伴随局部关键边界偏差;这属于需要额外检查的误差模式。

跟骨复位的任务定义还需覆盖骨块身份与空间关系。仅比较整体外形,可能不足以评价某一关键骨块的位置。本文建议把关节面局部关系、骨块间异常重叠和预先定义的几何约束分别记录,再由具备相应资质的临床人员判断方案是否可接受。这些维度是研究建议,具体参考标准与阈值应在研究开始前确定。

研发目标中可以纳入边界或几何信息,但不能任意增加一组权重后宣称实现了临床目标。每个新增项都需要解释对应哪类错误,并与已有方法作对照;主要终点和成功标准应在查看最终测试结果前固定。

三 用数据划分与分层评价检验泛化

同样的测试得分可能对应不同的模型行为。D’Amour等讨论的“欠充分规定”问题表明,一套训练与验证流程可能产生多个测试表现相近、部署表现却不同的预测器。[3]这提示我们,单一测试分数未必足以限定模型在目标环境中的行为。

另一类问题是总体结果掩盖重要亚组的失败。Oakden-Rayner等以医学影像为背景研究“隐藏分层”,说明标签或总体指标没有充分描述的数据差异,可能对应有意义的性能差距。[4]

在子殷的研究方案中,数据划分宜以患者为单位,保持同一患者的重复检查、左右侧衍生数据及相关模型处于同一分组。已经用于选模型、调参数或制定规则的病例,应按其实际用途记入开发或验证数据,不能继续被称为完全独立的最终测试集。

评价还可以按医院来源、扫描条件、伪影程度、病变类型和结构复杂程度分层。样本量不足的亚组应单列病例数与不确定性,避免把偶然结果推广到所有患者。新增医院的数据可用于独立外部验证,但一旦依据这些数据调优,就需要重新说明它们的角色。

同一版本重复运行是否一致,也应与预测是否正确分开记录。重复性检查用于确定运行条件下的稳定程度;对照参考标准的评价用于确定任务误差。两类证据互相补充,不能相互替代。

四 将人工修订记录转化为研究证据

子殷已公开的CalcAI项目报道,描述了骨块三维观察、复位候选方案比较与局部复核的科研方向,并明确项目仍处于研发与验证阶段。[8]这一工作场景为研究人工修订提供了具体对象。

本文建议,每个纳入研究的病例保存相互关联的AI初稿、修订后结果和审核记录。修订应尽量指向具体对象,例如某个标签边界、骨块变换、测量点或解剖命名,并注明使用的软件与模型版本。这样才能回答错误发生在哪里,以及修改影响了哪些下游结果。

修订次数本身不是质量指标。一次批量操作与多次细小拖动可能完成相同工作;不同工程师的操作习惯也会改变次数。应结合实际操作时间、修改范围、审核分歧和最终残余错误解释记录,并区分自动计算、人工操作与等待时间。

人工修订也不是天然正确的训练标签。对于存在争议的结构或方案,需要按既定标注规则复核,必要时保留分歧和不确定标签。用于训练回流的数据必须符合原有授权范围;修订进入训练集之前,应先完成质量筛选和数据角色确认。

可用于新一轮训练的资料应进入候选版本,经过独立评价后再决定是否替换现有版本。把修订记录保存下来,只是建立了研究条件;只有验证显示预先关注的问题得到改善,才能称为有效改进。

五 为不同专科设置不同的评价对象

专科工作可以共享影像读取、三维显示和版本管理能力,但应保留各自的任务定义。双下肢测量关注结构与几何规则的对应,跟骨复位关注多骨块关系,肺部重建则需同时关注结构识别、分支连通与解剖命名。

下表是本文提出的评价框架,供后续项目设计使用。它不代表各模块已完成表内全部功能,也不构成既定验收阈值。

表1 子殷专科研发的拟议评价维度
研发方向任务相关评价人工环节与交付检查
双下肢测量逐结构分割质量、关键点定位误差、规定平面下的角度误差取点修订耗时、规则一致性、修改后报告是否同步
跟骨复位关键骨块识别、局部空间关系、异常重叠及约束违背方案修订耗时、医生评价一致性、审核后残余错误
肺部三维重建目标结构覆盖、分支连通、动静脉对应及解剖命名疑点定位耗时、CT与三维对应、修订与最终标签一致性

六 让模型选型服从可复现的比较

教材介绍多种网络架构,有助于理解模型能表达什么以及计算怎样组织。但在工程选型中,架构名称无法单独说明效果。nnU-Net的研究强调把预处理、网络配置、训练和后处理作为相互关联的整体来适配分割任务。[5]

对子殷而言,比较候选模型时应尽量固定数据划分、参考标准、评估规则和计算条件,同时报告训练及推理成本。若一个方案使用了更多标注、更大预训练数据或不同后处理,应把差异列明。只有比较条件清楚,结果才能指导后续投入。

可以先建立可复现的基线,再针对明确失败类型逐项改进。改变输入处理、训练目标、网络结构或后处理时,应尽量拆开比较,以确认收益来自哪个环节。样本较少时,适度重复实验有助于观察训练随机性,但重复次数应服务于实际不确定性。

扩散模型等生成方法可以作为未来研究方向;其输出若用于解剖补全或形态推断,需要标明推断区域,并单独评价与患者原始影像的对应关系。视觉上合理的结果不能自行成为该患者真实解剖的证据。

七 将伦理问题落实到数据与人机协作

《Understanding Deep Learning》第21章讨论算法偏差、可解释性、隐私以及技术使用带来的社会影响。[7]放到医疗AI研发中,这些问题需要对应到可检查的行为:数据是否按授权使用,模型适用边界是否被准确表达,用户是否能够发现错误并作出独立判断。

人参与审核并不自动保证系统可靠。界面如果使用户过度依赖默认输出,或让关键错误难以定位,仍可能降低检查质量。DECIDE-AI强调早期临床评价中的实际工作条件和人因问题,可为将来符合条件的现场研究提供报告参考。[6]

本文建议把“审核后仍未发现的关键错误”与修订耗时一并纳入评价,并观察不同经验使用者的表现。这里所说的关键错误,需要由具体专科预先定义,不能在结果出来后任意改变口径。

在医院本地部署的情形下,可将原始影像处理和审核安排在院内环境。后续协作研究所需的输出范围、脱敏方式和流转规则,应由既定授权决定。具备本地部署能力,并不自动意味着具备跨机构使用数据的授权。

医生与工程师共同复核三维重建结果,围绕疑点定位、修订记录与交付质量开展讨论。AI概念示意图,非子殷真实工作现场。
医生与工程师共同复核三维重建结果,围绕疑点定位、修订记录与交付质量开展讨论。AI概念示意图,非子殷真实工作现场。

八 面向子殷的可检验研究方案

可以先选择一个用途清楚、输入相对一致的专科任务,比较现有人工流程与AI辅助流程。研究开始前固定主要终点、数据纳排标准、参考标准、严重错误定义及软件版本,并保留不成功或无法完成的病例。

若目标是研究效率,可把达到既定质量要求所需的人工操作时间设为主要终点,同时设置关键错误和最终质量的约束;若目标是研究测量准确性,则应以相应误差或一致性为主要终点。终点的选择取决于研究问题,不能把速度和质量随意合并成一个缺乏解释的总分。

同一使用者处理同一病例时,需要考虑记忆与顺序影响,可按任务条件采用随机顺序、适当间隔或不同使用者分组。评价最终结果时,若可行,应使评价者不知道结果来自哪种流程。统计分析宜以患者为基本单位,考虑同一患者多结构及多位使用者形成的相关性。

报告应同时呈现样本来源、失败病例、效应大小与不确定性,而非只给平均分或显著性判断。样本量依据主要终点和可接受误差规划;小规模试验可用于估计参数和改进流程,但不宜直接推出广泛临床效果。

在上述设计中,修订记录可以进一步用于失败分类研究:哪些错误反复出现,哪些最耗人工,哪些不容易被发现。由此形成的数据和假设,可指导下一轮开发;用于最终评价的数据则保持独立。

九 研究边界与后续价值

本文围绕一本基础教材与若干相关研究组织方法讨论,未采用系统综述的完整检索与筛选流程;子殷项目背景主要来自企业公开材料。因此,所提出的框架需要通过具体任务的实验验证,其有效性不能由本文的论述本身证明。

后续研究可分别检验三个问题:增加与任务相关的评价维度,是否更容易发现整体分数遗漏的错误;结构化修订记录,是否能帮助定位主要返工来源;经筛选的修订资料用于训练后,能否在独立数据上降低相应错误而不损害其他结构。

这也是基础教材对子殷的长期价值:让团队用共同的概念提出问题,用清楚的实验区分原因,再把有效改进落实到可追溯的医工交付。模型能力、工程流程与专业判断,在这一过程中共同接受检验。

交流与讨论

欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。

发表一条评论

请勿提交患者姓名、病历、电话等个人信息。
项目需求请前往联系合作。

0/2000

提交即申请审核并公开昵称和评论内容,信息处理详见隐私说明。

公开讨论

正在加载讨论…