面向医学3D打印的人工智能辅助影像分割与三维重建质量控制研究
数字医学3D打印研究系列 · 第02篇 · V1.1
作者:王文波、杨秀雯、李映锡、陈善玮
内蒙古子殷科技有限公司
摘要
医学3D打印将医学影像中的解剖信息转化为具有物理尺寸的模型,人工智能辅助分割可以参与这一过程,但算法输出仍需经过解剖确认、几何检查和用途审核。本文围绕内蒙古子殷科技有限公司数字医学3D打印创新研究中心项目中的影像自动化处理与专科三维重构方向,采用项目文件分析、目的性文献参考和技术方法框架构建相结合的方法,研究从影像输入到打印前数字模型交付的质量控制。本文提出覆盖数据接收、自动分割、人工修订、表面建模及交付审核的分阶段框架,区分原始算法表现、人工修订后质量与制造前几何一致性,并建立整体重叠、表面距离、关键结构、几何完整性和流程效率相结合的评价方法。研究认为,医学3D打印模型的可用性取决于特定用途下的解剖信息保真及其证据完整性,不能由单一分割指标或视觉效果替代。该框架可为企业组织研发测试、医工复核和模型交付提供方法参考,实际适用性仍需通过独立测试与连续业务记录验证。
关键词:医学3D打印;人工智能;医学影像分割;三维重建;质量控制;几何一致性
1 研究背景与问题
医学影像分割需要识别目标组织及其边界,三维建模则进一步把这些区域转化为可以观察、测量或制造的几何对象。对医学3D打印而言,处理结果不仅要在屏幕上呈现合理形态,还必须保持部位、侧别、空间关系和物理尺寸的一致性。局部边界错位、细小结构遗漏或单位设置错误,都可能在模型制造后继续存在。
子殷数字医学3D打印创新研究中心项目任务书将人工智能医学影像自动化重建、数字医学手术规划及肺结节、膝关节、足踝等专科重构列为研发方向。[1] 这些方向具有共同的技术入口,即从医学影像中提取可信的结构信息。由此产生的研究问题是:如何把自动分割结果转化为有明确用途、有检查依据、有版本记录的三维模型。
医学3D打印相关技术建议已将影像获取、分割、模型生成及模型核验纳入连续流程。[2] 本文在此基础上,侧重企业研发和交付中的衔接问题:上一步的结果需要提供什么证据,下一步才能使用;发生修改后,哪些检查必须重新开展;如何区分算法本身的能力与人工介入后的最终效果。
本文所称“三维重建”,限定为从断层影像、分割标签到解剖三维模型的构建,不指从CT投影数据恢复断层影像。图像重建中的灰度相似性、峰值信噪比等指标,不能直接回答解剖边界和打印尺寸是否满足要求。术前方案的临床选择、手术导板设计及实体打印性能不属于本文的主要评价对象。
2 资料来源与框架构建方法
2.1 项目依据与研究范围
本文以项目任务书为需求分析依据,并结合所提供验收材料中的科研活动与软件研发资料说明理解应用背景。任务书载明项目执行期为2023年4月至2025年4月;本文属于此后围绕项目技术方向形成的方法研究,不将本文提出的控制措施认定为执行期内已经实施的事实。[1]
公开文献采用目的性选择,覆盖医学3D打印工作流程、医学影像AI研究报告、分割评价方法和DICOM空间信息。选择这些资料的目的,是支持术语界定和方法设计,不构成系统综述。本文未重新分析原始患者数据,也未开展新的算法训练、对照实验或临床试验。
2.2 分析单元与形成步骤
框架以一次具有明确用途的建模任务为基本单元。首先提取影像输入、目标结构、自动处理、人工处理和交付文件五类对象;随后分析每次对象转换可能引入的错误;再为这些错误配置检查方法、责任角色与处置规则;最后设计能够区分算法表现、交付质量和操作效率的评价指标。
本文形成的研究产出是质量控制框架及评价方案,不是某一软件版本达到特定精度的实验结论。文中的场景分析用于说明方法如何使用,不对应已完成的患者病例;所有数值阈值均应由具体任务另行确定,本文不设置跨部位通用的合格线。
3 影像输入与参考标注的质量控制
3.1 先确定用途及必须保留的结构
建模前,应由临床需求方与工程人员共同明确目标结构、展示范围、关键测量位置及预期用途。教学展示、术前讨论和后续个性化器械设计对模型信息的依赖不同。一个能够解释整体骨形态的模型,未必能够支持对局部贴合面的尺寸判断。
任务单应记录必须保留的解剖结构、允许裁切的范围、需要单独表示的组织,以及无法从现有影像中可靠辨识的部分。对于不清晰的边界,应先确定如何表达不确定性,避免工程人员依据视觉完整性自行补足。若用途在处理过程中改变,应重新评估输入影像及模型,而不是只修改交付名称。
3.2 核验影像的物理空间信息
DICOM以像素间距、图像位置及图像方向描述影像平面在患者坐标系中的关系;标称层厚与相邻层中心间距具有不同含义。[3] 因此,导入时应核验序列归属、扫描范围、层面方向、空间间距及帧的对应关系,不能仅凭文件名排序或用层厚替代所有层间距离。
本文建议对常规断层序列保存导入后的几何摘要,包括矩阵大小、体素间距、坐标方向、覆盖范围及异常提示。对于缺层、重复层、非均匀间隔、倾斜采集或多帧数据,应使用相应解析流程并确认处理结果。涉及多序列融合时,还需核验配准关系;同一部位或相同矩阵大小不代表已经处于同一空间。
影像去标识化后仍需保留受控的任务关联,以便回溯原始序列;公开交流材料则不应携带患者身份信息。权限、使用目的和流转范围应在数据接收时确定,而不是在交付模型时补记。
3.3 区分图像质量与标注质量
运动、金属伪影、对比不足及局部容积效应可能使边界难以判读。重采样能够改变计算网格,但不能由此证明获得了原始采集中不存在的解剖细节。处理人员应记录哪些区域需要进一步判读,哪些区域无法满足当前用途;追加采集是否必要由临床方结合实际条件判断。
分割评价还需要定义参考标注的产生方式。CLAIM 2024强调明确参考标准、标注来源及标注者差异的处理方法。[4] 本文建议在标注说明中写清目标组织包含与排除规则,对争议区域进行复核,并保留裁决依据。专家参考标注是评价依据,仍可能存在观察差异,不应被表述为绝对无误的解剖真值。
用于测试算法的参考标注,应尽可能在不查看待测算法结果的条件下独立形成。若标注本身由同一算法辅助生成,再直接用其评价该算法,可能产生偏向。业务交付中的人工修订可以使用AI初稿,但应与独立测试的参考标注流程分别管理。
表格可左右滑动查看
| 错误类型 | 可能影响 | 检查与处置 |
|---|---|---|
| 序列或侧别不一致 | 模型对应错误对象 | 对照任务编号、原始影像和侧别标记;未澄清前暂停对应任务 |
| 空间信息解析错误 | 比例失真、翻转或错位 | 核验坐标、间距和已知解剖方向;修正后重建下游文件 |
| 缺层或采集伪影 | 边界断裂、局部结构失真 | 在原始切面复核;标记受影响区域并评估用途限制 |
| 目标定义不一致 | 同名标签代表不同组织 | 统一包含及排除规则;对争议标注复核裁决 |
| 参考标注受算法影响 | 测试结论偏向待测模型 | 建立独立标注或盲法复核流程,并说明无法避免的偏差 |
4 人工智能分割与人工修订的协同
4.1 固定模型与预处理配置
nnU-Net研究说明,医学影像分割的预处理、网络配置及后处理可以按照任务特征组织为可复现的处理方案。[5] 对企业研发而言,可借鉴的是明确并记录完整计算流程,而不能据此推定某个既有模型适用于全部临床部位。
本文建议每次推理关联输入序列、模型结构及权重版本、目标标签定义、重采样规则、强度处理方法和后处理参数。涉及运行时间比较时,还应记录硬件、软件环境和计时边界。若只保存“AI分割完成”及最终文件,后续便难以区分错误来自输入、模型还是操作配置。
模型适用范围应具体到影像模态、目标结构和已测试的数据条件。面对明显不同的扫描方式、严重伪影或训练中未覆盖的解剖改变,系统应提示人工评估适用性。概率输出或不确定性图可以帮助定位复核区域,但高置信度并不构成自动免检依据。
4.2 保留自动结果与修订结果
自动分割完成后,应分别保存原始标签和经人工修订的标签。修订记录至少包括修改区域、错误类型、修改人员、时间和版本关系。典型错误可以归为目标遗漏、相邻组织粘连、错误分离、边界偏移及标签混淆,便于后续分析哪些问题反复增加人工负担。
人工复核应在原始切面、正交重建视图及三维视图之间交叉核对。三维表面有助于观察整体形态,原始切面则提供边界判读依据。只旋转观察一个表面模型,难以发现所有层间断裂、内部遗漏或与邻近组织的错误连接。
临床人员重点确认目标结构及关键解剖关系,工程人员重点检查坐标、标签、几何处理和文件一致性。对于关键部位的分歧,应明确由谁作最终判定,并记录无法消除的限制。修改模型的人员不宜仅凭自己的操作结果完成全部交付审核。
4.3 分别评价算法效果与工作流程效果
算法评价应比较原始自动标签与独立参考标注;交付质量评价则检查人工修订后的最终模型是否符合用途。二者回答的问题不同。若将经过大量人工修订的结果作为AI原始准确率,会掩盖算法缺陷,也无法解释实际交付成本。
效率评价应包含数据整理、推理、人工修订、复核及返工时间,同时报告操作人员实际投入时间和任务总历时。只有在质量要求、任务难度和计时口径相近时,才适合比较人工流程与AI辅助流程。推理时间短不必然意味着整体交付时间短。
5 与打印用途相联系的分割评价
5.1 组合使用整体与局部指标
分割评价需要同时考虑区域重叠和空间偏差,常见指标各有适用条件。[6] Metrics Reloaded进一步强调,应根据目标结构、数据特征、算法输出及实际问题选择指标。[7] 因此,本文采用整体重叠、表面距离和关键结构检查相结合的方法,避免用一个总分覆盖全部质量要求。
Dice系数用于表示预测区域与参考区域的重叠程度,其定义如下。A表示预测区域,B表示参考区域,体积在一致的评价网格及空间定义下计算。
较高的整体Dice不意味着每个局部结构都准确。对于小体积目标,相同数量的误分体素可能导致更大的指标变化;把大结构和小结构合并统计,还可能掩盖小结构的错误。[8] 本文建议按解剖对象分别报告结果,并为关键局部设置独立检查项。
表面距离应以物理空间中的毫米计算,并记录表面提取方式及实现版本。本文建议将HD95明确约定为两个方向的最近表面距离各自第95百分位数中的较大者;若软件采用合并距离集合后求百分位数等其他定义,应如实说明,不能将同名结果直接混用。HD95可降低极端离群点的影响,但也可能弱化少量严重局部错误,因此仍需单独查看关键区域。
使用带容差的表面Dice时,应预先说明距离容差及其确定依据,并固定表面面积加权等计算细节。容差应与影像可辨识程度、参考标注差异和模型用途相联系,不能为了提高得分而在测试后调整。本文不把某个Dice值或固定毫米值规定为所有模型的通用合格标准。
表格可左右滑动查看
| 评价对象 | 建议指标或方法 | 解释边界 |
|---|---|---|
| 目标整体范围 | 按对象报告Dice与体积差 | 重叠程度不能替代关键边界检查 |
| 解剖表面 | 平均表面距离、HD95 | 统一物理单位、取样和计算定义 |
| 局部关键区域 | 局部距离、预定标志点及尺寸复核 | 事先定义区域,避免测试后选择有利位置 |
| 细小或分离结构 | 对象遗漏数、错误连接数、分支检查 | 结构本身可能具有合理的断开或变异 |
| 原始AI输出 | 与独立参考标注的逐例比较 | 不混入人工修订后的结果 |
| 人工协同流程 | 修订时间、返工率、审核通过情况 | 同时说明任务难度及最终质量要求 |
5.2 固定计算与统计口径
评价前需要规定标签映射、参考空间、裁切范围、插值方式及空标签处理规则。参考与预测均为空、仅一方为空的情况应分别报告,不能任意赋值后混入平均值。若测试目标包含病灶发现,还应评价对象是否被检出;只对已经检出的病灶计算分割得分,会遗漏检测失败这一部分问题。
测试数据应与模型开发数据分离,并说明分离层级。CLAIM 2024建议医学影像数据通常应在患者层级或更高层级保持互不重叠,以避免同一患者的数据进入不同分区。[4] 本文建议进一步针对设备来源、采集条件及目标结构难度形成分层结果;跨机构或较晚时间段的数据可用于考察在新增条件下的表现。
对同一患者的多个结构或多次扫描,不应当作完全独立样本简单扩大样本量。报告置信区间时,可采用以患者为单位的重采样,并说明层级、重复次数及统计方法。样本量应围绕主要指标需要的估计精度或对照差异确定,不能仅以图像切片数量表示研究规模。
最终报告应同时呈现逐例分布、主要分层、失败数量及失败原因。测试集上的问题可以指导下一轮研发,但修改模型或阈值后需要新的独立测试安排;反复根据同一测试集改进后,原测试结果已不能保持最初的独立性。
6 从标签到三维表面的几何一致性
6.1 把表面处理视为新的误差来源
标签转为表面网格后,平滑、简化、补洞及局部编辑都可能改变几何形态。医学3D打印技术建议提出,应关注模型生成和优化中的操作,并将导出模型轮廓重新叠加到原始影像核验。[2] 本文据此把“标签审核通过”和“最终表面审核通过”设置为两个独立状态。
建议保留由已审核标签直接生成的基础表面,再生成用于交付的处理后表面。每次涉及平滑或网格简化时,应记录参数并比较关键区域的几何变化。三角面数量增加只能使表示更细密,不能证明原始影像分辨率提高;减小文件体积也不能成为删除关键结构的充分理由。
处理规则应尊重目标解剖。仅保留最大连通区域可能删除骨折碎片或独立病灶;自动封闭所有开口可能改变管腔、孔道或预先约定的裁切边界。工程处理应根据任务定义区分伪影、真实分离结构和人为设计部分,并保留判断依据。
6.2 区分解剖模型与制造用模型
解剖模型表达影像支持的结构,制造用模型可能增加底座、连接杆、支撑连接或为了展示而设置的切面。新增几何应与解剖部分分层或分对象管理,并在交付说明中标识。不能把为了成形而增加的壁厚或连接结构解释为患者本身的组织。
对准备形成封闭实体的模型,应检查非流形边、自相交、重复面和异常法向等问题;存在有意开口或切面的模型,则应依据制造方案确认是否需要形成封闭体。网格检查通过表示满足特定几何条件,不代表解剖已经正确,也不代表相应材料和工艺能够按要求成形。
最终交付前应完成导出与重新导入检查,比较单位、整体尺寸、方向、对象数量和关键测量值,并查看模型与原始影像的对应关系。模型适用用途、版本号及未解决问题应随文件一同交付,避免仅凭文件名中的“最终版”识别有效版本。
6.3 分开验证不同阶段的误差
本文将几何一致性检查分为三个比较关系:自动标签与参考标注之间的差异,用于评价算法;交付表面与已审核标签之间的差异,用于评价建模和编辑;实体打印件与制造用数字模型之间的差异,用于评价后续制造。三类结果不能互相替代。
开展实体测量时,还需考虑测量工具、配准方法和取样位置造成的不确定性。不同阶段的误差可能存在相关性和方向性,不能把若干最大偏差直接相加就声称得到总体精度,也不能将个别环节的最好结果作为整条流程的性能。本文重点提出前两类比较,制造验证由相应工艺研究进一步展开。
7 分阶段审核与版本追溯
7.1 审核依据与责任分配
本文提出五个审核节点,分别对应输入数据、自动分割、人工修订、表面文件和最终交付。每个节点均应具有可检查的输入、输出、责任人和异常处理结果。自动处理成功只代表计算结束,审核通过则表示结果满足该节点约定要求。
表格可左右滑动查看
| 审核节点 | 需要保留的证据 | 进入下一阶段的条件 |
|---|---|---|
| 数据接收 | 用途、序列摘要、空间核验与异常记录 | 来源及对应关系明确,影像支持约定用途 |
| 自动分割 | 模型版本、处理参数、原始标签 | 输入适用性已评估,输出可供复核 |
| 人工修订 | 修订标签、关键区域确认、修改记录 | 目标结构及未解决限制已确认 |
| 表面建模 | 基础表面、处理参数、几何差异与回导检查 | 几何变化可解释,关键尺寸和方向一致 |
| 文件交付 | 文件清单、用途、版本、审核人及限制说明 | 交付对象与获审对象一致,接收方可识别有效版本 |
出现错误时,应先确认影响范围,再退回相应节点。输入序列或坐标错误通常需要重建其下游结果;仅修改制造底座可能只需重新检查制造模型及交付包。暂停和返工应针对实际依赖关系,既不能跳过受影响的检查,也不必机械重做全部工作。
7.2 使修改与审核状态保持一致
项目可采用任务编号、影像版本、标签版本、表面版本和交付版本形成关联记录,必要时用文件校验值核对具体文件。校验值只能用于确认文件内容是否变化,不能替代正确性判断。旧版本应保留但标明状态,避免在多人协作中被误作当前结果。
上游对象发生变化后,与其相关的下游审核状态应重新评估。例如,关键骨面标签被修订后,原先基于该标签生成的表面尺寸检查不再自动有效;只修改说明文字是否需要重新建模,则取决于其是否改变用途或几何要求。这样可以使版本管理直接服务于质量判断。
8 不同应用场景中的框架使用
以下为依据项目技术方向构建的方法示例,不代表真实病例的测试结果。示例用于说明相同框架如何随用途改变检查重点,而不是提出具体临床诊疗方案。
表格可左右滑动查看
| 场景 | 应重点保留的信息 | 优先检查的问题 |
|---|---|---|
| 膝关节骨模型 | 分骨标签、相对位置、关节邻近骨面 | 相邻骨粘连、局部边界偏移、侧别和尺度错误 |
| 肺结节及周围结构模型 | 目标结节、相关血管和支气管的对应关系 | 小目标遗漏、错误连接、分支中断和目标身份混淆 |
| 足踝复杂骨结构模型 | 多骨空间关系、约定保留的碎片 | 最大连通域处理误删、骨间错误融合、平滑改变局部形态 |
对于膝关节模型,整体骨体积的一致性不能代替关节邻近区域的局部复核;如果后续用途涉及贴合面设计,还需在新的设计任务中另行定义验证要求。肺结节相关模型则应区分目标是否识别正确和已识别目标的边界是否准确,避免只展示分割成功的对象。足踝模型中的分离骨块,可能正是需要保留的信息,不能依据连通性自动判为噪声。
这些示例说明,审核可以共享数据、版本及记录形式,具体检查区域与容许偏差则必须由任务决定。企业建设通用软件平台时,可以复用记录机制和检查工具,但仍需维护不同部位的目标定义与复核规则。
9 讨论与局限
本文框架将质量控制的对象从单一分割输出延伸到每次数据转换,重点解决三个问题:自动结果与人工成果混合评价,分割通过后忽略几何编辑,以及交付文件与审核版本失去关联。对应的方法是保存阶段性对象、按用途选择指标,并让每次关键修改能够触发必要的复查。
对企业而言,持续记录失败原因和修订耗时有助于安排研发优先级。若某类结构长期需要大量人工修补,便应分析输入条件、目标定义和算法表现,而不能仅依靠操作熟练度弥补。流程的价值可以通过返工原因是否可定位、版本是否可追溯、关键错误是否能够在交付前发现等结果考察。
本文也存在明确局限。框架来自项目需求分析及公开方法参考,尚未通过独立样本测试或连续业务对照证明其实际效果。不同部位的容差、复核工作量和一致性水平需要另行研究;现有资料不能支持本文给出子殷具体软件的准确率、节省时间或临床获益数值。
后续研究可选择边界明确的一类建模任务,预先固定输入要求、模型版本、参考标注及主要指标,在独立样本中分别评价自动输出和修订后成果,并记录交付失败及返工情况。若比较AI辅助与人工流程,还应控制操作者经验、任务顺序和重复操作的学习效应。获得这些数据后,才能判断框架中的检查措施是否改善质量,以及增加的审核工作是否合理。
10 结论
面向医学3D打印的AI辅助分割与三维重建,需要把影像空间信息、参考标注、自动输出、人工修订和表面转换作为相互关联的质量对象。本文提出的分阶段控制方法,以用途明确、关键结构保真、评价口径一致和版本可追溯为基础,将算法性能与最终交付质量分别评价。该方法为子殷数字医学3D打印相关研发提供了可进一步验证的工程研究框架,其效果和适用边界仍需真实数据支持。
参考文献
[1] 内蒙古子殷科技有限公司. 草原英才工程专项资金支持企业科技研发项目任务书 数字医学3D打印创新研究中心[Z]. 项目执行期2023年4月至2025年4月. 项目内部文件.
[2] Chepelev L, Wake N, Ryan J, et al. Radiological Society of North America (RSNA) 3D printing Special Interest Group (SIG): guidelines for medical 3D printing and appropriateness for clinical scenarios[J]. 3D Printing in Medicine, 2018, 4: 11. DOI: 10.1186/s41205-018-0030-y.
查看来源 ↗[3] National Electrical Manufacturers Association. DICOM PS3.3 Information Object Definitions C.7.6.2 Image Plane Module[EB/OL]. 在线现行版本[2026-09-27]. https://dicom.nema.org/medical/dicom/current/output/chtml/part03/sect_C.7.6.2.html.
查看来源 ↗[4] Tejani A S, Klontzas M E, Gatti A A, et al. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): 2024 Update[J]. Radiology: Artificial Intelligence, 2024, 6(4): e240300. DOI: 10.1148/ryai.240300.
查看来源 ↗[5] Isensee F, Jaeger P F, Kohl S A A, et al. nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation[J]. Nature Methods, 2021, 18: 203–211. DOI: 10.1038/s41592-020-01008-z.
查看来源 ↗[6] Taha A A, Hanbury A. Metrics for evaluating 3D medical image segmentation: analysis, selection, and tool[J]. BMC Medical Imaging, 2015, 15: 29. DOI: 10.1186/s12880-015-0068-x.
查看来源 ↗[7] Maier-Hein L, Reinke A, Godau P, et al. Metrics reloaded: recommendations for image analysis validation[J]. Nature Methods, 2024, 21: 195–212. DOI: 10.1038/s41592-023-02151-z.
查看来源 ↗[8] Reinke A, Tizabi M D, Baumgartner M, et al. Understanding metric-related pitfalls in image analysis validation[J]. Nature Methods, 2024, 21: 182–194. DOI: 10.1038/s41592-023-02150-0.
查看来源 ↗交流与讨论
欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。
公开讨论
正在加载讨论…