从三维重建到专科数字孪生:医疗AI患者专属仿真的证据边界与转化路径
从AI虚拟患者与临床试验案例出发,讨论三维重建如何逐步走向患者专属仿真。本文以跟骨复位为主要场景,提出四层研究路径、独立验证设计与阶段性转化方法,区分几何改善、功能预测和临床获益。
作者与文章属性
作者:王文波、杨秀雯、李映锡、陈善玮;单位:内蒙古子殷科技有限公司。
本文为叙述性研究述评与方法学探讨,面向数字医学、骨科工程与医疗AI研发人员。文中的技术分层、评价矩阵和实施顺序属于作者提出的研究框架;跟骨复位用于说明框架的应用方式,不代表已经完成数字孪生系统验证或证明临床获益。
摘要
目的:厘清医疗数字孪生与三维重建、生成式虚拟患者及临床预测模型之间的关系,探讨医学影像与3D打印企业如何沿现有专科工作流建立可验证的患者专属仿真能力。方法:围绕数字孪生外科应用、计算模型可信度、临床试验预后协变量调整及医疗AI早期评价,核对公开研究、监管原文和项目采购信息,并以跟骨骨折复位为场景构建方法框架。本文采用问题导向的资料选择,不构成系统综述或原始临床研究。
框架与论点:提出“解剖表征—干预方案—功能响应—临床结局”四层研究路径,将患者状态更新、方案版本、不确定性表达与独立评价贯穿其中。几何相似、力学合理性和临床获益分别对应不同证据,不能相互替代。数字孪生预测不能自动解决个体反事实不可观察的问题,模拟数量也不能直接换算为真实样本量。
结论:对以医学三维重建、手术规划和个性化制造为基础的企业,优先发展边界明确的专科方案仿真具有可讨论的实施价值。近期研究应聚焦可量化、可复核的工程终点;功能预测和预后判断应随对应的实验及随访证据逐步扩展。核心转化单位应是“针对具体用途、附有适用边界和验证证据的模型版本”。
关键词:数字孪生;患者专属建模;跟骨骨折;手术仿真;模型可信度;不确定性;医工协同
Abstract
Objective: To clarify the evidence boundaries of medical digital twins and propose a specialty-focused research pathway for patient-specific simulation. Methods: We examined selected publications, regulatory documents, and a public procurement notice, and developed a methodological framework using calcaneal fracture reduction as an illustrative use case. This is a narrative perspective, not a systematic review or an empirical clinical study.
Framework: Four layers are distinguished: anatomical representation, intervention planning, functional response, and clinical outcomes. Each layer requires purpose-specific validation, version traceability, and uncertainty reporting. Geometric agreement does not establish clinical benefit, and simulated patients do not create independent observed outcomes. Conclusion: A staged pathway beginning with reproducible geometric assessment may connect existing medical-engineering workflows to patient-specific simulation, while later functional and prognostic claims require additional independent evidence.
一、问题提出:从“看见结构”到“检验方案”
医学三维重建将断层影像转换为可观察、可测量和可制造的空间结构,为医工协作建立共同对象。临床讨论进一步追问的往往是:如果改变骨块位置、截骨角度、植入物布局或康复载荷,结果会怎样?这一追问要求系统表达干预及其后果,因而超出了单次结构展示的能力范围。
数字孪生相关研究已讨论手术规划、术中支持及术后管理等应用,但共同挑战仍包括数据更新、模型可信度和真实工作流中的验证。[1] 对企业而言,概念吸引力不能代替用途定义。一个系统究竟是在展示解剖、比较几何方案、计算受力,还是预测临床结局,必须先说明白。
本文围绕三个问题展开:患者专属模型在什么条件下可以逐步发展为数字孪生;不同层级的输出分别需要哪些证据;子殷这类以影像处理和医工交付为基础的企业,应如何选择第一项可检验的研究任务。
二、概念辨析:虚拟患者、数字模型与数字孪生
虚拟患者是一个宽泛概念。面向问诊训练的对话角色,主要模拟症状表述、信息遗漏和医患互动;合成队列模拟人群特征或疾病轨迹;患者专属计算模型则依据具体个体的数据建立结构或功能表征。这些对象可以相互配合,但它们的有效性评价不同。能生成逼真对话,不等于能预测该患者的生理变化。
本文采用操作性定义:专科数字孪生是在特定病种或器官范围内,与真实患者建立可追溯对应、按临床事件更新状态、能够模拟指定干预,并通过实际观测持续检验适用性的数字系统。此定义强调用途与反馈,不要求第一阶段就复制全身生理。相关文献将动态更新、预测能力及物理对象与数字对象之间的反馈视为重要特征。[2]
静态STL可以是数字孪生的解剖输入,但仅增加旋转、透明度或动画不会自动产生预测能力。尚未建立实际反馈的方案比较工具,宜准确称为“患者专属规划或仿真模块”。术后或随访数据更新患者状态,与重新训练算法属于不同操作:前者更新个体信息,后者改变模型版本,不能未经评价混为一体。
三、政策与案例:证据进入决策需要限定用途
FDA于2026年6月发布ICH M15最终指南,规范模型引导药物研发证据的规划、评价、记录及监管沟通。该框架要求明确模型所回答的问题和使用范围,并使评价强度与模型风险相称;它不是对任意AI虚拟受试者的整体认可,也不意味着模型证据在所有场景都具有相同权重。[5]
中国2026年第50号公告发布了修订后的《药物临床试验质量管理规范》,自2026年9月1日起施行。本文核对正文及配套问答,确认其支持新技术、新方法在符合伦理、科学和法律要求的前提下应用;在本次核对文本中未检得“虚拟患者”或“数字孪生”的专门授权条款。因此,本文不以该文件作为允许虚拟对照替代真实对照的依据。[6]
医疗器械计算建模还有另一条更贴近骨科工程的参考路径。FDA于2023年发布计算建模与仿真可信度指导文件,其适用对象包括基于物理、机理或第一性原理的模型。[3] 其中的风险与用途思路值得借鉴,但不应将这份指南扩大解释为对独立机器学习系统的普遍认可,更不能直接移用为中国注册结论。
3.1 PROCOVA的启示:提高试验效率与替代对照是不同主张
EMA于2022年对PROCOVA形成资格意见,认可在具有连续型结局的随机对照试验中使用预后评分进行协变量调整的方法。其关键是用独立历史数据建立预测信息,再将评分纳入真实试验的分析。资格意见讨论了提高精度和样本量规划的条件,并明确具体预测模型的开发不在本次资格认定范围内。[4]
这一路径的价值在于使预测信息在统计设计中发挥可评价的作用。它不等同于“只招募接受新药的患者,再给每人生成一个虚拟对照,就自然获得同等级证据”。Unlearn披露的阿尔茨海默病对照组缩小23%来自回顾性分析;帕金森病38%来自其特定研究披露。本文将这些比例视为特定条件下的研究结果或潜力估计,不将其作为通用降本系数。[8]
3.2 采购意向证明需求出现,尚不能证明技术成熟
中国政府采购网的公开信息显示,山东大学齐鲁医院于2026年5月19日公布数字孪生虚拟临床试验采购意向,预算262.5万元,包含虚拟人群建模、临床试验流程模拟、方案辅助及平台集成等内容。[7] 公告日期早于上述6月政策,不能据此建立“政策发布直接导致该采购”的因果叙事。
采购意向是需求信号,不是成交确认,也不是技术性能、临床有效性或监管接受的证明。该预算覆盖多项软件开发与集成工作,不能直接用作一个药物试验的标准服务费。企业应进一步核对具体采购文件、数据条件、验收标准和可重复交付的范围。
四、技术边界:预测不会消除反事实问题
设同一患者在方案A下的结局为Y(A),在方案B下的结局为Y(B),个体治疗效应涉及二者之差。通常只能观察其中一种实际结局,另一个反事实无法同时直接观察。数字孪生为未实施方案提供的是模型估计,不会把它变成真实观测。[9]
随机化能够支持群体平均效应的识别,但不能直接恢复每个人在两种方案下的完整结局。使用观察性资料估计治疗差异,还需要面对混杂、治疗选择和资料缺失。预测模型在既有治疗环境下准确,并不自动保证它在改变治疗策略后仍准确。
对骨科仿真也应保持这一分辨:计算某个复位方案的关节面几何差异,是相对明确的工程任务;依据该差异预测多年后的疼痛或功能,是需要新增证据的临床任务。同一患者生成一千个扰动方案,可用于敏感性分析,却仍然只有一个真实患者,统计分析应保留这种依赖关系。
五、四层研究路径:每增加一种主张,就增加对应验证
本文提出四层研究路径,作为研发与验收的讨论框架,而非现成的监管分级标准。每一层都可以形成有价值的成果,不需要等待后续层全部完成。但后续模型必须处理上游误差,不能默认分割、坐标和材料参数完全正确。
第一层解决“表达了什么”,第二层解决“改变了什么”,第三层解决“在给定条件下会产生什么响应”,第四层解决“真实患者之后发生什么”。层级之间存在联系,但不能用上一层指标替代下一层结论。
| 研究层次 | 主要输出 | 验证重点 | 不能直接推定 |
|---|---|---|---|
| 解剖表征 | 分割、结构、坐标与测量 | 独立标注、关键区域误差、空间一致性 | 真实受力或治疗效果 |
| 干预方案 | 复位、截骨或植入后的几何变化 | 变换正确性、约束、方案复核 | 几何改善必然带来功能改善 |
| 功能响应 | 指定条件下的受力或运动结果 | 数值收敛、实验对照、参数敏感性 | 未经验证的长期临床结局 |
| 临床结局 | 规定人群与时点的预后预测 | 独立队列、校准、亚组、前瞻性评价 | 使用预测模型本身产生因果获益 |
六、以跟骨复位为例:定义最小可验证任务
子殷已公开报道CalcAI围绕跟骨骨折三维观察、复位候选方案比较及局部复核开展研究交流。[11] 这项公开信息说明研究场景的来源,并不证明数字孪生已经建成。本文建议以“患者专属复位方案的几何仿真与量化评价”为候选研究任务,优先回答不同方案改变了哪些空间关系。
研究对象应限定影像类型、骨折范围和输入要求,预先记录排除情形及其理由。图像伪影、分辨率不足、结构缺损或无法可靠界定的关节面,应触发不适用或低可信提示,而不是由模型补出外观完整的结构后继续给出确定结论。
每例保存原始影像引用、分割版本、骨块标识、坐标系、AI初稿变换、人工修订变换和审核状态。每块骨的刚性变换可用旋转与平移表达;旋转中心和变换组合顺序应有明确定义。界面操作、数值记录、三维显示及导出结果应指向同一版本。
建议先比较三个对象:原始损伤状态、锁定的AI候选方案、医生或工程师参与修订的方案。独立评价者应尽可能不知道方案来源,以减少偏好影响。参与修改的人给出的认可可作为使用反馈,但不宜同时作为唯一的独立参考标准。
6.1 几何终点必须有操作定义
关节面台阶与间隙需要事先说明评价区域、截面或曲面、采样方式、法向定义及统计量。仅计算两块骨表面的最近距离,无法自动区分正常关节间隙、骨折裂隙、缺损或相互穿透。骨块重叠体积也需与真实解剖接触、网格质量和数值容差区分。
当使用对侧镜像作为形态参考时,应记录对侧可用性、配准误差与潜在自然不对称;镜像不能被直接当成损伤前真值。医生修订方案同样可能存在合理差异,应通过多评价者结果表达参考标准的变异。
评价结果宜保留原始指标和空间定位,避免未经验证就压缩成单一“最优复位评分”。若某方案改善整体形态但加重局部关节面问题,系统应展示冲突,交由有权限的专业人员判断。具体合格阈值由研究方案结合临床意义与测量误差预先确定,本文不设置通用临床阈值。
| 评价维度 | 建议记录 | 主要解释边界 |
|---|---|---|
| 关节面关系 | 台阶、间隙、评价区域与方向 | 测量定义必须一致;最近距离不等同于台阶 |
| 骨块与整体形态 | 重叠、关键结构关系、可用的形态参考 | 表面接近不证明解剖复位;对侧有自身误差 |
| 工作流负担 | 准备、运行、修订、复核及返工工时 | 仅推理提速不等于总工时下降 |
| 独立审核 | 评价者判断、分歧及残余错误 | 参与修订者不能充当唯一独立评估者 |
| 稳健性与失败 | 扰动后的变化、不适用及失败原因 | 不能删除失败病例后计算总体成功率 |
6.2 从结构到受力:力学仿真需要独立证据
骨骼表面模型不能单独决定接触压力、稳定性或运动表现。建立功能响应层,还需说明骨与软组织材料、软骨厚度、载荷来源、接触关系、边界约束及植入物参数。资料不足时可以研究不同假设下的结果范围,但必须说明哪些参数来自个体实测,哪些来自文献或工程假设。
建议把网格收敛、求解器设置及守恒关系检查,与实物、台架或其他独立实验对照分开报告。若材料或载荷在合理范围内稍作变化就使方案排名反转,该结论应被标记为不稳定。彩色应力云图只是一种输出形式,本身不能证明力学预测可信。[3]
在早期工作中,功能仿真适合用于提出机制假设和比较条件明确的方案。只有验证证据覆盖相应使用情境,才讨论其对患者级决策的作用。
七、验证设计:按患者独立,按任务验收
本文建议首先开展回顾性工程评价,并预先确定主要终点、评价对象、失败定义及分析方法。对同一患者的重复扫描、双侧数据、不同骨块和多次修订,应在分组时保持关联,避免同一患者的信息同时进入训练集和独立评价集。应尽可能检验时间或机构变化带来的性能差异。
使用多位评价者时,可按终点性质报告一致性、差值分布及置信区间,并在统计模型中处理患者和评价者造成的相关性。若研究比较人工方案与AI辅助方案,应考虑随机顺序、学习效应和适当间隔,避免把熟悉病例带来的提速误判为工具贡献。
样本量应依据预先指定的主要终点、期望差异、误差或方差、患者内相关性及失访等因素估计,不能因为现有病例恰好达到某个整数就宣称足够。探索性样本可用于估计这些参数,但不能在反复选择最佳结果后继续充当确认性评价集。
独立验证应覆盖失败病例。无法完成、需要大幅修订或输出不可解释的病例,应计入相应分母并报告原因。若只统计系统成功运行的病例,得出的平均误差与完成时间会高估可用性。
7.1 三项待检验假设与失败判据
假设H1:在预先限定的影像与骨折条件下,锁定的几何评价模块能够达到预先约定的重复测量误差要求。若关键区域定位不稳定、跨操作者结果偏差超过界限,或重复导入改变坐标与尺度,应判为未通过,不能用总体平均值掩盖。
假设H2:AI辅助工作流在维持预先定义的审核质量条件下,降低病例处理总工时。计时应包括数据准备、自动运行、人工修订、复核和返工;计算时间缩短而总工时不降,不支持该假设。若采用非劣效设计,其界值应具有事先说明的依据。
假设H3:在规范收集的纵向队列中,部分预先指定的几何或力学指标,与指定时点的功能结局存在可重复关系,并在基础临床变量之外提供增量预测价值。若独立数据中校准不佳、增量价值消失或关键亚组表现不可靠,应限制用途。即使关联成立,也不能直接证明按模型推荐干预会改善患者结局。
7.2 临床价值需要后续研究回答
工程评价通过后,可设计不改变诊疗决策的前瞻性观察,锁定模型并比较预测与后续实际记录。这能够检验数据流程、适用性和预测表现,但不能单独证明模型改善治疗。若进一步开展干预性研究,应依据具体目的设置对照、风险控制和相应审查。
早期临床评价还应记录使用者培训、工作流变化、人工覆盖决定、错误如何被发现以及工具使用的潜在负担。DECIDE-AI为AI决策支持系统早期临床评价的透明报告提供了参考。[10] 完成一个报告清单不等于已经获得临床有效性结论。
八、数据与版本:让“患者的变化”可被检验
本文建议以同一研究标识连接影像、模型、方案与随访记录,保留采集时点和数据来源。初始分割、AI初稿、人工修订与最终确认应分别存档,不能仅留下最后一次覆盖保存。这样才能区分模型错误、操作偏差与执行差异。
最小记录集合包括输入影像的空间信息与质量标记,分割和骨块版本,模型及参数版本,方案变换,评价区域与指标,修改者和审核者的角色及时间,以及实际采用的治疗和随访结果。建模数据、开发标签和独立评价资料应有清晰用途边界。
即使有术后影像,也需区分“计划模型”与“实际手术结果”:执行偏差、影像体位、金属伪影和配准误差都可能改变比较。随访中的缺失、再干预及康复执行差异也应记录,不能把它们默认为没有发生。
九、系统协同:大模型负责表达,计算模块承担数值职责
本文建议将信息整理、图像处理、几何计算、物理仿真和结果表达分为可追溯的模块。大模型可以辅助提取病历要素、解释术语、调用已验证工具和组织报告;涉及空间、力学或预后的数值,应由适合该任务且经过评价的模块产生,并显示其来源。
生成式语言表述的流畅程度不应改变数值结果的可信度。系统应同时呈现输入依据、假设条件、误差范围及不适用情形;资料不足时允许保留未知,不以自动补全替代真实测量。对未来不同候选模型,可以比较它们在同一任务上的表现,不必先假定统一大模型能够包办全部环节。
对于院内部署,数据处理和模型更新应遵循既定授权及实际网络条件。研发演示、科研使用、临床辅助和正式部署应分别记录用途;研究输出不能因出现在同一个界面中就自动扩大为临床功能。本文不涉及患者数据上传或新增数据授权。
十、转化路径:从具体成果定义可交付价值
基于上述分析,本文建议子殷优先讨论三个相邻层面的成果:可复核的病例模型与方案比较报告;围绕指定终点的专科研发工具;能够积累随访证据的研究工作流。这些成果可以沿既有医工服务发展,但是否形成付费需求,应通过具体项目的预算、数据条件和验收责任进一步验证。
面向医院科研团队,交付可以是锁定版本、可重现分析和符合研究方案的数据表;面向器械企业,交付可以是条件明确的方案比较及可信度证据;面向院内服务团队,交付可以是减少重复操作、保留审核记录的工作流。本文提出的是潜在合作方向,不表示相关订单、合作意向或临床使用许可已经获得。
经济性评价应同时计算病例准备、模型校准、专业复核、返工、部署维护与版本再验证的成本。只观察一次推理费用,容易忽略长期服务负担。市场规模也应区分可适用项目、实际支付方、采购周期和复购范围,单项采购意向不能直接外推整个行业的稳定价格。
| 阶段 | 可形成的成果 | 继续推进的依据 |
|---|---|---|
| 研发演示 | 交互流程与合成示例 | 算法与软件行为可重复,不作临床性能推定 |
| 回顾性科研 | 锁定版本、独立评价与失败分析 | 达到事先约定的工程终点及适用条件 |
| 前瞻性评价 | 真实流程、工作负担与预测校准记录 | 证明目标场景的适用性,并完成相应审查 |
| 临床辅助与部署 | 明确用途的服务与版本管理 | 满足对应证据、质量与监管要求,持续监测 |
十一、局限性与研究伦理
本文未进行系统性文献检索、证据质量量化或原始患者数据分析;资料选择可能存在遗漏。不同病种对数字孪生的定义和验证要求并不完全相同,本文四层路径也不意味着所有系统都必须采用相同架构。跟骨场景下的指标、研究可行性与实际效益,仍需临床团队和独立评价共同确认。
本文的政策讨论仅说明所核对文件的适用范围,不构成具体产品或试验的监管结论。模型在一种用途下通过验证,不能自动扩展至其他病种、医院、设备或决策目的。真实患者资料进入后续研究时,仍须在既定授权及适用审查范围内处理,并保留原始记录和访问边界。
利益相关说明:作者单位从事数字医学与医疗AI相关研发及服务,对文中讨论的转化方向存在业务相关性。本文公开提出研究主张及其失败条件,未报告新增临床疗效数据,未声称获得所引监管机构或文献作者的背书。本文为企业官网研究讨论文章,未经过学术期刊同行评议。
十二、结论
专科数字孪生的研究价值,在于把患者状态、干预方案、计算假设和真实反馈连接为可检验的过程。三维重建提供结构基础,方案仿真提供比较能力,功能与结局预测则要求逐步增加独立证据。数字模型越接近临床决策,越需要说明其适用条件与不确定性。
对子殷而言,以跟骨复位方案的几何仿真与量化评价作为候选起点,能够提出清晰的研究对象与验收问题。近期重点应放在坐标与版本一致性、关键区域测量、人工修订负担以及独立评价;后续再依据力学实验和纵向随访,判断能否扩展用途。真正值得积累的成果,是能够被复现、被质疑、被独立验证并在明确边界内使用的模型与方法。
交流与讨论
欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。
公开讨论
正在加载讨论…