跳至主要内容
子殷科技
搜索
学术观点2026年9月19日 · 专业述评

医生如何负责任地使用人工智能:从六条实践原则到可追溯的临床协作

以 BMJ 医学伦理评论为起点,结合 WHO 治理建议与临床研究报告规范,讨论医生、医疗机构和技术团队如何共同建立可解释、可复核、可追溯的 AI 使用流程。

子殷科技原创框架示意:六项 AI 使用原则,由医生、医疗机构与技术团队共同落实;连接任务准入、输入核查、结果复核、决策记录和异常反馈。此图为实践建议,不代表已验证的产品能力。
子殷科技原创框架示意:六项 AI 使用原则,由医生、医疗机构与技术团队共同落实;连接任务准入、输入核查、结果复核、决策记录和异常反馈。此图为实践建议,不代表已验证的产品能力。

摘要

目的:将医生负责任使用人工智能的伦理要求,转化为可以在临床协作中执行和核查的工作安排。方法:以 Daniel Sokol 在 BMJ 发表的评论为议题起点,选择性参照 WHO 医疗 AI 治理文件、DECIDE-AI、CONSORT-AI 及中国个人信息保护法律文本,开展叙述性分析;本文不属于系统综述,不报告新增患者数据或干预效果。主要观点:工具适用性、信息保护、输入与输出核验、患者沟通、决策记录和异常处置,应由医生、医疗机构与技术团队共同落实,并与任务风险和使用阶段相匹配。结论:负责任的 AI 使用,需要使关键结果能够回到原始证据,使人工复核具有真实的判断条件,并通过持续评价发现使用过程中的风险。本文提出的流程与指标尚需在具体场景中验证。

关键词:医疗人工智能;患者安全;临床判断;医工协作;可追溯性;人工监督

一、问题的起点:医生需要对 AI 的影响作出专业判断

人工智能可以参与病历整理、影像处理、风险提示和方案讨论,但不同任务对患者的影响并不相同。文字摘要中的遗漏、三维重建中的结构缺失,以及治疗建议中的错误,分别涉及不同的核查对象。讨论“医生能不能用 AI”时,首先应说明使用了什么工具、用于什么任务,以及结果会如何进入诊疗过程。

Sokol 的评论强调,医生既不宜无批判地接受每一个新系统,也不应原则性地拒绝 AI。其讨论将注意力引向工具是否适合、使用是否得当,以及医生能否对自己的决定作出解释。文章中的法律讨论立足英国情境;本文借鉴其伦理与实践启发,不将其转化为中国司法结论或使用 AI 的免责保证。[1]

WHO 将伦理、人权和利益相关方的责任放在医疗 AI 设计、部署与使用的全过程中。[2]据此,本文将“负责任使用”理解为一种共同完成的工作:医生判断临床意义,医院提供准入与管理条件,技术团队提供可验证的功能、限制说明和追溯能力。这是本文的分析框架,不是关于责任比例的法律划分。

二、六项原则如何转化为可核查的行动

以下六项议题依据所获 BMJ 文章材料概括;对应行动与留痕要求是本文提出的实施建议。它们需要嵌入医院现有工作流程,避免重复录入,也不应被简化为只需勾选的形式化清单。

表1 六项原则与实践建议的对应关系
原则议题可执行行动(本文建议)可核查的依据
选择并理解工具确认任务适用性;了解限制与失败情形用途说明、适用范围、培训记录
保护患者信息按授权与最小必要范围处理数据处理目的、访问与流向记录
核验输入和输出核对数据对应关系;回看原始证据输入核查、源影像、人工修订
必要的患者沟通说明 AI 对重要选择的影响与局限相关沟通和必要同意记录
保存有用记录保留关键判断理由及所用版本候选结果、修改历史、最终确认
处理潜在不安全结果控制影响、报告事件、分析并验证修复异常记录、版本信息、复核结果

2.1 用对工具:先明确任务、适用范围和失败情形

对医生而言,理解 AI 并不要求掌握源代码,但至少应知道系统的用途、输出含义、重要限制,以及何时需要人工复核。对某一任务有效的系统,不能仅凭名称相近就被用于另一项任务。[1]

本文建议,医院为拟使用的工具建立简明的用途说明:目标人群、允许的输入、支持的任务、已评价的场景、明确排除的情形和异常处理入口。医学影像处理尤其需要说明检查部位、序列要求、解剖覆盖与图像质量条件。选择工具时应核对这些条件,避免把一个完整、美观的输出误认为适用于所有病例。

2.2 保护信息:把数据使用目的和流向说明白

Sokol 提醒,可识别患者的信息不能被输入公共或未经授权的 AI 系统;仅去除姓名或编号,也可能因其他临床和个人细节而留下识别风险。[1]在中国,《个人信息保护法》将医疗健康信息列入敏感个人信息,要求有特定目的、充分必要性和严格保护措施;处理还需具备适用的合法性基础,并履行相应告知、同意或其他义务。[6]

在具体工作中,本文建议先确定哪些数据是任务必需,再明确由谁访问、在哪里处理、是否传给外部服务,以及保存多久。院内部署可以减少某些外传路径,但不能替代权限、日志、备份和数据用途管理。为诊疗处理数据与将其用于后续训练,是需要分别核对目的和授权的活动。

病历系统与技术追溯系统可以通过受控标识关联,避免在多个日志中重复保存完整患者信息。追溯记录也应遵守最小必要原则;“保留证据”并不意味着无限期复制全部医疗数据。

2.3 核验输入与输出:让人工复核具备实际条件

核查应从输入开始。患者、检查、左右侧、时间和单位等基础信息出现错误时,后续处理即使运行成功,也无法形成可靠的判断依据。对于自动复制或自动选择的数据,同样需要确认其对应关系。Sokol 强调应结合病史、检查和其他证据判断输出;结果影响越大,监督核查越应充分。[1]

WHO 对大型多模态模型特别指出了错误、不完整或带有偏差的内容,以及自动化偏倚带来的风险:人可能因为系统看起来可信而忽略本可发现的错误。[3]因此,本文建议复核界面同时提供原始证据、候选结果和修改入口;必要时先记录独立观察,再比较 AI 输出,以减少先入为主的影响。

例如,测量值应能定位到原始影像、测量点与参考平面;结构分割应能逐层查看边界和遗漏。概率或置信分数的解释需要相应验证,不能直接当作患者获益概率。展示小数位数、热图或解释文字,也不能代替对结果本身的核查。上述安排属于本文的设计建议,需通过实际使用评价检验其效果。

2.4 患者沟通:围绕会影响选择的信息展开

Sokol 的讨论关注具有实质影响的 AI 使用:当 AI 可能影响诊断、预后或治疗,向患者说明其作用通常具有重要意义;患者提出疑问或希望使用替代方案时,需要认真讨论。[1]这一观点不宜被简单改写为所有后台功能都必须逐项口头告知,也不能据此推定任何场景都无需告知。

本文建议,沟通内容围绕患者的实际选择组织:AI 参与哪一步、医生如何核查、主要不确定性是什么、是否存在合理替代方案。若 AI 只参与影像结构提取,就应具体说明这一作用,避免把“使用了 AI”表达成更准确或更安全的承诺。数据处理的法定告知与同意要求,应按适用规则另行落实。

2.5 决策记录:保存理由与版本,支持事后重建

有效记录应帮助其他专业人员理解当时掌握了哪些证据,以及为何作出某项决定。Sokol 的原文节选指出,无论接受还是拒绝 AI 建议,都应具有可以解释的理由,并将理由记录下来。[1]本文建议,记录的详细程度与临床影响相匹配,避免机械复制全部对话或生成内容。

临床记录可说明 AI 对关键判断的影响、相关核查和必要的患者沟通;技术记录则保存系统与模型版本、必要配置、输入关联、原始输出及修改历史。二者通过病例或任务标识衔接。原始候选结果与人工修订后的结果应能区分,不宜用最终结果覆盖全部过程。

CONSORT-AI 要求 AI 干预试验报告说明算法版本、输入输出、人机交互和错误分析等信息。[5]这为研究报告的透明性提供参照。本文将相近信息用于工作流程设计,是方法上的延伸;不能据此声称建立日志后已经符合全部研究规范,或获得了临床有效性的证据。

2.6 发现异常:先控制影响,再开展原因分析

对潜在不安全输出,应首先避免其继续影响患者相关决策,并启动相应人工处理和机构报告流程。异常尚未造成伤害时,也可以成为改进系统的重要线索。医院需要让使用者知道向谁报告、哪些结果应暂停采用,以及出现问题时如何维持必要服务。

本文建议保留与事件有关的输入关联、输出、版本、时间和操作记录,区分影像质量、数据配对、算法处理、界面呈现及使用流程等可能原因。发现一个错误,不应立即将全部责任归于模型或操作者;同样,修复一个病例也不等于消除了同类风险。

经修订的数据若要进入模型改进,应经过用途核对、专业复核和独立验证。临床工作中的即时修订,不宜自动触发生产模型更新;需要在受控版本中评价改动,保留既有结果与恢复路径。

三、共同责任:医生、医院与技术团队各自需要完成什么

要求医生承担判断责任,前提是提供足够的信息、时间和操作条件。如果关键证据无法查看、结果不能修订或系统限制没有说明,单一的确认按钮难以构成有效监督。因此,本文主张将责任要求落实为三方可完成、可交接的工作。

医生需要确认结果与当前病例是否相符,并对关键决策保持独立判断;医院需要组织用途准入、培训、管理分工和事件处置;技术团队需要说明功能边界、保留版本关系、支持定位与修订,并为异常调查提供必要资料。这里描述的是协作分工,具体法律责任仍取决于适用法律、事实与因果关系。

这一分工也意味着,培训不能只教点击步骤。可以加入输入选错、结构遗漏、结果与其他证据不一致、系统无法处理等情景,观察使用者能否识别问题并转入适当流程。评价应覆盖完整的人机协作过程,而不只统计软件是否给出了结果。

四、审计与评价:从算法分数走向实际使用证据

DECIDE-AI 将早期临床评价与实际临床表现、安全性和人因问题联系起来,为后续更大规模研究提供基础。[4]CONSORT-AI 则针对包含 AI 干预的临床试验提出报告要求。[5]两者属于不同阶段的报告规范,不能作为产品有效性认证,也不能仅凭完成条目就认定系统安全。

本文建议在明确的应用场景中预先约定评价对象、参照标准、分母、容许差异和异常处置办法。对于定量测量,可报告偏差及其分布,并根据研究设计评价一致性;对于分割,可同时关注关键结构遗漏和下游任务影响。算法指标、技术流程表现、临床有效性与患者结局应分别评价。

持续审计可以分层观察年龄、性别、病变类型、扫描设备、采集协议和中心之间的表现差异,但应有明确必要性并遵循数据最小化。小样本群体应说明不确定性;粗略差异也可能来自病例难度或构成变化,不能未经分析就判定歧视或算法偏见。WHO 对大规模多模态模型使用提出独立审计和分组评价建议,为此提供了治理层面的参照。[3]

下表为建议的监测维度,不是已验证的统一质控标准。各项指标应在开始评价前明确口径。尤其需要注意,修订率不等于错误率,低修订率也可能来自复核不足;事件报告增加有时反映报告机制改善,需要结合具体情境解释。

表2 机构审计的建议维度及解释边界
观察维度建议记录解释时需要注意
输入适用性不合格输入数、总评估数及不合格原因被排除病例同样需要报告
结果与参照的一致性按预定义标准统计偏差或关键遗漏参照标准本身也可能有不确定性
人工复核负担修订比例、修订类型、复核时间分布不能把未修订直接解释为正确
分组表现任务相关人群、病型、设备与中心差异报告分母、样本量与不确定性
异常与潜在伤害事件严重程度、暴露数量和处置过程报告数量受发现和报告机制影响
版本变化更新前后同一评价集的表现与失败类型评价集不得用于调参后仍充当独立验证

五、医学影像与医工转化:把原则落实到可回看的交付链

以“影像导入—AI 候选结果—工程修订—医生复核—报告或设计交付”为例,本文建议为病例、检查、序列、模型、测量和最终交付建立可追溯关联。工程人员负责其专业范围内的结构、几何与文件检查,临床专业人员负责相应医学判断;两类复核相互衔接。

假设一项下肢测量结果经过修改,复核者需要知道改变的是测量点、参考平面还是计算定义,并能回看修改前后的图像及数值。该示例仅说明追溯设计,不对应真实患者,也不提供截骨或治疗方案。对进入后续设计与制造的结果,还应明确最终采用的版本,避免旧测量与新模型混用。

对 MEDIFORGE 的研发与产品化而言,本文提出三个建设重点:让输出能够回到源影像;让工程修订与临床确认各自留下依据;让最终交付与所用版本保持一致。这些是面向未来建设和评价的要求,不代表平台全部模块已经实现、完成临床验证或取得相应监管许可。

实施可以分阶段推进:先验证技术链路的完整性和可复核性,再在适当授权与研究条件下评价真实使用过程,随后根据预期用途与适用要求开展更充分的临床评价和正式部署管理。工程运行成功、科研结果和临床使用结论,必须分别取得证据。

六、结论与局限

负责任地使用医疗 AI,需要在工具选择、数据处理、结果核验、患者沟通、记录与异常处置之间形成连续的工作联系。医生能够回看证据并解释关键判断,医院能够发现和管理风险,技术团队能够定位问题并验证更新,三者共同构成持续改进的基础。

本文为选择性文献支持的专业述评,未开展系统检索、证据质量分级、临床试验或实证审计。BMJ 原文仅获得部分内容,国际文件与中国具体实践之间亦存在制度差异。所提记录字段、协作分工和指标应根据科室任务进一步验证,不能用作疗效结论、免责承诺或个体诊疗建议。

发布与利益关系说明

发布主体:子殷科技。本文为官网专业述评,未经过期刊同行评审,不是 BMJ 官方译文、临床指南或原始研究论文。子殷科技从事医疗 AI 与医学3D打印相关业务,并推进 MEDIFORGE 研发,与本文讨论方向存在业务关联。文中对产品的讨论限于建设建议,不以企业身份替代独立评价。

本文使用生成式 AI 辅助资料检索、结构组织、文字起草与网页制作;引用依据及可核验范围列于文末。未使用患者原始资料,不报告新增实验数据;本文不声称已完成独立临床专家审稿。

交流与讨论

欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。

发表一条评论

请勿提交患者姓名、病历、电话等个人信息。
项目需求请前往联系合作。

0/2000

提交即申请审核并公开昵称和评论内容,信息处理详见隐私说明。

公开讨论

正在加载讨论…