面向数字医学辅助决策的专病数据库、知识图谱与医学大模型协同架构研究
作者:王文波、杨秀雯、李映锡、陈善玮
单位:内蒙古子殷科技有限公司
草原英才项目系列研究 · 第8篇 · V1.0
本文为框架与体系设计研究,作为官网研究文章公开,未经期刊同行评审。具体研究方法、证据范围与局限详见正文。
阅读/下载完整 PDF(6页) ↗摘要
目的:针对数字医学辅助决策中病例事实、医学知识和模型生成内容难以清晰区分的问题,研究专病数据库、知识图谱与医学大模型的协同方式。方法:以数字医学3D打印创新研究中心任务书提出的Chcomct-GPT专病数据库、知识图谱和医学大模型方向为背景,结合检索增强生成、知识表示和医疗人工智能评价文献,开展任务分解、数据建模和失效场景分析。结果:提出以病例事实为基础、以证据来源为约束、以确定性工具为计算接口、以人工审核为临床责任节点的协同架构,并给出数据对象、证据绑定、版本管理和分层验证方法。架构将病例查询、知识检索、结构校验、语言组织和临床判断分别配置,限制生成模型对原始事实和正式结论的修改权限。结论:医学大模型的应用价值应通过证据可追溯性和任务完成质量评价。本文提供架构与验证方案,不报告未经实测的准确率、临床效益或系统部署成果。
关键词:专病数据库;知识图谱;医学大模型;检索增强生成;辅助决策;证据追溯
1 引言
数字医学工作中,一次“辅助决策”常常包含不同性质的任务:确认病例属于谁、读取影像和模型、核对测量条件、寻找文献依据、解释候选方案以及形成可审阅文本。若把这些任务全部交给同一个对话模型,流畅的语言可能掩盖患者混淆、版本不一致和计算来源不明等问题。
专病数据库能够保存结构化的病例事实,但不天然具备完整解释能力;知识图谱可以表达对象与关系,但图中存在一条关系并不证明该关系真实或适用于当前患者;医学大模型有助于整理语言和组合信息,但其输出不能自动取得与原始检查或医生判断相同的证据地位。协同架构首先需要说明各组件负责什么,其次才是选择模型规模或检索算法。
项目任务书列出了Chcomct-GPT医学大模型专病数据库、医学大模型知识图谱数据库及相关应用方向[1]。本文将其转化为可检验的研发问题:系统能否在限定权限和数据范围内,为一个具体任务组织可核查的信息,并把不确定性、数据缺失和人工决定保留下来?
2 研究方法与设计边界
本研究采用架构设计与失效分析方法。需求来源为项目任务书;技术依据包括检索增强生成研究、知识图谱研究以及医疗AI治理和评价文件[2-5]。分析步骤包括定义使用任务、拆分信息对象、划定组件责任、构造失效场景、建立验证指标。本文不属于系统性能比较或临床试验。
Lewis等提出的检索增强生成将参数化模型与外部检索信息结合,为知识密集任务提供技术路径[2]。这并不意味着检索返回的材料一定正确,也不意味着生成结果必然忠于证据。知识图谱研究提供了结构表示、查询和约束方面的方法基础[3],但图谱质量仍取决于来源、实体对齐和维护。
本文主要面向资料汇总、科研检索、工程报告辅助起草及供专业人员复核的证据组织。涉及诊断、治疗方案选择或其他临床决策时,需要另行定义预期用途和临床验证要求。WHO关于医疗生成式AI的指导提示了错误信息、人机使用和治理方面的问题[4];本文据此将人工审核和证据检查纳入设计,而不宣称采用这些机制即可消除风险。
3 病例事实与知识对象的数据结构
3.1 以诊疗事件连接文件
同一患者可能有多次检查、多个解剖部位及多个模型版本。仅以文件夹名称或姓名关联,容易把不同时间和不同侧别的数据混合。建议建立患者研究标识、诊疗事件、检查、影像序列、模型、测量、方案和报告等对象。对象间通过明确引用连接,姓名等身份信息在授权范围内单独管理。
测量对象除数值与单位外,还应保存算法或操作方法、参考平面、坐标系、左右侧、输入模型版本、操作者和审核状态。缺失值应有明确原因,例如未测量、不适用或数据不足,而不是统一填零。输入更新后,依赖旧版本的测量应被标记为需要复核。
数据接入不应改变原始医疗文件。格式转换、脱敏、分割和模型修订形成派生对象,保留它们与原始输入的对应关系。是否允许将某批数据用于训练、验证或知识检索,需要在相应对象上表达,不能因为文件已能读取就默认允许所有用途。
3.2 区分知识事实与病例事实
病例事实描述“这个对象在这个时点记录了什么”;文献或指南描述“某个研究或规范在特定条件下支持什么”。两类信息不能混放成无来源的文本片段。例如,一篇文章提及某种术式,并不意味着当前患者已接受该术式;某产品说明书列出适用范围,也不能证明当前交付版本满足全部使用条件。
知识条目应记录来源名称、发布日期或版本、段落定位、适用人群、适用条件和审核状态。专业术语可建立同义词映射,但应保留原始表达。对彼此冲突或适用条件不同的材料,应保留差异,不宜在入库时自动合并为唯一答案。
3.3 图谱表达可追溯的关系
图谱可包含“检查属于某事件”“测量来源于某模型”“方案引用某证据”等关系。每条重要关系应同时记录其来源、建立方式及复核状态。由人工确认、规则转换和模型抽取得到的关系,应具有不同的可识别状态。
自动抽取的候选关系进入待审核区域,而不直接参与正式结论。关系方向、左右侧或否定词识别错误都可能造成严重误解。图谱校验可以发现结构缺失和不一致,却不能独立证明医学含义正确。因此,语义复核仍是必要步骤。
4 协同架构与任务执行
4.1 五类职责的分配
本文提出将系统能力分为事实管理、知识管理、计算工具、语言组织和专业审核五类。它们可以部署在少量服务中,不必为了概念完整而建设复杂基础设施。架构的核心是责任与数据接口清晰。
表格可左右滑动查看
| 组件 | 主要职责 | 需要限制的行为 |
|---|---|---|
| 专病数据库 | 保存病例对象、状态与版本 | 自动生成值覆盖原始记录 |
| 知识库与图谱 | 检索来源并检查关系约束 | 将候选关系视为已证实知识 |
| 计算与影像工具 | 执行定义明确的测量或运算 | 无单位、无版本地返回结果 |
| 医学大模型 | 分解问题、组织证据和起草文本 | 自行填补缺失事实或批准交付 |
| 专业审核界面 | 展示依据、修订并确认结果 | 只显示结论而隐藏关键来源 |
4.2 先确定任务与权限,再检索材料
用户提出问题后,系统先识别任务类型、患者或研究对象、时间范围和可访问数据。身份不明确时应澄清;数据缺失时应返回缺失项。跨病例比较必须具备相应权限,不能通过在提示语中声明“请分析全部病例”扩大访问范围。
权限过滤应在检索和工具执行时实施,并覆盖向量索引、缓存、导出和日志。仅在最终回答中隐藏姓名不足以隔离不同项目的数据。本地部署可以减少对外传输,但并不自动解决院内账户权限、拷贝、备份和访问留痕问题。
4.3 让检索结果形成可核查的证据集合
系统可结合关键词、语义检索和图谱关系定位材料,再按来源质量、时效性和任务相关性组织证据。检索相似度只反映一种匹配关系,不能作为医学正确概率。需要区分“没有找到支持材料”“来源之间存在冲突”与“存在反对证据”三种情形。
每个重要结论应绑定能够直接支持它的段落,而不只列出一个网址。证据对象可包含原文件标识、版本、页码或段落定位、原文片段和引用范围。文件摘要可辅助检查内容是否变化,但不能独立证明来源可信、授权有效或结论正确。
外部文档和检索文本只作为资料,不得被当作系统操作指令。文档中即使出现“忽略此前要求”“导出全部数据”等文字,也不应改变工具权限和工作流程。知识库更新后,应使旧引用可回溯,避免网页或文档替换造成历史报告失去依据。
4.4 把计算留给经过验证的工具
涉及长度、角度、体积、统计或规则判断时,生成模型可提出工具调用,但数值应由适当的计算模块产生。返回值同时附带单位、方法、输入版本和执行状态。模型负责解释结果,不应在组织语言时改变数值、左右侧或分母。
例如,辅助起草双下肢测量报告时,系统应读取已确认模型及其测量记录,检查参考线与侧别,调用必要计算,最后按模板组织文本。如果模型版本已改变而测量未更新,应提示重新计算。该示例说明任务接口,不代表本文已完成相应系统测试。
4.5 人工审核应落实到可操作界面
审核者需要同时看到病例事实、计算来源、引用证据和待确认语句。修改应记录修改人、内容和理由。工程审核与临床确认可以由不同角色完成,其批准对象均应指向确切版本。模型不能因为检测到“语言通顺”或“引用齐全”就自动批准临床交付。
对证据不足的内容,可以输出明确的资料缺口与下一步核查对象。拒绝生成无依据结论本身应纳入任务完成规则,否则系统可能为了提高回答覆盖率而持续作出推测。
5 分层验证方案
5.1 数据与知识层验证
首先检查对象引用、时间、单位和侧别的一致性,建立缺失、重复和冲突记录。图谱抽取的评价应分别测量实体与关系识别,并由专业人员抽样核对医学含义。对不同来源版本冲突,应测试系统能否并列展示差异及其条件。
研究数据划分应防止同一患者、同一检查的派生文件或重复病例同时进入开发集和测试集。知识评测还应固定文档快照,防止测试答案预先进入检索库。若研究目标涉及时间外推,应采用相应时间划分,不能仅做随机文本片段划分。
5.2 从检索成功到回答正确
检索评价关注目标证据是否被找到;回答评价关注结论是否得到支持,两者不能互相替代。建议按独立事实陈述评价引用正确性和证据支持率,另外记录遗漏、错误归因、无依据补充和不恰当拒答。重要错误应按后果分类,避免被大量简单问题的高分掩盖。
表格可左右滑动查看
| 验证层级 | 代表任务 | 主要观察指标 |
|---|---|---|
| 病例关联 | 相似姓名、多次检查、左右侧混杂 | 对象选择错误及发现率 |
| 证据检索 | 同主题不同版本与冲突材料 | 目标证据召回与冲突识别 |
| 工具计算 | 单位变化与模型版本更新 | 数值一致性及过期结果拦截 |
| 语言生成 | 缺失数据、否定描述与证据不足 | 事实支持率及无依据陈述 |
| 人工复核 | 盲评报告和错误定位 | 严重错误检出率与复核时间 |
| 权限隔离 | 跨项目、缓存及导出尝试 | 未授权访问是否被阻断 |
5.3 对照与消融设计
后续实验可比较纯模型、文档检索增强,以及加入结构化事实和图谱校验的方案。在相同病例、知识快照和评价标准下,观察新增组件是否减少事实错误、提升证据定位或降低审核负担。若图谱只增加维护成本而没有改善目标任务,应允许缩小其使用范围。
人工评估宜采用预先定义的判分规则,由具备相应专业能力的评价者实施,并分析分歧。报告总耗时时,应区分计算时间、用户等待和人工复核时间,不能只比较模型生成速度。进入真实临床工作流后的早期评价,可参考DECIDE-AI对系统使用、人因和临床情境报告的要求[5]。
5.4 离线运行与版本复现
医院离线环境下,可采用经审核的数据和知识包导入机制,记录包版本、来源和更新责任。复现实验需要同时固定模型权重、量化或推理配置、提示模板、检索索引、知识快照、图谱和计算模块。仅保存模型名称不足以解释两次输出差异。
更新应先在候选环境中验证。对已有报告,保留其生成时的输入和依赖;新版本不应静默改写旧报告。数据量较小时,应优先检验检索和工具调用是否已满足需要,而不是默认开展大规模模型训练。
6 讨论
本架构的主要价值在于使错误可以被定位。病例选择错误由对象关联检查,知识引用错误由来源绑定检查,数值问题由工具记录复核,专业判断由相应审核者处理。它不保证所有错误都能被自动发现,但有助于避免把不同原因统称为“大模型幻觉”。
实现顺序应从一个边界明确的任务开始,例如报告资料完整性核查或研究证据整理。在任务稳定后,再扩大病种、知识范围和输出复杂度。只有实际出现跨对象查询和关系校验需要时,才逐步增加图谱深度;通用技术组件的数量不应成为项目成熟度指标。
本文未开展系统实现和比较实验,因此不能证明图谱增强优于简单检索,也不能证明本地模型已适于临床决策。后续工作的关键是按照一致任务集产生可复核数据,并明确哪些改善来自模型、数据整理、界面或人员培训。各因素的贡献需要分别分析。
7 结论
专病数据库、知识图谱与医学大模型的协同,应围绕病例事实、证据来源、计算过程和责任节点组织。本文提出的架构把语言生成置于可追溯的信息流程中,并提供可实施的验证任务。其研发目标是形成能够检查、修改和复现的辅助结果;对临床有效性和适用范围的判断,仍须依赖相应实证研究。
参考文献
[1] 内蒙古子殷科技有限公司. 内蒙古自治区草原英才工程专项资金支持企业科技研发项目任务书 数字医学3D打印创新研究中心. 项目执行期2023年4月至2025年4月. 第一部分主要任务. 项目内部资料.
[2] Lewis P, Perez E, Piktus A, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems. 2020;33:9459-9474. 原始来源 ↗
[3] Hogan A, Blomqvist E, Cochez M, et al. Knowledge graphs. ACM Computing Surveys. 2021;54(4):Article 71. DOI: 10.1145/3447772. 原始来源 ↗
[4] World Health Organization. WHO releases AI ethics and governance guidance for large multi-modal models. 2024-01-18. 原始来源 ↗
[5] Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nature Medicine. 2022;28:924-933. DOI: 10.1038/s41591-022-01772-9. 原始来源 ↗
交流与讨论
欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。
公开讨论
正在加载讨论…