AI能否持续改进自己?递归自我改进的证据与医疗AI路径
从75页RSI研究综述出发,区分自我修改、机制继承与有效改进,并提出面向医学影像、三维重建和医工协作的可检验研究路径。
L1—L5:AI负责哪些改进决策?
研究团队提出的自主性分级,等级不直接代表效果、安全性或临床成熟度。
| 级别 | 决策范围 | 核心含义 |
|---|---|---|
| L1 | 执行改进 | 按预定流程实施更新 |
| L2 | 选择策略 | 自主决定怎样改进 |
| L3 | 获取经验 | 决定下一轮需要学习什么 |
| L4 | 环境适应 | 将运行反馈转为持久更新 |
| L5 | 递归元改进 | 修改并继承后续改进机制 |
摘要
人工智能正在参与数据整理、程序修改和实验设计,但自动完成研发任务,与持续改善研发方式之间仍有距离。本文采用叙述性文献评述,结合RSI五级框架与代表性方法,讨论如何识别真实的改进,以及怎样把相关思路转化为医疗AI的研究问题。
本文提出三项判断原则:记录被修改并实际复用的对象;在可比资源下评价后续版本;同时观察专业复核投入和新增错误。面向医疗AI,建议先以离线候选系统开展“AI初稿—专业修订—独立评价—版本更新”的研究,再验证改进机制是否具备可迁移价值。文章提出的是研究路径,不是已获得的实验结论。
关键词:递归自我改进;智能体;独立评价;医学影像;三维重建;医工协作
一 这篇75页论文实际提出了什么
2026年9月10日,Duan等在arXiv发布《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》。PDF共75页,作者单位包括上海交通大学、清华大学、字节跳动和上海人工智能实验室等。它是一篇研究综述与路线讨论,不能据此称为“中国官方路线图”。[1]
“人类建造的最后一个AI”是具有前瞻性的标题,并非已经得到验证的历史结论。阅读这类论文,应分别识别概念定义、已有实验和未来设想。研究路线的提出,不等于路线终点已经实现。
文首表格概括作者的五级划分。最关键的区分是:结构性L5要求修改后的改进机制被后续轮次继承使用;有效L5还需证明它在可比预算与独立评价下产生更好的后继系统。多代优势能否稳定累积仍是开放问题。[1]
二 自我反馈、自我修改与元改进:三类证据各说明什么
Self-Refine让同一语言模型生成答案、提出反馈并反复修订,方法无需额外训练。它说明单次任务的输出可以通过迭代改善;仅凭这种结果,无法证明系统在下一个任务中继承了更好的学习机制。[2]
STOP把调用语言模型的改进程序本身作为优化对象,并报告改进后的程序在一组下游任务上优于初始程序。作者同时说明,底层语言模型并未被修改,因此不把该结果称为完整的递归自我改进。[3]
Darwin Gödel Machine通过修改编码智能体代码、维护候选集合并进行基准评估开展探索。其2025年预印本报告,在论文的实验设定下,SWE-bench表现由20.0%提高至50.0%,Polyglot由14.2%提高至30.7%;底层基础模型保持冻结。[4] 这些数字属于特定软件任务实验,不能换算成医疗准确率,也不能作为通用智能持续增长的证明。
由这些研究可以作出一个有限推断:研发过程中的部分对象已经能够由AI生成、修改和比较。进一步声称“系统越来越会研发”,则需要评价产生新版本的方法,而不仅是最终选出的某个版本。
不同论文采用的RSI定义也不完全一致。引用时应说明系统究竟改了参数、提示词、工具,还是实验与筛选程序,避免用同一个“自我进化”标签掩盖机制差异。
三 如何检验系统是否真的变得更会改进
以下是本文提出的实验设计建议。可以把被改进的系统记为S,把生成和筛选候选修改的程序记为M。第一类实验比较S的新旧版本;第二类实验比较原始M与改进M在相同起点上产生后续系统的能力。两类问题不能用同一个终点分数替代。
例如,某次自动实验找到更好的影像后处理参数,只能支持这组参数在相应条件下更好。若要证明搜索策略也改进了,应把新旧策略放回同一初始模型、同一开发数据和同等资源条件下,比较多次独立运行后的结果。
资源比较应计入模型推理、候选训练、验证调用、失败实验和人工排障,而不只计算最终模型运行时间。若新策略额外搜索一百次才找到好结果,这可能是预算增加带来的收益。
评价需要保留不参与候选选择的最终测试。反复查看同一测试集的结果并调整策略,会使它事实上成为开发集。可在开发阶段使用训练集和验证集选方案,锁定候选后再进行一次最终测试;失败结果仍应报告。
除最终平均值,还应报告轮次轨迹、独立运行之间的波动、旧任务退化和停止原因。如果改进无法复现,或只能在被反复优化的题目上出现,就应限制结论范围。
四 医疗AI中的反馈,为什么需要分层解释
把RSI用于医疗AI,首先需要定义什么是有效反馈。程序是否运行成功、模型是否贴合影像、专家是否接受方案,以及患者是否获益,是不同层级的观察。
例如,三维重建结果的表面平滑程度可以由软件计算,但平滑并不必然意味着骨折边界更真实;候选复位的几何误差更小,也不足以单独证明手术可行性或功能结局更好。这些例子说明,优化目标必须与具体用途对应。
专业人员的修订具有研究价值,但不能把每一次修改自动当作通用真值。需要记录修改原因:输入异常、解剖识别错误、测量定义差异、软件操作问题,还是专业意见尚未统一。原因不同,对应的技术处理也不同。
Shumailov等在其递归训练研究中发现,模型生成数据反复进入后续训练可造成分布信息丢失,即模型坍塌。[5] 这不等于所有合成数据都不可用,但提示研发团队:模型自己的输出不能未经独立核对就反复充当正确答案。
因此,本文建议保留原始证据、人工修订及修订理由的对应关系,并将自动生成内容与专业确认内容分别标识。AI可以先整理差异、提出原因和形成候选方案,专家把精力放在存在分歧或可能影响结果的部分。
五 面向子殷场景的一条可执行研究路径
从医疗AI与医学3D打印企业的研发需求出发,本文建议先选择一个边界明确的研究任务,例如医学影像与三维模型的空间对应检查。它比直接以“自主完成诊疗”为目标更容易定义输入、错误类型和验收结果。
第一步,固定任务合同。明确输入格式、空间坐标、目标结构、输出要求和拒绝条件。以影像与模型核对为例,可以先检查方向、尺度、左右侧以及模型与切面的对应关系,不能将这些工程检查包装成病理诊断。
第二步,让AI形成完整初稿。系统完成可自动处理的输入检查、候选输出、疑点定位和复核资料生成;未解决的问题保留标记。这样,即使专家尚未完成复核,团队仍能看到端到端流程,并继续改进不依赖专业结论的部分。
第三步,汇总经过确认的修订。对于反复出现的问题,AI形成候选修复或候选规则,并说明它适用于什么输入、可能影响哪些已有病例。人工一次修正的个案,不宜直接扩大为适用于所有器官和医院的规则。
第四步,在离线候选环境比较新旧版本。通过预先约定的评价后再形成待发布版本。真实临床系统的更新另按相应使用范围与发布流程执行;论文讨论本身不意味着开启医院环境中的自动更新。
第五步,研究改进机制。待基础流程稳定后,再比较“固定修复策略”与“可根据历史证据调整的修复策略”。重点观察后者是否在新任务上减少同类失败,而不是仅看它修改了多少代码。
以上是面向相关场景的建议方案。本文不据此为医工造物或CalcAI标注L4、L5等级,也不声称子殷已经完成相应实验。
六 一项具备发表价值的实验应怎样设计
可检验的研究问题是:在相同资源和质量要求下,经过验证的专业修订能否使后续候选版本减少错误,并降低每例总人工投入?这比“系统是否具有自主进化能力”更容易形成明确的研究设计。
本文建议设置三个比较条件:A为冻结的原始流程;B为使用固定更新策略、吸收已确认修订的流程;C为允许调整候选生成或修复策略的流程。三组使用相同初始模型、可比数据与资源预算。B相对A评价反馈利用的价值,C相对B评价改变改进机制的额外价值。
数据划分应以患者为单位,并核查同一患者的双侧、重复检查和派生模型是否跨集合。可将外院或较晚时间段的数据作为额外测试,以观察迁移性;最终测试资料不供系统选择修改。对于复位研究,人工参考方案也应与候选搜索输入分开。
主指标应根据任务预先确定。重建任务可以采用约定的结构识别或几何误差指标,同时报告失败率;测量任务可以观察与专业参考的偏差及一致性。若研究目标包含减负,应记录数据准备、复核、修改、返工和异常处理的总人工时间。
统计上,优先比较同一病例在各流程下的配对结果,并报告效应大小和置信区间。涉及同一病例多个骨块时,应考虑病例内相关性,不能把所有骨块当成互不相关的独立患者。专家评价可在可行时隐藏版本来源,并保留分歧及处理记录。
样本量应由主要终点、预期差异、方差和设计共同确定。先导数据可以用于估计这些参数;不能仅因拥有一批病例,就宣称达到充分统计效能。若结果不支持机制改进,应如实报告,并分析究竟是反馈不足、机制无效还是成本过高。
研究交付应包括固定版本、病例流转与排除记录、评价定义、失败案例和分析方法。几何性能或操作时间的改善属于相应技术与流程证据;患者获益仍需与用途相符的进一步研究。
七 讨论:研发自主性与专业责任如何共同推进
本文认为,医疗AI的近期机会在于减少重复性研发与复核准备,让专业人员更早看到可检查的完整结果。自动整理输入、定位差异、生成复核视图和比较候选版本,都可以成为有价值的工作单元。
专业参与不必表现为每一步都等待确认。团队可以先完成不会改变专业定义的工程工作,再把真正影响结论的少数问题集中提交复核。与此同时,效率评价也要把这部分专业投入计入成本,不能把它隐藏在自动化指标之外。
需要保留的关键约束是:优化过程可以改变候选方法,但不能通过放宽主要终点、删除失败病例或改写参考结果来制造成功。评价标准若确需调整,应形成新版本并解释原因,而不是让不同标准下的分数混在同一条增长曲线上。
对于企业,值得积累的是可追溯的经验链:什么输入导致什么问题,采取了什么修改,在何种独立条件下验证,在哪些范围内仍然有效。这类证据既能支撑产品改进,也能帮助医院和研究团队判断合作成果的实际价值。
结论与资料说明
递归自我改进为AI研发提出了一个重要问题:能否让经过验证的经验,持续改善产生下一代系统的方法?现有研究提供了若干机制与受限任务中的实验线索;对医疗AI而言,下一步应把这一问题拆成可独立评价的任务,测量质量、迁移能力和真实人工投入。
本文为定向检索基础上的叙述性评述,未开展系统综述、元分析或新增实验。文献1核对原文框架与L5证据讨论;文献4核对公开全文中的系统定义与摘要结果;文献2、3、5的相关介绍以作者摘要为限。检索不保证覆盖全部最新研究。
本文由AI辅助检索、整理和撰写,以子殷科技企业从业视角讨论研发方法,可能具有产业视角偏好。文章未使用未公开患者数据,不提供个体诊疗建议;所提研究设计尚待实施。官网发表属于公开学术交流,不等同于学术期刊录用或同行评审。
交流与讨论
欢迎交流研究方法、技术问题与实践经验。评论经审核后公开,子殷团队可在此回复。
公开讨论
正在加载讨论…