论文链接:Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents 发表时间:2026年9月 机构:Harvard Medical School × MIT × OpenAI(医疗场景+方法+模型的重磅三方产学研) 领域标签:cs.AI / Clinical Agent

一、论文背景

长程临床 Agent 是什么:不是回答单个医学问题,而是管理一整段真实工作——急诊科一个班次里持续接诊多位病人、开医嘱、安排检查、根据结果调整处置,在时间与资源双重压力下连续决策数小时。

为什么短程基准看不见这类失败:主流 Agent 基准是"短轨迹单任务"(一次问答/一次操作),成功在轨迹末尾打分。而真实部署是小时级交错多任务,失败模式是累积性的:单个决策都对,整体执行崩坏——比如诊断正确但抗生素晚开了两小时。

执行差距(execution gap):论文用 Clinical Environment Simulator(CES)量化了这个差距:诊断准确率 4.39/5(相当好),但 critical-action 完整度 2.94/5、及时性 3.34/5(危险地低)。知道该做什么 ≠ 做完做及时——这是"认知-执行"的经典分离在 Agent 上的再现。

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
医疗 LLM 评测MedQA 系、医学基准单轮问答能力无执行维度
医疗 Agent 系统MedAgent 系工具调用辅助诊疗短程、单病人
Harness 自演化HarnessEvolve/ModularRSI(同月)经验反馈演化脚手架通用编码域
长程 Agent 失败execution gap 类研究长程失败分类通用域
医疗安全系统临床决策支持系统(CDSS)规则化辅助非生成式

定位结论:Asclepius 把 harness 自演化技术首次系统应用于高错误代价的临床长程场景——其贡献一半是方法(自进化 harness 三件套),一半是测量(三失效模式的 per-trace 操作化),后者对医疗 Agent 独立有价值。

三、问题定义

具体场景:急诊整班次多病人管理,要求诊断正确且关键动作(用药、升级监护等)完整、及时、公平地执行。

抽象问题:如何把"长程交错任务中的执行质量"从不可测变为可测量、可定位、可改进。

形式化:给定班次 episode(病人流、时间线、资源约束)、动作空间 A、关键动作集 K(每病人),执行质量 Q = f(诊断正确率, K 的覆盖率, K 的时延分布, 时延的病人间公平性);约束:错误代价不对称(漏救»过度处置)。

精妙之处:三失效模式的per-trace 操作化——把模糊的"执行差"翻译成三个可从执行轨迹直接计数的量:指令遵循漂移(instruction-adherence drift:执行与手册的偏离率)、治疗不完整(incompleteness:K 的漏项)、严重度公平缺口(severity-equity gap:危重病人的时延劣于轻症的程度)。可测量才可管理。

四、问题解法

三件套架构:

① 自进化 harness(操作手册重写):每个班次结束后,用该班次的 trace 级反馈(哪些指令被偏离、哪些关键动作迟了)重写操作手册(系统提示层),下个班次生效。类比:科室每周末的病例复盘会,把教训写进下周的值班流程——但自动化且每班一次。演化对象是"手册"而非模型:高风险知识不经过梯度,保持可审计的文本形态。

② 外置临床技能库:高风险规程(过敏性休克的一线处置顺序、脓毒症一小时 bundle)以独立技能文件存在,不塞进系统提示。理由:规程变更频率与系统提示不同;独立文件可被临床专家单独审阅签署;按需加载省 token(SkillSeam 的持久梯度原则在医疗域的应用)。

③ 三隔离子 Agent:按病人队列把逐轮决策划分给三个相互隔离的子 Agent。理由:单一 Agent 管理多病人时上下文互相污染(A 病人的药物过敏史干扰 B 病人的用药决策);隔离把每病人的上下文封在独立会话,漂移不跨病人传播。

五、评估指标与实验证据

指标基线Asclepius说明
critical-action correctness—+22%(p=0.024)held-out 批次(演化未见过)
诊断准确率4.39/5保持不降执行改进不以诊断为代价
评判稳健性—5 个 LLM judge × 3 模型家族一致结论非单 judge 偏差

三失效模式的基线量化(问题侧证据):诊断 4.39/5 vs critical-action 2.94/5 vs timeliness 3.34/5——执行差距被三个数字清楚钉住。

证明力分析:held-out 批次设计排除了"手册只是记住了这批病人"的过拟合解释——重写的手册在没见过的病人组合上仍然有效,说明学到的是流程级规律(如"夜班后段复查频率需提高")而非病例记忆。五 judge 三家族的一致性排除了评测器偏差(医疗评分的 LLM judge 可靠性是真实威胁)。p=0.024 在单次 rollout 的医疗模拟语境下是可接受的显著性水平(完美功效需多 rollout,论文坦承此限制)。

六、效果优势的根源解释

根源机制与证据链

  1. 漂移的针对性修复(论文实验已支持):基线的执行差距主要由指令遵循漂移累积(班次后段手册指令被逐渐忽略);手册重写把"被偏离最多的指令"改写为更不易漂移的形式(位置、强调、检查点化)→ critical-action +22% 而诊断不变——改进集中在执行信道。
  2. 隔离切断污染传播(论文实验已支持 + 机制推理):多病人上下文混合时,一个病人的复杂病史作为干扰项降低其他病人关键动作的检索效率;隔离后每会话的干扰负载恒定 → 时延的病人间方差缩小。
  3. 外置技能库的加载选择性(与 SkillSeam/Gavel 证据互证):高风险规程只在相关病人出现时加载,上下文噪声下降 → 手册指令的遵循率上升。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
ModularRSI(同日)harness 自演化(编码域)对比信号+隔离数据有效域不同、演化信号设计不同支持:harness 演化跨域可迁移
Reflexion轨迹反思改进语言反馈促进行为会话内非持久手册支持:文本反馈有效
临床流程的安全研究班次交接与清单清单降低遗漏人类医学实践支持:手册清单化的医学传统
多 Agent 上下文干扰研究上下文污染无关信息降低执行通用域支持:隔离的机制基础
HazardAuditor(同日)执行接地 guard可执行威胁监督安全侧补充:执行监督与执行改进互补

综合判断与未决问题

多研究共同支持:文本层 harness 演化有效(ModularRSI/Reflexion/本文三方);上下文隔离降低干扰(通用研究+本文)。仍属推测:手册重写的长期收敛性——班次次数趋于无穷时手册是否会震荡(改 A 影响 B 再改回 A),论文的多班次分析未覆盖长程。适用边界:模拟器(CES)与真实急诊仍有现实差距(论文自述 simulation-to-reality gap);错误代价极高场景中 +22% 仍意味着 78% 的差距残留,部署门槛远未达到。可能的失效条件:病人构成剧烈变化(如大规模事故)时历史 trace 的指导意义骤降。

七、必要知识反推

领域知识层:急诊临床流程(关键动作的类型学、时延的临床意义——抗生素每延迟一小时死亡率上升的循证);临床安全的清单文化(WHO 手术清单传统)——不懂这些就无法定义 critical-action 集与公平性指标。

方法论知识层:harness 演化的信号设计(trace 级反馈的提取与聚合);模拟器构建(病人到达过程、病情演化的时间模型);LLM judge 的可靠性控制(多 judge 交叉、家族多样化)。

工程知识层:多会话隔离的 Agent 编排(队列分配、状态同步边界);技能库的版本管理(规程变更的临床签核流程嵌入);per-trace 计量(三失效模式的自动计数实现)。

知识融合关键节点:“把临床安全文化翻译成 harness 设计”——清单医学(人类智慧)与 harness 演化(AI 方法)的融合点在于:两者都承认执行层缺陷需要流程级而非知识级修复。没有医学背景就只会想到"提升模型的医学知识",有了这个融合才能定位到手册层。

八、通用性灵感

  1. 认知-执行分离的测量先行:先量化"知道但做不到"的差距(诊断 4.39 vs 执行 2.94),再谈改进——否则改进会错位到知识层(论文证据:三指标分离后执行改进+22% 不动诊断)。推广:个人效能(懂道理 vs 做到的量化日记)、组织管理(战略共识度 vs 执行到位率分开测)。
  2. 流程资产的演化周期:把 SOP/手册从静态文档变成"每班次一复盘"的演化资产(论文证据:手册重写机制)。推广:客服话术手册的周级迭代、运维 runbook 的事故驱动更新。
  3. 干扰隔离的会话设计:并行处理多个"对象"时按对象隔离上下文,防止单对象的复杂度污染其他对象的决策(论文证据:三子 Agent 隔离)。推广:多项目并行的工程团队(每项目独立 war room)、多客户服务的 AI 系统。
  4. 高风险知识的可审计外置:错误代价高的知识保持文本形态独立存放(专家可逐一审阅),不进入不可解释的参数(论文证据:临床技能库设计)。推广:金融合规规则、航空检查单的 LLM 系统集成方式。