论文链接:Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents 发表时间:2026年9月 机构:Harvard Medical School × MIT × OpenAI(医疗场景+方法+模型的重磅三方产学研) 领域标签:cs.AI / Clinical Agent
一、论文背景
长程临床 Agent 是什么:不是回答单个医学问题,而是管理一整段真实工作——急诊科一个班次里持续接诊多位病人、开医嘱、安排检查、根据结果调整处置,在时间与资源双重压力下连续决策数小时。
为什么短程基准看不见这类失败:主流 Agent 基准是"短轨迹单任务"(一次问答/一次操作),成功在轨迹末尾打分。而真实部署是小时级交错多任务,失败模式是累积性的:单个决策都对,整体执行崩坏——比如诊断正确但抗生素晚开了两小时。
执行差距(execution gap):论文用 Clinical Environment Simulator(CES)量化了这个差距:诊断准确率 4.39/5(相当好),但 critical-action 完整度 2.94/5、及时性 3.34/5(危险地低)。知道该做什么 ≠ 做完做及时——这是"认知-执行"的经典分离在 Agent 上的再现。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 医疗 LLM 评测 | MedQA 系、医学基准 | 单轮问答能力 | 无执行维度 |
| 医疗 Agent 系统 | MedAgent 系 | 工具调用辅助诊疗 | 短程、单病人 |
| Harness 自演化 | HarnessEvolve/ModularRSI(同月) | 经验反馈演化脚手架 | 通用编码域 |
| 长程 Agent 失败 | execution gap 类研究 | 长程失败分类 | 通用域 |
| 医疗安全系统 | 临床决策支持系统(CDSS) | 规则化辅助 | 非生成式 |
定位结论:Asclepius 把 harness 自演化技术首次系统应用于高错误代价的临床长程场景——其贡献一半是方法(自进化 harness 三件套),一半是测量(三失效模式的 per-trace 操作化),后者对医疗 Agent 独立有价值。
三、问题定义
具体场景:急诊整班次多病人管理,要求诊断正确且关键动作(用药、升级监护等)完整、及时、公平地执行。
抽象问题:如何把"长程交错任务中的执行质量"从不可测变为可测量、可定位、可改进。
形式化:给定班次 episode(病人流、时间线、资源约束)、动作空间 A、关键动作集 K(每病人),执行质量 Q = f(诊断正确率, K 的覆盖率, K 的时延分布, 时延的病人间公平性);约束:错误代价不对称(漏救»过度处置)。
精妙之处:三失效模式的per-trace 操作化——把模糊的"执行差"翻译成三个可从执行轨迹直接计数的量:指令遵循漂移(instruction-adherence drift:执行与手册的偏离率)、治疗不完整(incompleteness:K 的漏项)、严重度公平缺口(severity-equity gap:危重病人的时延劣于轻症的程度)。可测量才可管理。
四、问题解法
三件套架构:
① 自进化 harness(操作手册重写):每个班次结束后,用该班次的 trace 级反馈(哪些指令被偏离、哪些关键动作迟了)重写操作手册(系统提示层),下个班次生效。类比:科室每周末的病例复盘会,把教训写进下周的值班流程——但自动化且每班一次。演化对象是"手册"而非模型:高风险知识不经过梯度,保持可审计的文本形态。
② 外置临床技能库:高风险规程(过敏性休克的一线处置顺序、脓毒症一小时 bundle)以独立技能文件存在,不塞进系统提示。理由:规程变更频率与系统提示不同;独立文件可被临床专家单独审阅签署;按需加载省 token(SkillSeam 的持久梯度原则在医疗域的应用)。
③ 三隔离子 Agent:按病人队列把逐轮决策划分给三个相互隔离的子 Agent。理由:单一 Agent 管理多病人时上下文互相污染(A 病人的药物过敏史干扰 B 病人的用药决策);隔离把每病人的上下文封在独立会话,漂移不跨病人传播。
五、评估指标与实验证据
| 指标 | 基线 | Asclepius | 说明 |
|---|---|---|---|
| critical-action correctness | — | +22%(p=0.024) | held-out 批次(演化未见过) |
| 诊断准确率 | 4.39/5 | 保持不降 | 执行改进不以诊断为代价 |
| 评判稳健性 | — | 5 个 LLM judge × 3 模型家族一致 | 结论非单 judge 偏差 |
三失效模式的基线量化(问题侧证据):诊断 4.39/5 vs critical-action 2.94/5 vs timeliness 3.34/5——执行差距被三个数字清楚钉住。
证明力分析:held-out 批次设计排除了"手册只是记住了这批病人"的过拟合解释——重写的手册在没见过的病人组合上仍然有效,说明学到的是流程级规律(如"夜班后段复查频率需提高")而非病例记忆。五 judge 三家族的一致性排除了评测器偏差(医疗评分的 LLM judge 可靠性是真实威胁)。p=0.024 在单次 rollout 的医疗模拟语境下是可接受的显著性水平(完美功效需多 rollout,论文坦承此限制)。
六、效果优势的根源解释
根源机制与证据链
- 漂移的针对性修复(论文实验已支持):基线的执行差距主要由指令遵循漂移累积(班次后段手册指令被逐渐忽略);手册重写把"被偏离最多的指令"改写为更不易漂移的形式(位置、强调、检查点化)→ critical-action +22% 而诊断不变——改进集中在执行信道。
- 隔离切断污染传播(论文实验已支持 + 机制推理):多病人上下文混合时,一个病人的复杂病史作为干扰项降低其他病人关键动作的检索效率;隔离后每会话的干扰负载恒定 → 时延的病人间方差缩小。
- 外置技能库的加载选择性(与 SkillSeam/Gavel 证据互证):高风险规程只在相关病人出现时加载,上下文噪声下降 → 手册指令的遵循率上升。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| ModularRSI(同日) | harness 自演化(编码域) | 对比信号+隔离数据有效 | 域不同、演化信号设计不同 | 支持:harness 演化跨域可迁移 |
| Reflexion | 轨迹反思改进 | 语言反馈促进行为 | 会话内非持久手册 | 支持:文本反馈有效 |
| 临床流程的安全研究 | 班次交接与清单 | 清单降低遗漏 | 人类医学实践 | 支持:手册清单化的医学传统 |
| 多 Agent 上下文干扰研究 | 上下文污染 | 无关信息降低执行 | 通用域 | 支持:隔离的机制基础 |
| HazardAuditor(同日) | 执行接地 guard | 可执行威胁监督 | 安全侧 | 补充:执行监督与执行改进互补 |
综合判断与未决问题
多研究共同支持:文本层 harness 演化有效(ModularRSI/Reflexion/本文三方);上下文隔离降低干扰(通用研究+本文)。仍属推测:手册重写的长期收敛性——班次次数趋于无穷时手册是否会震荡(改 A 影响 B 再改回 A),论文的多班次分析未覆盖长程。适用边界:模拟器(CES)与真实急诊仍有现实差距(论文自述 simulation-to-reality gap);错误代价极高场景中 +22% 仍意味着 78% 的差距残留,部署门槛远未达到。可能的失效条件:病人构成剧烈变化(如大规模事故)时历史 trace 的指导意义骤降。
七、必要知识反推
领域知识层:急诊临床流程(关键动作的类型学、时延的临床意义——抗生素每延迟一小时死亡率上升的循证);临床安全的清单文化(WHO 手术清单传统)——不懂这些就无法定义 critical-action 集与公平性指标。
方法论知识层:harness 演化的信号设计(trace 级反馈的提取与聚合);模拟器构建(病人到达过程、病情演化的时间模型);LLM judge 的可靠性控制(多 judge 交叉、家族多样化)。
工程知识层:多会话隔离的 Agent 编排(队列分配、状态同步边界);技能库的版本管理(规程变更的临床签核流程嵌入);per-trace 计量(三失效模式的自动计数实现)。
知识融合关键节点:“把临床安全文化翻译成 harness 设计”——清单医学(人类智慧)与 harness 演化(AI 方法)的融合点在于:两者都承认执行层缺陷需要流程级而非知识级修复。没有医学背景就只会想到"提升模型的医学知识",有了这个融合才能定位到手册层。
八、通用性灵感
- 认知-执行分离的测量先行:先量化"知道但做不到"的差距(诊断 4.39 vs 执行 2.94),再谈改进——否则改进会错位到知识层(论文证据:三指标分离后执行改进+22% 不动诊断)。推广:个人效能(懂道理 vs 做到的量化日记)、组织管理(战略共识度 vs 执行到位率分开测)。
- 流程资产的演化周期:把 SOP/手册从静态文档变成"每班次一复盘"的演化资产(论文证据:手册重写机制)。推广:客服话术手册的周级迭代、运维 runbook 的事故驱动更新。
- 干扰隔离的会话设计:并行处理多个"对象"时按对象隔离上下文,防止单对象的复杂度污染其他对象的决策(论文证据:三子 Agent 隔离)。推广:多项目并行的工程团队(每项目独立 war room)、多客户服务的 AI 系统。
- 高风险知识的可审计外置:错误代价高的知识保持文本形态独立存放(专家可逐一审阅),不进入不可解释的参数(论文证据:临床技能库设计)。推广:金融合规规则、航空检查单的 LLM 系统集成方式。