论文链接:Agentic AI for operating scientific instruments for nanoscale characterization 代码仓库:Open-SPM/Agentic_AFM(仪器控制库 Open-SPM/RePySPM) 发表时间:2026年8月 机构:EPFL(瑞士洛桑联邦理工学院)生物与纳米仪器实验室,单一高校 领域标签:科学仪器自动化 · MCP 工具调用

一、论文背景

1.1 原子力显微镜:一台需要"手感"的仪器

原子力显微镜(AFM)是纳米尺度表征的核心工具,原理可以类比"用手指摸盲文":一根安装在微悬臂上的尖锐探针在样品表面逐行扫描,针尖与原子间的作用力使悬臂偏转,激光照射悬臂背面并反射到光电探测器上,偏转量被实时读出。一个反馈回路根据偏转误差不断调整针尖的 z 向高度,使针尖始终贴着表面起伏"滑行",最终把逐行的高度数据拼成一张纳米地形图。

问题在于,这张地形图的质量高度依赖操作员的持续判断。反馈增益太小,针尖跟不上陡峭台阶,会在下降沿"坠落"后弹起,扫出被拉长的假条纹(parachuting,降落伞效应);增益太大,反馈回路进入振荡,图像出现规则波纹(feedback ringing,反馈振铃)。此外还有压电滞回、蠕变、双针尖、丢失表面等十余类伪影。参数之间还互相耦合:提高积分增益改善跟踪却可能引入振铃;降低 setpoint(针尖压力相关)能压住降落伞效应但有损伤针尖和样品的风险;放慢扫描速度提高质量却牺牲通量。同一台 AFM,换一个针尖、换一个样品、甚至只是热漂移推进,最优参数组合就变了——这就是为什么 AFM 培训动辄数月,熟练操作员成了稀缺资源。

1.2 现有自动化为什么不够

此前的自动化尝试分三类,但都只覆盖工作流的一段:

  • 硬编码例程:写死的采集脚本,遇到非预期状态就失效;
  • 任务专用控制器/优化器:如用遗传算法优化 PID 参数,需要一个预先定义的标量目标函数(如 trace-retrace 相似度),只能优化"设计者想到的量";
  • 训练出的机器学习模型:按样品/模式训练,迁移能力弱,仪器软件一升级就要重训。

共同缺口在于:把"看图判断质量、决定下一步调什么"这件人类专家做的事自动化。这个环节需要综合高度图、误差图、扫描线形态和多类伪影的权衡,很难写成一个单一的目标函数——恰好是多模态大模型擅长、传统自动化做不了的事。

1.3 LLM 上仪器:两条路线之争

用 LLM 操作仪器有两条技术路线:

  1. 微调路线:拿仪器专属的"指令-命令"数据对微调模型(如 GPT-4.1),让它直接生成命令文本。问题:仪器知识被烙进模型权重——软件升级、换基座模型都要重新标注重训;更危险的是,微调只保证输出"语法像命令",不保证"物理上合理",错误会静默执行到硬件上。
  2. 工具增强路线:给通用模型一个结构化工具接口,让它在运行时"选工具、填参数"。模型只负责意图理解,单位定义、必填参数、合法取值由外部接口强制校验。工具描述几小时就能写完,换模型无需重训。

实现工具增强的关键标准是 MCP(Model Context Protocol,模型上下文协议)——可类比为"AI 应用的 USB 接口":服务器把一组函数注册成带名称、参数 schema 和描述的"工具",LLM 客户端按需调用。它让"模型"与"仪器能力"解耦,仪器更新只需重新生成工具注册表。

前序工作 Mandal 等的 AILA 是最全面的 LLM 操作 AFM 演示:LLM 负责解释任务,调参却外包给遗传算法,最佳模型任务成功率约 65%,且明确报告了歧义指令会导致错误命令——安全问题没有解决。本文正是在这条线上推进:LLM 能不能自己看图、自己调参,并且一条错误命令都不发到硬件上?

二、论文定位和关联工作

2.1 研究谱系

谱系一:显微镜自动化 / 自主 SPM。传统 ML 用于 X 射线、光学、电子显微镜的自动采集与重建;扫描探针领域有主动学习选测量位置、假设学习区分物理模型、reward 驱动调参、自动图像质量评估与针尖状态调整等。这些方法强大前提是实验目标能被量化表达;本文定位是互补——当决策取决于多个难以合成单一目标的图像特征时,用 LLM 综合判断。

谱系二:LLM 操作仪器。微调路线(直接生成命令)与工具增强路线(MCP 结构化访问)之争是本文的核心对照。AILA(Mandal et al.)用 LangChain 编排 + 遗传算法外部调参,是本文最直接的对照物。

谱系三:实验室自动化 / 自主实验。自驾驶实验室(self-driving lab)追求端到端自主,本文刻意退一步:agentic operation(代理化操作)而非 self-driving lab——实验意图留给人类,执行、调参、后处理交给 Agent。

2.2 定位对比

维度微调路线(FT-GPT)外部优化器(AILA/遗传算法)本文(MCP 三 Agent)
命令知识存哪模型权重外部控制器工具注册表(可再生成)
换模型/升级重新微调重写控制器只换模型或重跑发现脚本
图像评估无标量目标函数LLM 视觉多通道综合
歧义防护无无执行前歧义检查层
实测错误率23.3%–28.4%任务成功率约 65%0.0%

定位结论:本文不是"第一个把 LLM 接到 AFM",而是第一个证明(a)LLM 视觉可以替代标量目标函数做图像质量评估与调参决策、(b)安全性主要来自架构层(工具+歧义检查)而非模型能力、(c)该框架无需任何 AFM 专属训练即可跨样品跨模式工作的系统工作。

三、问题定义

3.1 从具体场景到抽象问题

具体问题:如何让 LLM 安全地操作 AFM 全部可执行工作流?拆开看隐含三个子问题:

  1. 翻译可靠性:自然语言 → 仪器命令,一条都不能错(错命令可能撞针、划伤样品);
  2. 调参智能性:图像 → 质量判断 → 参数更新,需要像专家一样权衡多参数耦合;
  3. 泛化性:不重训就跨样品、跨成像模式工作。

核心洞察(深层结构相似性):AFM 操作员的"可执行工作流"本质上是一个信息完备性受限的多目标序贯决策问题——指令信息不全就不能行动(安全性),图像质量是多维伪影向量的函数而非标量(智能性),而专家知识是通用的而非按样品记忆的(泛化性)。论文的关键抽象是职责切分:

人类保留意图(intent),Agent 接管执行(execution):命令执行 = 可校验的符号翻译问题;调参 = 有安全边界的有界序贯决策;后处理 = 预批准操作集内的选择问题。

3.2 形式化

  • 命令执行:给定自然语言指令 x 与工具注册表 T = {(nameᵢ, schemaᵢ, unitᵢ)},输出工具选择与参数填充 (t, θ);约束:若 x 信息不充分(缺值/单位不清/轴不明/意图模糊),必须返回澄清请求而非执行;
  • 调参:给定当前参数 p 与多通道观测(前/后向高度图、误差图、最近 10 条扫描线),输出伪影严重度向量 s ∈ [0,1]⁶ 与有界参数更新 Δp(受操作员定义的 scan-rate 上限、最小 setpoint、参数优先级约束);
  • 后处理:给定图像与预批准透明操作集,输出诊断与操作序列,禁止无约束图像修改。

精妙之处:把"安全"从模型能力问题改写为架构约束问题——不是要求模型永不犯错,而是让"模型可能犯的错"在到达硬件前被系统性拦截。

四、问题解法

4.1 总体架构:三个 MCP Agent + 一层安全网

论文把 AFM 操作分解为三个独立可测试的 MCP Agent,人始终保留在环上:

Agent角色输入输出
AFM Messenger命令翻译与执行自然语言指令经校验的仪器命令 / 澄清请求
AFM Pilot闭环调参多通道图像+扫描线+当前参数伪影评分+有界参数更新
AFM Doctor伪影诊断后处理最终图像诊断报告+透明处理操作序列

4.2 AFM Messenger:自动生成的 129 工具注册表

一个**发现脚本(discovery script)**扫描 RePySPM(实验室自研的开源 AFM Python 控制库)API,把每个公共方法自动转成一个 MCP 工具,包含模块名、函数名、参数与单位信息,存入 JSON 注册表经 FastMCP 加载——共 129 个工具,零手工逐个编写。仪器软件更新时重跑一遍脚本即可再生成注册表,模型完全不用动。这相当于给 LLM 一本"自动生成的仪器操作手册"。

**歧义检查层(ambiguity check layer)**是安全核心:在执行前检查指令是否包含足够信息,识别四类问题——缺失数值、单位不确定、轴方向不明、意图模糊。有歧义就退回操作员澄清(MCP 交互式工作流允许在同一会话内补全信息后继续),确认后才执行。规则还区分 SET/GET 操作、把共享参数(如 setpoint)路由到正确模块、强制单位换算、分离参数配置与扫描启动;进针(approach)和启动扫描这类安全关键动作需要额外确认。

4.3 AFM Pilot:用 LLM 视觉替代目标函数

Pilot 运行一个闭环:拉取最近一次参数更新后的前向/后向高度与误差数据 → 渲染诊断视图(含最近 10 条前/后向扫描线,用于评估行间跟踪与振铃)→ LLM 视觉评估六类伪影(降落伞效应、反馈振铃、滞回、蠕变、双针尖、丢失表面跟踪)各打 0–1 严重度分 → 在预定义安全边界内有界更新 setpoint / 积分增益 / 扫描速度 → 循环,直到"允许参数空间内好到不能更好"。

严重度评分是模型的"判断"而非计算量,含义由提示词中的语言锚点固定:0.0 无伪影、0.1–0.3 轻微、0.4–0.6 明显可见、0.7–1.0 严重。可接受阈值(parachuting ≤0.35、ringing ≤0.25)由专家视觉评估标定。参数间的耦合关系与安全约束(扫描速度上限、最小 setpoint、参数优先级)以操作指令形式写进提示词,LLM 据当前状态选择有界调整——这本质上是把人类专家的调参启发式"升增益到振铃、退一点、再压 setpoint"显式化后交给 LLM 执行。

关键设计:没有目标函数、没有外部优化器。论文用 LLM 的通用科学视觉知识直接评估图像,这正是跨样品零重训泛化的来源(见第六部分)。

并行确定性交叉校验:一个 Python 数值检测器从扫描线数组直接计算 parachuting/ringing/hysteresis 三类伪影的独立严重度(分别基于边缘梯度+前后向不对称、频谱高分频功率占比、前后向互相关滞后)。它不参与调参决策,只做交叉校验——AI 评分与数值评分差异超过 50% 就触发 LLM 重新检查数据。这是"概率判断 + 确定性仪表盘"的双保险。

4.4 AFM Doctor:预批准工具箱里的透明后处理

Doctor 检查最终图像,识别残留伪影、解释物理成因,然后从一个预批准的透明处理工具集(平面校平、行对齐、疤痕去除、裁剪、背景扣除、FFT 去条纹、导出 Gwyddion 文件等)中选择操作。每步处理后重新检视,可级联修正。限定透明工具集防止了无约束图像篡改、避免引入未经证实的"伪伪影"。校正用的行偏移与多项式背景只从掩膜后的平坦背景区域估计,不被表面形貌带偏。

五、评估指标与实验证据

5.1 评估体系

主指标:命令错误率——模型输出与预期函数调用/工具选择精确匹配(temperature=0)的失败比例。这是核心论点"架构层保障安全"的直接度量。辅助指标:错误构成分类(单位/数值错误、歧义/信息缺失、工具/模块选错等)、与人类专家对比的四项终点。消融指标:±工具访问、±歧义检查层的阶梯对比,直接分解两个架构组件的贡献。

5.2 基准:2747 场景

有经验 AFM 用户手写 234 条指令并配对 RePySPM 调用,扩展筛选为 2747 个场景(真实操作会话 + 罕用功能的合成例子,覆盖单条/连续命令、单位与数值变体、欠指定请求),按 76/8/8/8 划分,取三个固定测试集(225/200/224 条),所有配置跑三遍报均值±标准差。这个基准的设计直指安全要害:故意混入欠指定请求,考验系统能否"不知为不知"地退回澄清而不是硬猜。

5.3 核心结果

错误率阶梯(表):

配置错误率降幅来源
裸 Claude Sonnet 4.6(直接生成命令)89.2 ± 0.7%—
FT-GPT(微调 GPT-4.1 文本生成)28.4 ± 1.5%权重记忆
FT-GPT-FC(微调+函数调用)23.3 ± 0.7%+结构化工具
Sonnet 4.6 + 工具25.1 ± 1.1%+结构化工具(无微调)
FT-GPT-FC + 歧义检查8.9 ± 0.4%+执行前拦截
Opus 4.8 + 工具6.4 ± 1.6%更强基座模型
Sonnet 4.6 + 工具 + AC4.8 ± 0.9%+执行前拦截
Opus 4.8 + 工具 + AC2.3 ± 0.7%+执行前拦截
Sonnet/Opus + MCP + 歧义检查(交互式)0.0 ± 0.0%+同会话人机澄清

统计显著性:工具访问对所有模型 P<0.0001;歧义检查对 Sonnet/FT-GPT P<0.0001、对 Opus P<0.01。

值得注意的是裸 Sonnet 的 89.2% 错误率说明直接让 LLM 背命令格式完全不可行,而错误构成分析揭示了各配置的失败模式差异:FT-GPT/FT-GPT-FC 的错误 79.3%/78.2% 是单位/数值错误;工具化 Sonnet 的残余错误 64.9% 是歧义/信息缺失(单位/数值错误只剩 1.8%);工具化 Opus 残余错误以工具/模块选择为主(64.3%)。每种配置死法不同——这直接指导了两层防护的设计。

部署形态的 Claude-MCP 交互式 Agent 命令画像:150 条请求中 73.3% 直接执行、22.7% 退回澄清、4.0% 报告无对应工具——没有一条被路由到错误工具。

与人类专家对比:5 名操作员 vs AFM Pilot,相同失调起点、相同可调参数(限定 setpoint + 积分增益)、相同质量标准,Wilcoxon 符号秩检验四项终点均无显著差异:迭代次数 p=0.063、调参时间 p=0.625、最终 parachuting 严重度 p=1.000、最终 ringing 严重度 p=0.188。方向上 Pilot 迭代更少、最终振铃更低,人类略快、最终降落伞更低——但都收敛到可接受状态。

泛化与成本:同一套策略零重训覆盖校准光栅、蝴蝶翅、胶原纤维、KPFM 金铝光栅(保持 KPFM 专用 PID 固定,仅提供 KPFM 通道供综合评估)等多种样品与模式;10 次迭代会话约 95% 输入 token 由 prompt cache 命中(缓存价格 0.1 倍)。

5.4 实验设计如何支撑论点

阶梯设计逐层分解贡献:裸模型→+工具隔离"结构化接口"的价值(降 60+ 个百分点);+工具→+AC 隔离"执行前拦截"的价值(再降 16–20 个百分点);最终交互式 MCP 补上"人补全信息"这最后一环达成零错误。若只有总对比(裸 vs 完整系统),无法区分是模型强还是架构好;阶梯让每个架构组件的贡献可归因。错误构成分析则进一步把"AC 为什么有效"落到机制:欠指定的指令不只产生歧义错误,还会诱发单位/数值错误,提前拦下就不止消灭歧义类错误。

六、效果优势的根源解释

6.1 错误归零的因果链

对比对象:微调路线曾经有效,因为它把命令语法烙进权重,输出"看起来像命令";但它有不可逾越的障碍——权重记忆只能记忆统计规律,无法保证物理合理性(单位该是 V 还是 mV、数值该在什么安全范围),且这份记忆随软件升级过期。

因果链一(工具接口消除单位/数值错误):

方法差异:129 工具的 schema 强制(名称+参数+单位+模块路由)→ 机制变化:单位与参数校验从"模型权重内的概率回忆"移出到"接口层的确定性强制"→ 指标体现:FT 系模型 79.3%/78.2% 的单位/数值错误占比,在工具化 Sonnet 中压到 1.8%。

权重是概率性的,schema 是确定性的。当"单位必须显式填对"变成接口约束而非生成偏好,一整类错误就从错误分布里结构性消失了。

因果链二(歧义检查层消除歧义错误):

方法差异:执行前的歧义检查层 + 交互式澄清 → 机制变化:不确定的指令不再被"硬猜成某个命令"而是被拦截退回人类补全 → 指标体现:残余错误中 64.9% 的歧义/信息缺失类被提前消灭;且欠指定还会诱发单位/数值错误,所以降幅(16–20 个百分点)大于初始歧义错误占比。

这条链的关键是把错误的发生位置从"执行后"移到"执行前"。LLM 天然倾向给任何输入一个答案(不知为知之);歧义检查层的作用不是让 LLM 变得永不犯错,而是不让不确定性变成硬件动作——错一条命令的成本从"重跑实验"变成"多问一句话"。

因果链三(LLM 视觉替代标量目标函数→跨域泛化):

方法差异:AI-vision 综合评估前/后向高度图、误差图、扫描线、多伪影严重度 vs 遗传算法最大化单一 trace-retrace 相似度 → 机制变化:调参决策不再压缩成单一标量(必然丢弃未被目标函数编码的特征),而是像人类专家那样同时权衡跟踪质量、反馈稳定性与参数耦合 → 指标体现:同一策略零重训跨校准光栅/蝴蝶翅/胶原/KPFM 四类样品模式工作,调参表现与 5 名专家无显著差异。

标量目标函数"只测它被设计去测的量",换样品/模式往往要重设目标甚至重训;LLM 的通用科学视觉知识是样品无关的,这就是泛化免费的原因。反事实:若去掉 LLM 视觉改回标量目标,框架就退回 AILA 类系统——任务成功率约 65% 且需外部优化器;若去掉歧义检查层,Sonnet+工具停在 25.1%,错误主要来自欠指定请求的硬猜。两个组件的必要性都被消融数据直接证明。

6.2 一句话总结根源

安全性来自架构(确定性 schema + 执行前拦截 + 人机澄清),智能性来自模型的通用知识(视觉评估+参数权衡),两者正交组合让"零错误"与"跨域泛化"同时成立——而不是靠一个更强的模型硬扛。

七、必要知识反推

假设一个完全外行要复现这项工作,最少需要知道什么?

7.1 领域知识层(AFM 与扫描探针)

  • AFM 成像物理:悬臂-针尖-反馈回路的工作机制,高度/误差双通道含义,前/后向扫描的差异——不知道这些就无法设计诊断视图,也无法理解为什么"最近 10 条扫描线"能暴露行间跟踪问题。
  • 伪影分类学与成因:parachuting(反馈跟不上陡沿)、ringing(增益越过稳定裕度)、hysteresis/creep(压电非线性)、双针尖等——这是 AI-vision 评分维度、确定性检测器设计、Doctor 处理工具集三者的共同 vocabulary。不理解成因,就无法把"振铃了"翻译成"降积分增益"。
  • 调参启发式与安全边界:专家的"升增益到振铃、退一点、压 setpoint"循环、setpoint 下限(保护针尖)、扫描速度上限——这些必须显式写进 Agent 提示词,是 LLM 决策的围栏。

7.2 方法论知识层(LLM 与 Agent 工程)

  • 微调 vs 工具增强的取舍分析:知道微调把知识烙进权重带来的重训与静默错误问题,才会选择 MCP 路线。
  • MCP 协议与工具注册表设计:schema、FastMCP 加载、会话内记忆保持——三 Agent 架构的地基。
  • 错误分类学驱动的防护设计:先跑基准拿到错误构成(79% 单位错误 vs 65% 歧义错误),再针对性设计防护层——“先测量、后设计"的方法论。

7.3 工程知识层

  • 仪器 API 自动发现:写脚本扫描 RePySPM 生成 129 工具注册表,而不是手写——可维护性的关键。
  • 确定性数值检测器:边缘梯度+前后向不对称、频谱功率、互相关滞后等经典伪影量化方法(分别继承自 Kubo、Kohl、Chu 等的前序技术),作为 AI 评分的独立仪表盘。
  • 评估设计:2747 场景基准构建、三测试集、temperature=0 精确匹配、错误人工分类;Wilcoxon 符号秩检验配对比较人类与 AI;prompt cache 成本控制。

7.4 知识融合的关键节点

  • 融合点一:错误画像 → 防护架构。把"微调模型死于单位、工具模型死于歧义"的实证发现,翻译成"schema 强制 + 歧义拦截"的双层设计——领域错误分类学与 LLM 工程在这里化学反应。
  • 融合点二:专家调参循环 → LLM 提示词约束。把数十年的 AFM 操作经验(参数耦合、安全边界、停止准则)编码为操作指令,让 LLM 在围栏内做专家级权衡——隐性专家知识第一次显式化为 Agent 约束。
  • 融合点三:概率判断 + 确定性校验的双模评估。AI-vision 负责决策、Python 检测器负责审计、50% 分歧触发复查——两个认识论上互补的组件(通用但概率性 vs 狭窄但确定性)组合出可信系统。

八、论文中可以提取的通用性灵感

灵感一:安全来自架构,不来自模型

核心思想:对物理世界执行任务的 Agent,可靠性应通过"确定性接口 + 执行前校验 + 交互式澄清"分层保障,而不是指望模型本身不犯错。

论文证据:同一个 Sonnet 4.6,裸模型错误率 89.2%,加结构化工具降到 25.1%,加歧义检查降到 4.8%,交互式 MCP 澄清后归零——模型一个字没变,架构三层递进。

推广场景:(1) 工业机器人/数控机床的自然语言控制(错命令=撞机);(2) 数据库运维 Agent(DROP/DELETE 前的歧义确认);(3) 医疗设备操作助手;(4) 金融交易指令的 AI 代理执行;(5) 云基础设施变更管理(Runbook 执行前 schema 校验)。

灵感二:错误分类学先行,防护对症下药

核心思想:设计防护机制前先做错误构成分析——不同模型/配置的死法不同,防护层应针对主导错误类型设计,且错误类型会随架构迁移(消掉一类,另一类浮上来成为新主导)。

论文证据:FT 模型 79% 单位错误→用 schema 治;工具化 Sonnet 65% 歧义错误→用 AC 治;Opus 残余主要是工具选择错误。每一步防护都精确对应上一轮诊断。

推广场景:(1) Agent 系统的阶段性失败分析驱动迭代;(2) LLM 应用的回归测试分类体系;(3) 任何"先测量再优化"的可靠性工程。

灵感三:通用知识替代任务专用目标函数

核心思想:当任务质量是多维特征的综合权衡、难以压缩成单一标量目标时,用 LLM 的通用知识做直接评估,可以免去按任务定目标函数、按任务重训的成本,获得免费跨域泛化。

论文证据:LLM 视觉同时权衡高度图/误差图/扫描线/六类伪影,同一策略零重训跨四类样品与成像模式;对照 AILA 的遗传算法只能优化 trace-retrace 相似度这一设计者预设的量。

推广场景:(1) 通用代码/文档审查 Agent(质量是多维的);(2) 实验通用性评估(色谱、质谱、电镜的"图谱好不好”);(3) UI/UX 自动评估;(4) 材料合成条件的多目标权衡。

灵感四:概率判断配确定性仪表盘

核心思想:让 LLM 做决策、让确定性程序做独立审计,分歧超阈值触发复查——通用性与可复现性互补。

论文证据:AI-vision 驱动调参,Python 检测器并行打分,差异 >50% 触发 LLM 重查;严重度评分用语言锚点固定语义,专家标定阈值。

推广场景:(1) 医疗影像 AI 的第二读片系统;(2) 自动驾驶的规则兜底;(3) 金融风控中模型分+规则分的双通道;(4) 任何需要可解释审计轨迹的高风险自动化。

灵感五:职责切分——人类管意图,Agent 管执行

核心思想:“agentic operation 而非 self-driving lab”:把决策权分层,意图层留人类、执行层给 Agent,既降低安全风险也降低了验证负担(执行层可以独立基准测试)。

论文证据:三 Agent 各自独立可测试(Messenger 用 2747 场景基准、Pilot 用人类对比实验、Doctor 用人类参照处理);论文明确拒绝端到端自主叙事。

推广场景:(1) 自动驾驶的接管设计;(2) AI 科研助手的边界划分(人定假设、AI 跑实验);(3) DevOps 的审批流(AI 提变更、人批准);(4) 具身智能的技能授权边界。

灵感六:API 自动发现生成工具层

核心思想:从现有代码库的 API 自动扫描生成 LLM 工具注册表,让"AI 接入老系统"的成本从手写工具降为跑一遍脚本,系统升级时注册表随代码自动同步。

论文证据:发现脚本扫描 RePySPM 生成 129 个 MCP 工具(含单位信息),仪器更新重跑脚本即可,无需重训模型。

推广场景:(1) 企业遗留系统的 AI 化改造(ERP/MES API 扫描);(2) 开源软件的 AI 助手自动生成(如给 Gwyddion、ImageMagick 全 API 生成工具层);(3) 测试框架的命令生成;(4) 多仪器实验室的统一 AI 接入层。

附录:一图看懂系统

人类操作员(保留实验意图)
    │ 自然语言指令
    ▼
┌─────────────────────────────────────────┐
│ AFM Messenger(MCP)                     │
│  · 129 工具注册表(RePySPM 自动发现)     │
│  · 歧义检查层:缺值/单位不清/轴不明/意图   │
│    模糊 → 退回澄清,确认后才执行          │
└───────────────┬─────────────────────────┘
                │ 经校验命令
                ▼
           真实 AFM 硬件 ──► 高度/误差数据
                │                  │
                │                  ▼
                │   ┌──────────────────────────────┐
                │   │ AFM Pilot(闭环调参)          │
                │   │  · AI-vision 六类伪影 0–1 评分 │
                │   │  · 有界更新 setpoint/增益/速度 │
                │   │  · Python 确定性检测器交叉校验  │
                │   └──────────────┬───────────────┘
                │                  │ 最终图像
                │                  ▼
                │   ┌──────────────────────────────┐
                │   │ AFM Doctor(后处理)           │
                │   │  · 预批准透明工具集内选择       │
                │   │  · 诊断 + 级联修正 + 报告       │
                │   └──────────────────────────────┘

关键数字速查:错误率阶梯 89.2% → 25.1% → 4.8% → 0.0%;2747 场景基准;129 个 MCP 工具;vs 5 名人类操作员四项终点 p=0.063–1.000;95% prompt cache 命中率。