论文链接:https://arxiv.org/abs/2608.28027 代码仓库:https://github.com/string-os(运行时)与 https://github.com/string-os/apps(应用仓库) 发表时间:2026 年 8 月(arXiv v1,cs.AI) 机构:首尔国立大学 + H1R.AI(企业+高校合作;一作 Jookyung Song 为 SNU 学生身份与 H1R.AI 双属,通讯作者 Nojun Kwak 属 SNU、Simyung Chang 属 H1R.AI) 领域标签:Agent 基础设施 / Agent-Computer Interface / 操作系统

一、论文背景

LLM Agent 已经能干很多事:写代码、订机票、处理 PDF、运营新闻站。但论文开篇点出一个被普遍忽视的事实:Agent 是一种全新的软件用户,却没有任何一个界面是为它设计的。

看看 Agent 现在的处境。它要用网页,就得面对为人类眼睛设计的 HTML/CSS——人眼可以扫一眼就忽略广告和导航栏,Agent 却要把这些全部读进上下文、逐 token 付费,还要再读一遍、再付一遍,每一轮都是如此。它要用工具,就得面对 JSON schema——这些为程序设计的接口定义不管当下用不用得上都常驻上下文。论文给这种负担起了个名字:认知负载(cognitive load),借自人类认知心理学的经典概念——Sweller 的认知负载理论与 Miller 的『神奇数字七』。对模型来说,这表现为已被文献记录的干扰效应、长度效应与位置效应(lost in the middle、无关上下文分心等),而且小模型受影响最重。

当前的主流方案各有各的问题。Function calling 与 MCP 标准化了能力『连接』的方式,但把能力描述留在上下文里常驻,每接入一个新工具,账单就涨一截,而上下文预算并不会跟着涨。工具检索(tool retrieval)缩小了常驻集合,但保留了 schema 契约本身。Skill 库(如 Anthropic 的 Agent Skills)把程序性知识打包成了文档,但仍然假设 Agent 自己去读懂并实现——把散文翻译成代码这件事还是模型在做。人类早就解决过同款问题:操作系统和浏览器把复杂性吸收进一个统一层,所以一个人可以用几千个应用而不必学习任何线缆格式。Agent-Computer Interface(ACI)研究(SWE-agent)也证明性能强烈依赖给 Agent 的界面。但这个层对 Agent 而言还不存在——Agent 还活在『操作系统诞生之前』的时代:原始手册、一次性集成、模型与万物之间没有公共物。

String 就是冲着这个层去的。它押了两个宝:其一,接口应该是文档格式而不是协议——SFMD 是 CommonMark 的严格超集,一个 Markdown 文件声明视图、导航与类型化动作,文件即应用、复制即安装;其二,节约 Agent 的上下文是运行时的工作而非 Agent 自己的。这两个赌注合起来,就是把『给 Agent 造操作系统』当成一个正当的研究问题。

二、论文定位和关联工作

论文的相关工作地图分五条线,String 在每条线的延长线上又都拐了个弯。

工具接口线:Function calling、Toolformer、Gorilla、ReAct、MCP 标准化了能力的连接,但描述常驻上下文(O(n) 每轮);工具检索工作(ToolLLM、Re-Invoke、tool retrieval 基准)缩小常驻集合却保留 schema 契约;Agent Skills / Voyager 的技能库打包了程序但假设执行环境在 Agent 侧。String 的差异:把 schema 契约整个换成渲染页面——能力描述不再驻留,而是按需渲染成 Markdown 视图。

Agent-Computer Interface 线:SWE-agent 证明界面本身能撬动性能,可执行代码动作(executable code actions)表明换一种动作表达就有效果;WebArena、Mind2Web、OSWorld 则记录了人类界面(网页、桌面 GUI)对 Agent 有多敌意。String 把 ACI 思想从『给某个 Agent 配一个好界面』泛化为一个通用运行时,并让网站能直接把 Agent 原生界面发给 Agent(而不是靠 Agent 去适配人类界面)。

OS 启发系统线:AIOS 与 MemGPT 把 OS 想法带进 serving 栈内部(调度、内存管理);String 标准化的是外侧——Agent 与外部世界之间的接口层。方向相反,互补而非竞争。

HCI 与系统先例线:渐进披露与『识别优于回忆』(Norman《设计心理学》)、直接操纵、信息觅食理论、认知负载管理——这些给人机交互设计的经典原则,在 String 里被『为机器用户重演』。统一表面的血统则可追溯到 REST 与 Unix 的一切皆文件。

基准线:SkillsBench(87 个实践者任务、八个领域、每任务配精选技能)证明了『文档写得好,成功率高』。String 直接在它的地基上做实验:把精选技能运行时化为 String 应用。

维度之前的路线本论文的突破
能力交付schema/手册常驻上下文,O(n) 每轮运行时按需渲染单一视图,O(1) 常驻 53 token
程序性知识散文 + 示例代码,Agent 每任务重打一遍作者提供可调用签名,运行时执行
接口形态协议(MCP 工具列表)文档格式(SFMD),文件即应用
覆盖范围每站点/每工具单独集成一个语法横跨应用、文件、shell、网页乃至旧 HTML
安全模型依赖 Agent 自律或人工审查特权跟随来源:本地可 shell、远程仅 HTTP

定位结论:String 是 ACI 研究与 OS 传统的一次合流——不是又一个 Agent 框架,而是主张『Agent 的界面层应该长成文档渲染纪律』的基础设施论文。

三、问题定义

论文面对的具体场景:Agent 的能力面在错误的层被组装——每种能力都以描述形式驻进上下文收费,Agent 还得自己持有、比对、重新推导每个可能用到的工具的操作知识。

核心洞察——深层结构相似性:作者看到 Agent 的处境与 1970 年代面对几千个程序的人类用户同构。人来靠操作系统抽象掉了线缆格式,靠浏览器抽象掉了 HTML;Agent 需要同款抽象,但有一个关键不同:Agent 的『感知』就是上下文本身。人类的注意力可以跳过页面上无用的部分,Agent 的注意力等于它付费读入的一切。所以这个抽象层的目标函数与人类 OS 不同——它必须把『节约上下文』当作第一公理。

类比对应表:

深度学习/经典系统概念String 中的对应物
进程/地址空间Topic(每话题文档、历史、变量、串行执行)
系统调用接口约 20 个斜杠动词;MCP 上单工具 {topic, cmd}
文件系统与分页SFMD 文档块可寻址、部分视图
IPCWebhook 收件箱(只追加消息、显式确认)
包管理器/install 原子暂存、(namespace, name) 身份
权限模型来源边界:本地 shell+HTTP;远程仅 HTTP
凭证库每应用作用域环境变量;仅在作者位置展开

形式化的问题定义:给定一个随集成数量 n 增长的能力目录与固定的上下文预算 W,设计一个运行时 R 与文档语法 G,使得 (1) 常驻接口开销为 O(1) 而非 O(n);(2) 任意能力的全量细节保持可寻址(不必驻留即可访问);(3) 能力在决策点的呈现顺序与时机可控(分阶段披露);(4) 特权与机密由运行时强制隔离,不依赖 Agent 自律。约束:Agent 是已部署的冻结模型,不能指望它在运行时学会新语法。

这个抽象的精妙之处在于把『上下文经济』从 Agent 的责任翻转成运行时的责任(P1),并把『能力的呈现』当成渲染问题而非协议问题——一旦能力呈现变成渲染,渐进披露、按需加载这些 HCI 的成熟工具箱就全部可以搬过来用。

四、问题解法

String 的解法是一个 17.8k 行 TypeScript 的开源运行时加一套文档语法,围绕四条设计原则展开。

4.1 SFMD:可执行 Markdown 即应用(P3)

类比:SFMD 之于 Agent 应用,就像 HTML 之于网页——一个声明式文档声明全部行为。但比 HTML 更进一步:它是 CommonMark 的严格超集,六种扩展构造(YAML front-matter、可寻址的 HTML 注释块、指令、快捷方式、动作围栏代码块、变量)每一种都映射到已有的 Markdown 产物,所以任何普通 Markdown 阅读器都能正常显示 SFMD 文件。

动作块声明动词(五种 HTTP 方法或 CLI)、端点或 shell 模板、带别名与默认值的类型化参数。响应模板(act..response 块)把原始结果重整为 Markdown,并可绑定值快捷方式——一个长标识符坍缩成 @post-3 这样的一 token 地址。

关键设计:零新语法。已部署的模型没法在运行时学新表面语法——任何超出预训练分布的东西都得在上下文里拼出来,而且每个 session 都要再来一遍。所以 Agent 读的是预训练规模吸收过的纯 Markdown,写的是同样吸收过的 Unix shell 约定:斜杠动词、-flag value 短别名、位置参数、-help、shell 风格变量。语法面刻意保持极小:/open、/act、/info 加少量导航/状态/编辑/包管理动词。那个著名的 53 token 常驻存根只需要给这套语法命名,不需要教它——因为语法本身已经是模型的母语。

4.2 部分披露作为渲染纪律(P1)

类比:这就是 HCI 的渐进披露与『识别优于回忆』为机器用户的重演。Agent 不需要在上下文里『持有』信息才能访问它——它只需要一个地址。

四条具体规则:

  • URL 隐藏:URL 是给运行时解引用的,不是给模型背的。链接渲染成 [@id Label] → [Label][@id],导航用 /open @id——任何 URL 都不进上下文。
  • Schema 隐藏:动作的方法、端点、头部只在调用瞬间重要。视图只列动作名,完整 schema 出现在 -help 上,实现块整个从正文剥离。
  • 基于地址的部分读取:/open doc#block 渲染单个区域(显式标记、标题 ID 或标题 slug 均可定位),任何纯 Markdown 文档都免加标记地获得段落寻址能力;行号视图与行区间编辑让 Agent 按坐标工作。
  • 有界列表与差分:菜单每 session 只展开一次,之后压成一行;长列表截断时留一个续读地址;变更以有界 diff 返回。

P4 递归渲染让这些效应复利:动作输出本身被重新解析渲染为 SFMD,结果里的链接成为可导航快捷方式,结果与任何页面共享同一语法——接口与自己复合。

4.3 统一表面与来源信任(P2 + 运行时)

一个工件,两种渲染:SFMD 网站给浏览器发带样式 HTML,给 Agent 发原始文档(平行 URL 加 .md 或内容协商,/open https://site/page 直接可用)。对 Agent 来说网页和本地应用长得一模一样——没有每站点语法、没有 HTML/CSS 要过滤。连旧 HTML 页面也由运行时转换成同一语法进来。论文自己团队的新闻站就是这样一个页面:人当网站读,Agent 用 /open 和 /act 当应用操作。MCP 上整个运行时是单个 {topic, cmd} 工具,发现信息住在渲染页面里而非工具列表里。

信任跟随来源而非请求:一个语法横跨多个信任域,特权必须来自文档从哪来而不是它想干什么。规则是浏览器式的切分:CLI 动作只能来自本地 file:// 文档或本地安装的应用;远程 SFMD 只能调 HTTP 动作——因为远程内容在任何人审查后都可能改变。安装是原子复制(带路径穿越校验);链接安装保持远程、够不到 shell。

机密不过模型:凭证在应用 topic 内一次性设进每应用存储。$VAR 只在作者写下的模板位置解析,从不来自进程环境、从不来自调用方提供的值。运行时拒绝任何出现在命令参数位置的 $var——注入的指令无法外泄存储的密钥。事件是消息不是命令:webhook 载荷只追加进收件箱,Agent 必须自己读并确认,运行时从不执行 webhook 内容。

4.4 部署教会的事

三个月生产使用(三个 Agent 团队、一个约 3000 月读者的端到端新闻服务、41 个公开应用)带来三条硬教训:(1) 生态长成了 shell 形——41 个应用里 CLI 动作 151 个对 HTTP 49 个,所以信任模型围绕来源构建是对的;(2) 静默参数丢失是最坏失败模式——解析器曾静默丢弃约束子集外的参数行,没崩溃但 Agent 就是少了作者声明的旗标。文档即程序,则宽容解析就是安静的错误编译(P3 被违反的代价);(3) 来源边界是 Agent 能理解的边界——『本地文件可以 shell、远程页面不行』这条规则作者和 Agent 都读得懂,Agent 能推理的边界才是它真正能遵守的边界。

五、评估指标与实验证据

5.1 指标体系

  • 主指标:任务成功率(SkillsBench 87 任务 × 每条件 3 次 × 6 模型,OpenHands harness)——证明换接口不掉性能,这是主张成立的底线。
  • 辅助指标:完成片段的 token 消耗(只统计完成的片段,避免不同条件完成不同任务的混淆)——证明上下文经济主张。
  • 常驻接口 token(固定成本量,衡量 O(1) vs O(n))。
  • 派发准确率 / 错误动作选择率(catalog 规模 5-100 × 2 模型)——衡量分阶段披露的因果效应。
  • 消融指标:提前披露实验——信息总量固定、只把 tier-2 细节提前一轮展示,衡量披露时机的因果作用。

5.2 主实验:SkillsBench

设置:把基准的每个精选技能保持任务级操作集不变,把程序与代码示例运行时化为声明的 String 动作。三条件对比:无技能、精选技能、String 应用。

模型无技能技能StringΔ vs 技能 (pp)token 缩减 均值/中位
GPT-5.551.5%67.3%68.5%+1.237.4% / 27.2%
DeepSeek V4 Pro26.9%50.1%50.9%+0.844.3% / 41.1%
Kimi K2.633.4%54.0%53.2%−0.839.2% / 36.1%
Claude Opus 4.845.7%54.1%57.8%+3.728.7% / 26.4%
Claude Sonnet 4.633.5%47.2%48.2%+1.021.7% / 19.2%
Claude Haiku 4.58.8%30.1%32.1%+2.029.6% / 28.4%
平均33.3%50.5%51.8%+1.333.5% / 29.7%

解读:六个模型中五个持平或更高(仅 Kimi 微降 0.8pp),token 缩减 21.7-44.3% 全模型一致。论文特意强调这个跨家族、跨尺度的一致性——省的钱来自系统而不是某个模型的怪癖。值得注意的是从无技能基线的 +18.5pp 提升与精选技能几乎相同:运行时化的技能保住了文档化技能的全部收益。

5.3 规模实验:100 个 OpenAPI 服务

全 JSON schema 每轮 103,518 token;每工具一行索引 3,291 token;String 53 token(固定单工具接口,安装的应用在打开前零成本)。按实测斜率(约每应用 1,035 token),200k 窗口在 N ≈ 190 附近直接爆掉——超过这个数全 schema 契约根本写不下来。实测对全 schema 基线 token 掉 93.5%(Sonnet 4.6)与 91.8%(Haiku 4.5)。

5.4 因果实验:分阶段披露

同一目录(规模 5-100,Sonnet 4.6 与 Haiku 4.5)上加三层 staging,六个模型×规模格子全部提升派发准确率 10-37 点,错误动作选择从 28% 降到 2%。反向消融:信息保持固定、仅把 tier-2 细节提前一轮展示,Sonnet 损失 11.6 点、Haiku 23.3 点,95% 置信区间不含零。披露的时机本身在做真实的工作,不只是省 token。

5.5 共设计初探:界面作为训练目标

用生产轨迹(非合成数据)微调四个开权重模型(Qwen3.5-4B/3.6-27B、Gemma 4-E4B/31B),20 个留出任务(含训练中未出现的应用,模型必须学会的是语法而非背应用):

模型成功率 前→后生成 token/任务 前→后缩减
Qwen3.5-4B60%→70%345.5→122.064.7%
Gemma 4-E4B65%→80%182.8→38.678.9%
Qwen3.6-27B85%→85%419.2→201.551.9%
Gemma 4-31B80%→90%200.2→43.778.2%

四个中三个成功率先升,全部 token 减半到五分之四——包括成功率没动的 Qwen3.6-27B 也少了一半 token(微调后的模型不再重新推导接口:探索性打开、畸形命令、重试都消失了)。作者谨慎地称之为概念验证(20 任务只能以 5pp 分辨率看成功)。

证据链评估:这套实验设计聪明的地方在于主比较选了一个『不掉性能』的地板(与精选技能比)而不是去刷分;token 缩减只在完成片段内统计且作者在威胁有效度里声明了这可能有完成集差异的混淆;因果性由受控的提前披露实验直接 Establish 而不是靠相关性推断。弱点也诚实:内部评测、端到端比较不隔离可执行打包与渲染纪律各自贡献。

六、效果优势的根源解释

为什么换接口能省三分之一 token 而不掉成功率?

对比对象:精选技能条件。它为何有效?因为它把领域知识写成了好文档,Agent 读了文档知道怎么做。它的根本局限在于交付形态:知识以散文+示例代码形式驻留,Agent 必须每一项任务把散文重新翻译成代码——论文的追踪分析给出了惊人数字:代表性任务上技能条件花 13 次工具调用组装文档描述的工具链,String 声明动作只需 2 次调用。翻译工作本身既是 token 成本也是出错面(代码合成、依赖选择、参数拼接每一步都可能错)。

String 的根本性改变:把『谁把程序性知识变成执行』从 Agent 换成了应用作者。作者提供可调用签名,运行时执行——代码合成错误面整个消失。因果链:散文→代码的翻译被移除 → 每任务调用数从 13 降到 2 → 完成片段 token 降 33.5% 且成功率微升(错误面同时缩小)。

为什么常驻成本从 O(n) 变 O(1)?

机制根源:schema 常驻设计把『能力目录』与『能力描述』绑定——每接入一个工具就必须在上下文里为它付租金,无论本轮用不用。String 把两者解耦:目录信息住在渲染页面里(打开才知道有什么),常驻的只有语法命名(53 token)。信息没有消失,只是从『驻留』变成『可寻址』。Agent 不需要持有信息才能访问它,只需要地址——这是对『上下文=工作记忆』这个稀缺资源最根本的重新分配。规模实验的 103,518 → 53 就是这个重新分配的直接读数。

为什么披露时机会因果地影响准确率?

这是论文最漂亮的一击。表面解释是『细节多了会分心』,但论文做了关键区分:单纯的常驻体量不会可靠地破坏派发,但在选择时刻把易混动作的细节摊开才会。也就是说干扰是条件性的——发生在决策点上。机制:注意力在决策点被多个候选的相似参数面拉扯,相似度越高干扰越大。三层 staging 把 tier-2 细节从决策点移走,错误动作选择从 28% 到 2%;反向实验证明这不是相关而是因果(信息固定、只动时机、损失 11.6-23.3 点且置信区间不含零)。这条发现本身有独立于 String 的价值:它把 HCI 的渐进披露从设计品味升级成了有因果证据的机器用户界面定律。

为什么运行时吸收接口后小模型受益更明显?

无技能→String 的提升:Haiku +23.3pp(8.8→32.1)、DeepSeek +24.0pp、Sonnet +14.7pp、GPT-5.5 +17.0pp——小基线模型提升幅度更大。根源与认知负载文献一致:长上下文的干扰、长度、位置效应对能力弱的模型伤害最重。String 把界面知识移出上下文,等于给小模型卸掉了最重的认知负载。微调实验进一步显示:一旦界面变成小而稳定的语法,小模型可以从使用轨迹学会它(Gemma 4-E4B token 减 78.9%)——稳定的接口是可学习的训练目标,臃肿的接口不是。

反事实:如果去掉分阶段披露会怎样?

去掉 staging 的 String 大约退化到『技能+索引』的水平:错误动作选择回到 28%(2%→28% 是六格中观察到的全部范围),成功率的包装收益虽然保住(可执行动作还在),但决策质量收益消失。这反证 staging 不是锦上添花而是设计核心——也因此作者把它列为四原则之首的 P1 的具体机制。

七、必要知识反推

假设让一个毫无背景的人从零做出 String,最少需要知道什么?

领域知识层

LLM Agent 的上下文经济学:必须懂得 token 即成本、注意力即感知——Agent 的每一轮都对常驻上下文重新计费。不知道这个,就不会把『节约上下文』设为运行时的第一目标函数,会做出又一个协议层。

当前工具生态的准确画像:function calling / MCP / tool retrieval / skill 库各自的机制与局限(常驻 O(n)、检索瓶颈、假设执行环境在 Agent 侧)。不掌握这些就找不到『schema 契约』这个要替换的靶子。

长上下文行为文献:lost in the middle、无关上下文分心、输入长度效应——这些是『为什么部分披露有效』的机制依据,也是因果实验设计的假设来源。

方法论知识层

HCI 经典理论:认知负载理论(Sweller)、渐进披露与识别优于回忆(Norman)、信息觅食(Pirolli-Card)、直接操纵。论文的每条渲染规则都能在这些理论里找到原型;不知道它们就得在机器用户身上重新发明一遍,而且多半发明得不那么好。

操作系统设计传统:Unix 一切皆文件、REST 统一接口、进程/IPC/权限/包管理的经典分解。Table 1 的 OS 映射不是装饰——它保证了系统的每个部件都有经过五十年打磨的语义(原子安装、显式确认的消息、作用域凭证)。

实验设计:基准改编(保持任务级操作集不变的技能→应用移植)、配对条件对比、因果消融(信息固定只动时机)、完成片段内的 token 统计口径。尤其需要懂得为什么端到端比较是诚实的但也需要声明它不隔离单项贡献。

工程知识层

TypeScript/Node 全栈与 MCP 服务器实现:17.8k 行四个分层包(零依赖 SFMD 解析器、编译器、格式无关的 daemon 客户端、运行时)的架构判断力——特别是『daemon 客户端永远不见 SFMD』这种解耦决策。

安全工程:来源特权、路径穿越校验、模板位置限定的变量展开、loopback 绑定。『$var 不出现在命令参数位置』这条规则需要对注入路径的具体想象。

生产运维:三个月三团队的真实部署、webhook 收件箱、原子安装——很多教训(静默参数丢失)只能在生产里学到。

知识融合的关键节点

  1. 节点一:把 Agent 识别为认知负载主体。把 Sweller 的认知负载理论从人类迁移到模型,与 lost-in-the-middle 等实证文献对接——这一步把『token 贵』这个经济问题升级成『认知过载』这个设计问题,OS 层的必要性由此成立。
  2. 节点二:接口=预训练分布内的语法。意识到已部署模型学不了新语法,于是 Markdown(读)+ Unix shell(写)是唯一可行的语法选择——这个约束倒逼出 SFMD 作为 CommonMark 超集的整套设计,也解释了 53 token 存根为何可行。
  3. 节点三:来源而非请求的信任模型。当统一表面把本地与远程拉进同一语法,Unix 权限模型不能直接用;把浏览器同源策略的思想与 CLI/HTTP 动作二分对接,得到『本地可 shell、远程仅 HTTP』——一个 Agent 自己能推理的边界。
  4. 节点四:时机的因果性。把『干扰发生在决策点』这个假设做成提前一轮披露的受控实验——HCI 直觉由此变成机器用户的因果定律,这是全文科学价值最高的一步。

八、论文中可以提取的通用性灵感

灵感一:接口的固定成本应该与集成数量解耦

  • 核心思想:任何为『新用户』(人、Agent、服务)服务的系统,其常驻开销应设计成 O(1),把规模信息移到按需寻址的层。
  • 论文证据:100 应用下全 schema 103,518 token vs String 53 token;实测 token 降 91.8-93.5%。
  • 推广场景:(1) 微服务网关的发现信息从启动配置改为按需渲染;(2) IDE 插件系统的懒加载命令面板;(3) 大模型工具生态之外的 API 聚合平台;(4) 机器人技能库的按需加载。

灵感二:把程序性知识从『被读者实现』改为『被作者提供』

  • 核心思想:文档描述『怎么做』时,翻译负担在读者;把程序声明成可调用签名,翻译负担回到作者——一次付清,人人受益。
  • 论文证据:技能条件 13 次工具调用组装工具链 vs String 2 次调用;成功率持平且 token 降 33.5%。
  • 推广场景:(1) 内部工具文档改为可执行 runbook;(2) 数据分析的 SQL 教程文档改为参数化查询函数;(3) DevOps 手册改为可调用自动化剧本;(4) 教育领域的『示例代码』改为可调式实验。

灵感三:为冻结的学习者设计时,只能用它的母语

  • 核心思想:面对无法在运行时再训练的用户(已部署模型、遗留系统、新员工),接口语法必须落在对方已有能力分布内,任何『更好的新语法』都是负资产。
  • 论文证据:SFMD 刻意零新记号——Markdown 是预训练母语,shell 语法是母语,53 token 只负责命名。
  • 推广场景:(1) 面向老系统的兼容层设计;(2) 面向新员工的入职工具(用他们熟悉的软件习惯);(3) 无障碍设计(不要求用户学习新交互范式);(4) 跨代产品迁移的向后兼容策略。

灵感四:干扰发生在决策点——披露时机是因果变量

  • 核心思想:信息呈现的时机本身影响决策质量;在选择的瞬间暴露易混选项的细节会造成条件性干扰,哪怕信息总量不变。
  • 论文证据:tier-2 提前一轮展示损失 11.6(Sonnet)/23.3(Haiku)点,95%CI 不含零;staging 使错误选择 28%→2%。
  • 推广场景:(1) 人类决策界面的渐进披露(表单分页、结账流程);(2) 推荐系统的候选呈现时机;(3) 教学设计中的脚手架次序;(4) 代码评审工具的上下文按需展开。

灵感五:信任跟随来源,规则要简单到使用者能自己推理

  • 核心思想:安全边界应绑定在用户可观察、可推理的属性(它从哪来)而非需要审计的属性(它想干什么);使用者能推理的边界才是能遵守的边界。
  • 论文证据:『本地可 shell、远程仅 HTTP』作者与 Agent 都读得懂,Agent 在错误信息明说规则时会主动适应。
  • 推广场景:(1) 浏览器同源策略的扩展设计;(2) 企业数据的来源分级访问;(3) 物联网设备的本地/云端权限二分;(4) 面向儿童的数字产品设计。

灵感六:稳定的小接口是可学习的训练目标

  • 核心思想:当运行时吸收了界面知识,剩下的策略定义在小而稳定的语法上——这恰好是小模型能从轨迹中学到的目标;接口设计因此与可训练性共设计。
  • 论文证据:四个开权重模型微调后三个成功率升、全部 token 减 51.9-78.9%,包括未成功提升的模型也停止了接口的重复推导。
  • 推广场景:(1) 智能家居 API 简化后端侧模型蒸馏;(2) 游戏引擎的稳定脚本 API 作为 RL 训练面;(3) 企业内部 DSL 的设计以可教性为准绳;(4) 机器人操作原语的稳定化以利于策略学习。

灵感七:宽容解析是安静的 bug 温床

  • 核心思想:当文档成为程序,解析器的宽容(静默丢弃不认识的行)等价于无声的错误编译;响亮失败是正确性要求而非开发体验偏好。
  • 论文证据:生产中解析器静默丢参数行导致 Agent 缺失作者声明的旗标,被列为最坏失败模式。
  • 推广场景:(1) 配置文件解析器的严格模式默认化;(2) 数据管道的 schema 校验前移;(3) DSL 与标记语言工具链的错误设计;(4) 协议实现的 must-fail 明确化。

附录:部署速查

  • 生态现状:41 个公开应用,CLI 动作 151 : HTTP 49——shell 形生态。
  • 一句话总结:String 的贡献不是又一层抽象,而是一个实证——Agent 界面问题的解不在更好的协议,而在渲染纪律:文档即应用、按需披露、来源定特权。53 token 对 103,518 的对比会让任何人重新审视自己给 Agent 的上下文里都塞了什么。