论文链接:arxiv.org/abs/2608.25399 发表时间:2026年8月 机构:Stanford University(单作者 Jakub Smékal) 领域标签:cs.AI / Agent 经济学 / 实证软件工程
一、论文背景
1.1 Agent 编码的成本时代
Agentic coding 已是工业界标配:agent 在长视野中自主读代码、改代码、跑测试、迭代修复。随之而来的是 token 开销——一次复杂任务的花费可达单轮对话的成百上千倍。既有研究(Bai et al. 2026)表明:同一任务的两次相同运行,token 可以差 30 倍;更高花费买不来可靠更高的准确率;模型对自己消耗的估计很差。成本大、随机、难预测——这是所有部署者的痛点。
1.2 被忽视的变量:任务描述本身
之前的研究要么变模型、固定 prompt(Bai et al.),要么变 prompt 表面形式、固定语义(paraphrase 研究)。而真实世界中,两个工程师给 agent 的任务描述天差地别:有人写八节完整规格书,有人只贴一行报错。任务描述的信息量本身如何塑造 token 开销?能否事前预测?——此前没有系统测量。
类比:同样请装修队,有人给全套图纸(水电位、材料清单、验收标准),有人只说"把家搞舒服点"。后者不是不能做,但工头要反复试错、来回确认——工时(成本)必然上涨。涨多少?哪些细节最值钱?这就是本文要量化的。
1.3 三个研究问题
- token 开销在多大程度上可通过任务规格与思考力度控制?
- 规格变化是否影响运行的方差?
- 未见过的任务的开销能否被预测?
二、论文定位和关联工作
2.1 成本作为结果变量
推理成本越来越多地作为报告结果而非实现细节。最近邻是 Bai et al. 2026(八模型 × SWE-bench Verified,同任务固定问题陈述、变模型)——本文反转其设计:固定模型(Kimi K3)、变任务描述。两篇互补:他们回答"哪个模型省",本文回答"哪个写法省"。
2.2 Prompt 作为变量
单 prompt 基准脆弱性研究(paraphrase 使性能摆动数点)保持任务信息不变、变表面形式;本文相反——故意变信息量并给每个增量定价。已有发现"删细节有时反而提升正确率"(破坏误导性词汇线索)、“打包技能文档可能增加开销不涨性能”——提示信息量与收益并非单调。
2.3 任务描述应包含什么
Bettenburg 等对 bug 报告的经典发现:最有价值的要素也最难提供;Khatib 等在 433 个 SWE-bench issue 上发现修复建议、复现脚本、定位信息与解决率正相关;SWE-Bench Pro 配人类撰写需求。让 agent 主动请求信息(而非变化输入 prompt)是互补路线。
定位结论:首个系统变化任务描述信息层级、同时测量成本均值与方差的工作,填补"prompt 影响成本"这一空白维度。
三、问题定义
具体问题:任务规格(prompt)的信息结构如何影响编码 agent 的 token 开销与轮数,开销可否便宜地预测?
抽象洞察:规格中缺失的信息由模型推理补偿,而推理即成本。任务描述是信息的压缩包——压缩率越高(信息越少),agent 需要"解压"的推理越多,token 与轮数越多。信息可以放在 prompt 里(便宜、一次付费),也可以让模型自己推理出来(贵、每次运行都付)。本文本质是在测量这个信息放置的经济学。
形式化:对任务 t、规格 b、思考力度 e,成本 y_tbe 建模为贝叶斯分层模型(跨任务共享形状 + 任务级水平);预测问题:用 4 个任务学共享成本形状 ŝ_be,对新任务 h 用 k 次探测运行估计水平 δ̂,预测 ŷ_hbe = δ̂ + ŝ_be。
精妙之处:把"prompt 怎么写"从经验艺术变成可测量、可定价、可预测的工程变量。
四、问题解法(实验设计)
4.1 规格分布的构造
5 个 SWE-bench Verified 任务(xarray、astropy、django 等真实开源项目),每个构造 12 种规格变体:
- 十种规格变体:基于 GitHub Spec Kit 模板的八节完整规格(header、user story、Given/When/Then 验收场景、edge cases、功能需求、关键实体、成功标准、假设)+ 七个单节删除版 + 两个部分规格(minimal=header+user story 仅 129 token;contract=header+需求+成功标准 166 token)。
- 两个锚点:raw(裸失败测试输出——工程师直接贴错误日志的现实写法);oracle(直接给出修复方案,仅要求应用——信息上界的合理性检查,成本仅全规格的 0.05–0.19 倍,因构造性便宜被排除出主分析)。
规格由 LLM 起草后人工修订保证模板一致性与忠实性。
4.2 执行网格
5 任务 × 12 规格 × 3 思考力度(low/high/max)× 15 次重复 = 2,700 次运行。模型 Kimi K3(温度 1.0,Modal 端点),脚手架 mini-swe-agent(标准 SWE-bench Docker 镜像、120 轮上限、无网络、防解泄漏筛查)。
4.3 结果与分析
记录成本(美元、标价)、输入/缓存/输出 token、轮数、是否解决。log 轮数与 log 成本相关 r=0.953(轮数作无单位开销代理)。每节删除效应拟合一个贝叶斯分层模型,报告后验中位数与 90% 可信区间。
4.4 预测器
留一任务:4 个训练任务学共享形状 ŝ_be(哪些配置相对贵、不含任务水平信息);held-out 任务用 k 次固定配置(全规格+low)探测运行估计水平。k=0(纯形状)vs k=1($0.11)vs k=10。
五、评估指标与实验证据
5.1 发现一:prompt 移动均值,且效应任务依赖
单节删除都不大:删功能需求/假设/边界/实体/成功标准任一项,成本变化 −5.4% ~ −2.4%(居然大多略降——这些节的信息边际价值低)。
大砍才见血:砍到裸 user story(minimal)→ 成本 +29.7%、轮数 +16.4%,五个任务全部同向。任务间差异巨大:13% 到 115%(xarray-7393 是极端点,该任务砍成 user story 成本翻倍还多——证明存在"prompt 杠杆巨大"的任务,实践者应实测自家任务而非假设)。
唯一有独立效应的单节:验收场景(acceptance scenarios)。删除它 → 轮数 +7.0%(五任务一致)。深挖原因:验收场景(Given/When/Then 可执行用例)与成功标准(散文式断言)表达同一要求的不同抽象层——删具体形式(GWT)费轮数,删抽象形式(散文)无影响。重要的是"哪些情况必须通过"的具体性,不是"有要求"本身。
raw 锚点的启示:最不结构的 raw 在低思考力度下是十一种变体中最便宜的(4/5 任务上)——失败测试输出自带文件名与测试定位,这种定位替代了散文规格留给 agent 的探索轮次。具体性再次胜过结构。
任务间分歧随砍削规模上升:五个小删 4–8%,两大砍 29–40%——prompt 的杠杆是任务属性。
5.2 发现二:思考力度与规格是"稀缺处的替代品"
最贵/最便宜规格的比值:low ×2.13 → high ×1.67 → max ×1.61。删验收场景的轮数代价:low +20.1% → high +4.5% → max +2.1%。解读:信息与思考互为替代只在思考稀缺处成立——低力度时 prompt 缺的信息靠推理补(推理就是缺失节的价钱);max 力度时模型反正会大量推理,给不给信息差别不大。但注意:几何均值花费从 $0.117(low)涨到 $0.561(max),绝对美元差随比值收窄反而拉大。
规格不影响解决率:所有删除的 90% CI 都含零(±7.5 点内)——成本差异归因于 prompt 而非"某些变体解了更简单的任务版"。
5.3 发现三:prompt 不动方差
同规格 15 次重复的几何标准差中位数 ×1.34;分规格看 1.29–1.40,差异小到各任务-力度的分布大量重叠。存在的差异由成本水平解释:绝对散布与平均成本 log-log 斜率 1.08、r=0.95(近正比——越贵的设置本质上越随机)。与 null 模型(仅采样噪声)对比无可靠超出。结论:随机性来自服务栈与模型而非任务描述;通向可预测开销的唯一路是降低开销本身。
5.4 发现四:token 结构决定优化杠杆
Kimi K3 上:输出 token 仅占处理量的 2.7% 却占 51.1% 美元(缓存命中 96.3%,新鲜输入占 13.4% 花费)。面向输入的优化(prompt 压缩、上下文裁剪)只触到零头;减少轮数才动大头。(作者注明:比例依赖价目表与缓存命中率,不直接外推其他栈。)
5.5 发现五:单次探测把预测误差砍掉四分之三
| 预测方式 | 中位误差 |
|---|---|
| 不测量(仅共享形状) | 161%(r=0.08,不比模型自估好) |
| 单次 $0.11 探测 | 36%(r=0.72) |
| 10 次探测 | 25% |
此前工作(Bai et al.)显示模型自估误差 ~161% 级别——一次廉价探测就跨过"能不能用"的门槛。
5.6 为什么实验设计能证明论点
三个控制保障归因干净:其一,解决率不变排除"便宜是因为任务变简单";其二,15 次重复 × 贝叶斯分层模型把任务间异质性显式建模而非平均掉;其三,oracle/raw 双锚点把信息量的上下界钉住,主分析用 11 个真实变体避免 oracle 的构造性便宜污染效应。
六、效果优势的根源解释
(1)为什么砍 user story 最贵、删验收场景最显著? 机制:信息缺失由推理补偿,推理即成本。裸 user story 只剩"我要什么",没有"怎么算对"——agent 必须自己探索验收标准(写测试、试边界),每个探索都是轮数与 token。验收场景的 GWT 用例提供"哪些情况必须通过"的可执行具体性——agent 直接对照实现而非逆向猜标准。raw 测试输出同理:文件名+测试名就是现成定位。具体性(而非要求的存在)才是省轮数的关键——散文式"系统应保持稳定"无操作价值,GWT 的"给定 int32 坐标、当 stack 后、则 dtype 仍为 int32"直接可验证。
(2)为什么低思考力度时 prompt 效应更大? 思考与 prompt 信息是替代品:low 力度下模型不会自发深想,prompt 信息直接决定行为;max 力度下模型无论如何都会推理验证,外部信息增量被内部推理稀释。这与"信息与思考互为替代只在思考稀缺处成立"的经济学直觉一致。
(3)为什么方差不可通过 prompt 压? 方差来源分解:若 prompt 引发不同的探索路径多样性,则信息少的规格方差应更大——数据显示不是。几何标准差跨规格恒定(×1.29–1.40 重叠)、绝对散布按斜率 1.08 正比于均值——随机性内生于服务栈调度与模型采样,与任务描述无关。唯一的方差控制是降均值(顺带降方差)。
(4)预测器为什么有效? 成本 = 任务水平(这个任务本质多难)× 配置形状(哪种规格×力度组合相对贵)。前者跨任务不可迁移(161% 误差证明),后者跨任务稳定(形状可从 4 个任务学得)。一次探测便宜地钉住水平——形状+水平=可用的预测。这是"共享结构+个体校准"的经典分解在成本预测上的应用。
七、必要知识反推
7.1 领域知识层
- Agentic coding 工作流:mini-swe-agent 脚手架、SWE-bench 评测协议、Docker 隔离环境——实验可复现的基础设施知识。
- Agent 成本结构:输入/缓存/输出 token 的计价差异——不懂"输出占 2.7% 量却占 51% 钱"就没法谈优化。
- 需求工程:Spec Kit 八节模板、user story/GWT 验收场景的行业实践——构造规格分布的领域素材。
7.2 方法论知识层
- 实验设计反转:识别出"变模型固定 prompt"的空白维度并反转——研究设计的定位感。
- 贝叶斯分层模型:跨任务共享效应+任务级分歧的显式建模——小样本(5 任务)下正确处理异质性的工具。
- 重复测量与方差分解:几何标准差、log-log 斜率分析——区分"prompt 影响均值"与"不影响方差"的统计手段。
- 预测器设计:形状迁移+水平探测的两段式结构。
7.3 工程知识层
- 2,700 次运行的编排与成本核算;防解泄漏筛查;LLM 起草+人工修订的规格构造流程。
7.4 知识融合的关键节点
- 节点一(定价思维):把 prompt 的每一节当作可定价的信息增量——信息经济学的视角注入 prompt 工程。
- 节点二(具体性假说):从"验收场景删除有独立效应、成功标准删除无效应"的对比中提炼出"具体性>要求存在"——两个几乎同信息的节的自然实验。
- 节点三(替代品边界):发现"信息-思考替代性"随思考力度变化的边界条件——把经济学直觉精化为可检验命题。
- 节点四(预测的分解结构):形状/水平分解让"单次廉价探测"这个实用方案成为可能。
八、论文中可以提取的通用性灵感
灵感一:缺什么信息,就以推理的形式付费
- 核心思想:任务描述中省略的信息不会消失,而是转化为执行者的探索成本;把信息前置到规格里通常是更便宜的付费方式。
- 论文证据:砍到裸 user story 成本 +29.7%(5/5 任务同向);oracle(直接给答案)仅 0.05–0.19 倍成本。
- 推广场景:外包合同的需求清晰度与返工成本;法律咨询的事前陈述完整度;新员工 onboarding 文档与试错成本;API 文档质量与集成调试时间。
灵感二:具体可执行的验收标准优于抽象要求
- 核心思想:“哪些情况必须通过"的可执行具体性(输入→输出对、测试用例)比"应该怎样"的散文要求更有操作价值。
- 论文证据:删 GWT 验收场景轮数 +7.0%(5/5 一致),删语义等价的散文成功标准无任何可测效应。
- 推广场景:产品需求的 AC 写法;装修合同的材料与验收清单;教育评分标准的 rubric 具体化;外包 QA 的测试用例交付。
灵感三:均值可设计,方差是本性——降方差先降均值
- 核心思想:输入设计能控制系统输出的平均水平,但运行间的随机性往往内生于系统本身;唯一可靠的方差压缩是缩小规模。
- 论文证据:所有规格的重复运行几何标准差恒 ×1.34;绝对散布按斜率 1.08 正比于均值;与仅采样噪声的 null 无差异。
- 推广场景:物流时效的均值 vs 波动管理;云服务延迟的 p99 控制;实验重复性的成本效应;任何"既要快又要稳"的运营场景。
灵感四:先看钱花在哪类资源上,再选优化杠杆
- 核心思想:计费结构决定优化优先级——量少的资源类别可能占大头成本,直觉优化可能作用在零头上。
- 论文证据:输出 token 占 2.7% 量却占 51.1% 花费(缓存命中 96.3%)→ 输入侧优化只触 13.4%,减轮数才动大头。
- 推广场景:云成本的存储 vs 出口流量;人力成本的全职 vs 顾问;数据库的存储 vs 查询计算;个人时间管理的高价值时段识别。
灵感五:一次廉价探测胜过一切先验猜测
- 核心思想:个体差异巨大且不可迁移时,用少量实测校准个体水平、用群体数据提供结构形状,是预测的实用解。
- 论文证据:无测量预测误差 161%(不比模型自估好)→ 单次 $0.11 探测 36%(r=0.72)→ 10 次 25%。
- 推广场景:招聘的试用日;买房前的验房;供应商的小批量试单;模型部署前的单点压测;任何"样本贵但可测"的预测场景。