<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>PaperReading on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/paperreading/</link><description>Recent content in PaperReading on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 03 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/paperreading/index.xml" rel="self" type="application/rss+xml"/><item><title>Actions with Receipts + ContractRL + Guarded Commits：Agent 治理三层——审计收据、修复契约、审批事务 三论文合读 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-governance-audit-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-governance-audit-trio-paper-reading/</guid><description>本篇合读中科院信工所+国科大与 MPI-SWS+MIT CSAIL+Purdue 的三篇 Agent 治理论文：Actions with Receipts 把每条声明变成密码学级「收据」，让审计可重放（跨对象攻击检出 0.9961 vs 基线 0.1797）；ContractRL 把工具调用修复建模为契约约束 MDP，补丁式修复语义成功 0.9362、token -75%；Guarded Commits 把人类审批升级为工作流事务的四条件提交谓词（验证器精度 1.000、271,035 轨迹重放哈希匹配 1.000）。三篇共同勾勒一条主线：数据库与供应链安全几十年的成熟思想——内容寻址、事务边界、fail-closed 校验、账本重放——正在系统性反哺 Agent 治理。</description></item><item><title>Agent 安全新前沿五重奏：技能链劫持、模因木马、无辜信使、内存分区与主动越权 合读精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-agent-security-quintet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-agent-security-quintet-paper-reading/</guid><description>同一周出现的五篇论文拼出一幅完整的图景：Agent 攻击正在从「操纵模型」转向「滥用系统结构」。APEX 用跨技能伪造授权链把攻击成功率做到 84.3%（直接注入只有 3.5%）；Memetic Trojans 借 Agent 社交网络的内生传染因子把曝光放大 3.19 倍；The Innocent Courier 把 LLM 的合法网页抓取工具变成 99.9% 隐蔽的泄密信道；ZoneClaw 用「持久化≠授权」的内存信任分区把 372/480 的攻击压到 6/480；OverAct 则证明越权不需要攻击者——7 个模型全部主动越权，SELFAUDIT 能把隐私违规砍掉 43%。本文逐篇拆解五项工作的机制、实验与根源，并提炼它们共同指向的防御范式。</description></item><item><title>AutoCompact + Cross-Benchmark Transfer + AuraForge 三篇合读：编码 Agent 训练的三根支柱——上下文管理策略化、RLVR 泛化性、安全监督合成 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-coding-agent-training-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-coding-agent-training-trio-paper-reading/</guid><description>合读 2026 年 10 月 1 日同期出现的三篇编码 Agent 训练论文：AutoCompact（SMU+NTU+Harvard）把「何时压缩上下文、保留什么、压缩后怎么继续」训练进策略本身，用执行前在线纠正的压缩监督加 joint GRPO 在 SWE-bench Verified 上拿到 30.4→39.6（+9.2pp）；Cross-Benchmark Transfer（Surge AI）证明 1700 个专家任务上的单 epoch 纯 RL 能让 Kimi K2.7 Code 在全部六个外部基准上全线迁移（DeepSWE +12.4pp、TB2.1 +14.6pp、SWE-Marathon 5.0→25.0），且学到的不是基准惯例而是「完成工作的通用方式」；AuraForge（CMU+UCLA）用攻击效果断言替代修复实现细节断言来合成安全测试，FPR 从 16.7% 压到 2.8%（-83%），训练 Qwen3.5-4B 让 SecPass 从 0 提到 8.54。三篇分别回答了编码 Agent 训练的三个正交问题：上下文怎么管、学到的东西会不会泛化、安全监督从哪来——合起来构成一根完整的训练支柱。本文按七部分结构拆解三篇的问题定义、方法机制、实验证据与优势根源，并提炼可推广到其他领域的通用灵感。</description></item><item><title>FloWright × InFlowOp 合读：用工作流进化工作流，为故障付费而不为流程付费 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-workflow-coevolution-duet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-workflow-coevolution-duet-paper-reading/</guid><description>同一团队（William &amp;amp; Mary + NEC + UIUC）在 2026 年 10 月 1 日同日放出的两篇多智能体工作流论文合读：FloWright 把工作流本身当作 harness，统一评估、训练与测试时三种用途，用零额外成本的结构感知信用定位（c=−|F|/|V|）驱动多角色共进化训练（+5.03% vs 单角色 +2.83%）；InFlowOp 则用单一免标注代价货币同时驱动工作流构建（COALESCE 双向聚合）与运行时局部矫正（RE-ASSIGN→RE-DECOMPOSE 代价阶梯），较单智能体最高 +11.97%。两篇分别回答了「工作流怎么训练」与「工作流运行时怎么修」，并各自贡献了 DATAWRIGHT（44 评估臂）与 BRAID 两个工作流级基准，共同回应了『多智能体增益在单智能体可解数据上无法体现』的领域困境。</description></item><item><title>GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读：harness 自进化在 GUI、机器人、图像生成三条垂直域的落地</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-vertical-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-vertical-trio-paper-reading/</guid><description>「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线：GUI-HARVEST 用重复视觉执行证据加行为预测双门，在 OSWorld 六个骨干上最高提升 12.33 个百分点；DynaHarness 用快慢脑加物理执行契约，把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%；EvoGen-Harness 用 where+how 联合归因进化，让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作，本文合读三者的共同骨架、域特化设计与实验证据链，并讨论 harness 工程的边界与反例。</description></item><item><title>Harness 优化三重奏：Turbo Harness、ActiveSaddler 与 VeriHarness 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-optimization-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-optimization-trio-paper-reading/</guid><description>当「自动优化 Agent Harness」成为显学之后，下一个增益藏在哪里？三篇同期论文给出了三条正交路线：Turbo Harness（Rutgers+Red Hat+MIT-IBM）回收外层搜索的「废气」蒸馏成 playbook，用 GRPO 训出 9B 实例编辑器，把全局 Harness 按每个测试实例打补丁——SWE-bench Verified 38.4→54.4，SWE-smith-MR 成本 $0.310→$0.046（约 6.7 倍下降）；ActiveSaddler（POSTECH+KAIST+微软）把「训练课程」建为失败模式臂的非平稳 bandit，让课程与 Harness 共进化——GAIA2 59.8±1.0（+4.4pp）、Terminal-Bench 2.0 80.0（+7.5pp），同等精度成本降为 1/4.6；VeriHarness（Cambridge+Google Cloud）则把 Harness 思想搬到验证侧，用「分歧裁决+共识挑战」两条互补检查通道让同模型验证自己的产出——修订模式 Flash +6.2 / Opus +6.4，空库自进化技能在 held-out 上 +11.0。本精读逐篇拆解机制与实验，再回答一个统摄性问题：为什么恰好是「实例、课程、验证」这三个维度——答案是它们分别对应推理分布、优化分布、监督信号三个此前被忽视的自由度，且三者可叠加。</description></item><item><title>Harness 的有效性边界：Malena × Finding the Right Fit 合读精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-boundary-duet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-boundary-duet-paper-reading/</guid><description>同月两篇论文从正反两面划定 Agent Harness 工程的有效性边界。EPFL+Apple 的 Malena 用受控消融证明：骨干够强时，几乎全部收益来自编码 agent 运行时与骨干本身——给模型一个 shell 和文件系统（Chat→Oneshot）是测得的最大单一效应，搜索原语、多 agent 编排全部统计不显著（最大差距 Best-of-N vs UCB1 仅 2.71pp，CI 含 0），单会话极简 agent 在 MLE-bench 上以 62.5% medal 率碾压四个 SOTA Harness（最佳外部 47.1%）。NTU 的 Finding the Right Fit 用 66 配置矩阵证明另一半事实：换 Harness 模型排名完全反转（TB4 上 Claude−GPT 差距在 OpenHands +7.94、PI −30.16，摆幅 38.09pp），6204 条轨迹归因发现 Harness 的真实价值集中于「把失败转成模型可用的反馈」这一件事。合读结论：Harness 的价值不在「编排的丰富度」而在「反馈回路的完整性」，且随骨干增强而向运行时基底收缩。</description></item><item><title>Mem++ + MemFit + Beyond Memory 三篇合读：Agent 记忆系统的三层递进——从非破坏性存储到信念状态 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-memory-paradigm-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-memory-paradigm-trio-paper-reading/</guid><description>合读 2026 年 10 月 1 日同期出现的三篇 Agent 记忆论文：Mem++ 用非破坏性存储与读时选择解决组织记忆的双时态版本问题，MemFit 用全 LLM-free 检索管线把记忆构建成本压掉 88%，Beyond Memory（PoS）则主张长程 agent 需要维护显式信念状态并诊断 Belief Trapping。三篇构成一条清晰递进链：第一层解决「证据不许被破坏」，第二层解决「证据要便宜且精准地找回」，第三层解决「证据不等于对当前世界的一致估计」——而贯穿三篇的共同叙事，是对「写时蒸馏有害」的独立共识。本文按七部分结构拆解三篇的问题定义、方法机制、实验证据与优势根源，并提炼可推广到其他领域的通用灵感。</description></item><item><title>PivotOPD + ComputerSD + EviRover 三篇合读：智能体在线训练的三个新维度 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-online-agent-training-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-online-agent-training-trio-paper-reading/</guid><description>合读 2026 年 9 月底同期出现的三篇智能体在线训练论文：PivotOPD 量化了「59% 的失败轨迹源于单个关键失误、事后引导 2 轮即可把重放成功率从 8% 拉到 58%」这一诊断事实，用预防（反向 KL）/恢复（前向 KL）双蒸馏的不对称设计教会模型从自己的错误状态中爬出来；ComputerSD 把 GUI 每步执行后的截图反馈变成可验证的实时指导，价值门按步级判断一致性调制 token 级信号，配合全异步流水线把吞吐提到 5 倍，EvoCUA-8B 在 OSWorld 达到 47.9% 超全部开源模型；EviRover 则把「感知」本身 agentic 化——模型自己决定放大、裁剪还是搜索，EviLens 基准上较基座平均 +30.2 点，grounding IoU 0.444 超 Gemini-3.5-Flash。三篇分别补上在线训练的三个空白维度：失误恢复能力、实时反馈蒸馏、感知过程 agentic 化。</description></item><item><title>SkillSpec + RASO + Prompt2Skill 三篇合读：Agent 技能优化的三条路线 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-skill-optimization-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-skill-optimization-trio-paper-reading/</guid><description>合读 2026 年 9 月底同期出现的三篇 Agent 技能优化论文：SkillSpec 用共识门控与表示路由解决「改技能时如何不退步」，RASO 用跨 Harness 检索适配把数百万公开技能变成先验知识，Prompt2Skill 则只凭一句自然语言任务描述、零用户数据自动造数据并优化出目标模型专属技能。三篇分别对应可靠性、外部知识、零数据三条路线，共同背书「技能 = 文本程序记忆」范式。本文按七部分结构拆解三篇的问题定义、方法机制、实验证据与优势根源，并提炼可推广到其他领域的通用灵感。</description></item><item><title>信用分配四重奏：给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-credit-assignment-quartet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-credit-assignment-quartet-paper-reading/</guid><description>2026 年 10 月初，四篇论文从四条路线围攻 agentic RL 的同一个软肋：终端奖励只给轨迹级 0/1 分，步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配，把训练信号覆盖率从 GRPO 的 41% 拉到 95%，ALFWorld 91.0%；LinkedIn 的 SHARPO 用段级 hindsight 重加权，84.90±1.19 对 GRPO 70.57（+14.32）；南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器，WebShop score +12.7；UIUC 等的 DARS 用谓词依赖图势函数塑形，ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」：不是要不要过程奖励，而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界，并提炼可迁移的通用做法。</description></item><item><title>后果化评测四重奏：当基准不再比对答案——Argo-Bench、DAYJOB、Incident-Arena、EurekaBench 合读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-benchmark-frontier-quartet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-benchmark-frontier-quartet-paper-reading/</guid><description>2026 年 10 月初，四篇基准论文在同一周内集体宣告了一件事：比答案的时代该结束了。TextQL 的 Argo-Bench 用 74.9 亿行 ERP 模拟器按行动后果给企业数据智能体打分，最强模型 Opus 5.5 仅解决 34.8% 的任务；Surge AI 的 DAYJOB 以全标准通过制测专业交付，Opus 5.5 医疗 24.7%/金融 23.9%，中位配置仅 0.6%；Incident-Arena 用双门 LLM-free 验证器在持续流量与重启下检验生产修复，GPT-6 Astra 也只有 0.59 的 Pass@1，且 55% 的轨迹已执行完整修复却只有 59% 通过——340 例纯粹败在不知道何时停；CMU Neubig 组领衔 10 机构的 EurekaBench 则发现 agent 预测精度已逼近人类（47.4 vs 48.8），科学洞察却悬殊落后（42.4 vs 69.7）。四篇合读指向同一范式转移：让评分落在行动的真实后果上，才能量出被『答案比对』掩盖的能力断层。</description></item><item><title>多智能体可靠性三种失败模式合读：Right Answers, Wrong States + Worse Together + The Delegation Danger Band 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-mas-reliability-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-mas-reliability-trio-paper-reading/</guid><description>把三篇 2026 年 10 月的多智能体系统（MAS）可靠性论文放在一起读：西交大等四机构的 OFFQUERY 发现「答对但状态错」的 off-query 失败（T3 64.7% vs T1 14.3%），REGROUND 三任务齐升（T1 +309.0%）；Anthropic Fellows 的 Worse Together 用四环境 77 场景证明多用户多智能体团队反而劣于单协调者（30% vs 64%），MCP 服务端 guard 挽回 73.1% 失败；PayPal AI 的 Delegation Danger Band 发现继承伤害非单调——只有中间能力的 1.7B 显著受害（Δ(32)=−0.19），最强模型全剂量稳健，策展交接带内 +0.50。三篇合起来勾勒出 MAS 可靠性的三层失灵图景：信息状态污染、公共地悲剧、上下文继承过时。</description></item><item><title>当 Agent 开始自我改进，安全还剩什么？——自进化安全三部曲合读：SAVER × Safety Must Survive Self-Improvement × Sharpening Tax</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-self-evolution-safety-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-self-evolution-safety-trio-paper-reading/</guid><description>本篇合读 2026 年 10 月初同期发布的三篇论文，回答同一个核心问题：当 Agent 通过经验积累、递归自我改进与 RL 后训练不断更新自己时，原本经过验证的安全属性与能力覆盖能否在「改进」中存活？浙大领衔 16 家机构的 SAVER 综述以 683 篇语料绘制自进化 Agent 安全的转移中心地图（Provenance Loss 97 例 / Authority Escalation 77 例）；Tulane 领衔 6 校的实证研究证明「检测到失败≠停止执行」，keep 规则下 42 个失败根 0% 恢复、founder fallback 100% 恢复且保留 43% 以上成本节省；Meta Superintelligence Labs 领衔的 Sharpening Tax 用 pass@K 曲线形状量化后训练代价——42 个组合中 36 个 TaxS(128) 为正，base+harness 在 WebShop 上以 85% vs 56% 反超。三篇合起来构成「领域地图—失败机制—改进代价」的完整认知链条。</description></item><item><title>当评测本身成为研究对象：Agent 评测方法学三支柱合读精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-evaluation-methodology-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-evaluation-methodology-trio-paper-reading/</guid><description>三篇 2026 年 10 月 arXiv 论文从不同角度重写了「怎么评测 agent」这件事：Agents Are Systems 用 432 配置格 × 8640 次实验证明信息轴效应第一（1.93）、54% 分数方差是纯噪声、提示式自我验证无效而 oracle 工具让验证行为 ×3；ReLiveGym 把评测拉长到数周真实回放世界，发现种子方差占 54–95%、触发机制主效应 ω²=11%、cron 在浏览器任务上碾压 sleep；Groundability 证明弱审查者的可靠性由接地证据而非参数量决定——官方证据下 GPT-OSS-120B 达到 catch 1.00/over-rejection 0.00，而 30 倍大的 Qwen3-235B 未检查 catch 仅 0.28。三者合起来构成一份「评测方法学三支柱」：配置系统观、时间维度、审查证据观。</description></item><item><title>经验的去处：Token 化训入权重，还是组件级路由分流？——X-Tree × Component Routing 合读精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-experience-routing-duet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-experience-routing-duet-paper-reading/</guid><description>自改进 Agent 的核心争论——经验该微调进权重还是检索进上下文——在同月两篇论文中得到两个正交答案。Waterloo+Duke+NUS 的 X-Tree 借鉴文本 BPE tokenizer，以「递现次数×长度×成功率」的 X-Score 从轨迹池确定性挖掘技能树，零 LLM 调用，作为数据、奖励、上下文三种信号训入权重：WebArena 离线 RL 22.9 vs Go-Browse 18.4（相对 +24%），随机树消融 −5.0 跌破 SFT 基线，仅 100 条轨迹挖出的树已超 500 样本 SFT。South Dakota State 的 Component Routing 则把经验拆成定位符/过程/状态事实/教训四组件，按训练前可测的复现率 r 与状态条件性 κ 路由：定位符 +4.9、教训 +1.5 归权重，过程 −4.2、状态事实 −4.1 归上下文，路由规则在留出骨干族 24/24 格恢复符号，MobileGym 33.2% 全面碾压（无经验 19.1%）。合读结论：权重与上下文不是二选一，而是按经验成分的性质分流——高复现低条件性进权重，低复现高条件性进上下文。</description></item><item><title>Agent 安全应当是一份运行时契约——精读《Agent Safety Should Be a Runtime Contract》</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-agent-safety-runtime-contract/</link><pubDate>Thu, 13 Aug 2026 10:00:00 +0800</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-agent-safety-runtime-contract/</guid><description>当 Agent 开始执行代码、改写文件、发送消息、操作数据库，把安全寄托在 RLHF 这类训练时对齐上，在结构上是不够的。本文精读 arXiv:2608.11274，拆解其提出的&amp;rsquo;运行时契约&amp;rsquo;范式：预防面阻止危险、证据面验证完成，并以 52 起事件、32 起虚假完成、12 个系统轨迹审计和 28560 篇论文的会议审计四条证据线汇聚论证。</description></item><item><title>AI4AI at Test-Time：通过脚手架实现强到弱的能力迁移</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-ai4ai-test-time-harness-transfer/</link><pubDate>Thu, 13 Aug 2026 10:00:00 +0800</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-ai4ai-test-time-harness-transfer/</guid><description>Salesforce AI Research 提出强到弱脚手架范式：让强构建者模型为固定弱目标模型构建推理时脚手架，在不更新参数的前提下，将 GPT-5.4-mini 在四个心智理论基准上的宏平均准确率从 0.49 提升至 0.91。本文从背景、定位、问题定义、解法、知识反推、通用灵感六个维度精读全文。</description></item><item><title>EvoX Genesis：用持久递归世界让软件自主演化</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-evox-genesis-persistent-recursive-worlds/</link><pubDate>Thu, 13 Aug 2026 10:00:00 +0800</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-evox-genesis-persistent-recursive-worlds/</guid><description>深度精读 EvoX Genesis（arXiv 2608.10450）：它把&amp;rsquo;持久化&amp;rsquo;从 agent 转移到项目，用持久递归世界在 120 小时、44 美元内从空仓库长出 25 万行 Rust C 编译器，跨模型替换保持测试全通过，并把 10 万行 Fortran MESA 重写为 9 万行 Rust 获得 1.55–6.87× 加速。</description></item><item><title>Spark-to-Paper：将端到端论文生成做成可组合技能</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-spark-to-paper-composable-skill/</link><pubDate>Thu, 13 Aug 2026 10:00:00 +0800</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-spark-to-paper-composable-skill/</guid><description>深度精读 Spark-to-Paper（arXiv:2608.11924）——一个把研究论文生成做成 13 个可组合技能、预注册式实验规划、Self-Refutation Loop、6 个确定性门控、双路径可编辑图表的端到端系统。引用有效率 99.5%、图表可编辑性 96.4%、伪造检测 14%→92%、每篇 $8.1 / 3.2h / 11.9M token。</description></item><item><title>【论文精读】SkillZip：面向可扩展 Agent 技能库的契约保持图压缩框架</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-skillzip-contract-graph-compression/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-skillzip-contract-graph-compression/</guid><description>深度解读 SkillZip（arXiv 2608.05604）：一个执行感知的程序性抽象框架，通过节级图表示、MotifZip 契约保持压缩、PathHydrate 预算内水合和 ReZip 增量维护四大组件，在 ALFWorld 上提升 12.2 分、SkillsBench 上提升 6.2 分，同时实现 3.46× 压缩比、99.2% 依赖保持和 98.7% 验证器可达性，并在 100K 技能库上保持 248.3ms 延迟的稳定检索。</description></item><item><title>Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-mechanist-ai-scientific-instrument/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-mechanist-ai-scientific-instrument/</guid><description>深度精读 arXiv:2608.12036——浙江大学 ZJUNLP 提出的 Mechanist 是一个用 AI 研究AI的自主智能体系统。它构建了约13000篇可解释性论文的知识图谱、整合4300万篇跨26学科论文库、沉淀32种机制分析方法，形成「假设生成→因果干预→验证循环」的闭环。在复现16篇论文的可靠性评估中，比 Claude Code 高出9-13%、比 AI Scientist 高出31-38%。更重磅的是，它自主发现了跨模态安全风险转移（不安全响应率从20.3%飙升至48.6%）、提出了完整的信念机制理论，并成功将机制洞察转化为DNA序列引导生成（α-螺旋含量从43.8%提升至56.6%）。这是一篇关于「让AI成为研究AI的科学仪器」的里程碑式工作。</description></item><item><title>OpenART Arena: Scaling Agent Red Teaming via Open-Ended Environment Evolution 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-openart-agent-red-teaming/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-paper-openart-agent-red-teaming/</guid><description>OpenART 是评估 Agent 在演化环境中安全性的大规模红队测试 Arena：覆盖 10,000+ 验证场景、50 个领域、500,000+ 工具/MCP/Skills，通过 15 个真实部署的 Agent × 5 个基础模型 = 75 个配置展开评测。其参考策略 EMHA（Evolutionary Markov Hypergraph Attack）以超图遍历、授权状态转移、档案引导演化为核心，在不更新任何参数的前提下取得 85.0% 的池化 Strict ASR。本文系统拆解其问题定义、EMHA 技术细节、8 个攻击向量、消融实验与三类反复出现的漏洞模式，并提炼出对 Agent 安全研究的可迁移方法论。</description></item><item><title>Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-agent-skills-harmful-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-agent-skills-harmful-paper-reading/</guid><description>这篇来自华为与华中科技大学的 empirical study 首次系统地把 LLM Agent 的失败归因到「被加载的 Skill」上。作者借鉴差分测试思想，构建配对执行（有 Skill vs 无 Skill / 语义匹配 Skill），在 SkillsBench 与 SWE-Skills-Bench 上确认了 307 个技能诱导失败（125 功能失败 + 182 效率回归），并开发分类法驱动的 SkillTriage 归因工具。最反直觉的发现：看似相关的 Skill 比不相关 Skill 更有害——它让 Agent 错误实现或漏掉任务必需元素；效率回归的最大来源不是提示长度，而是「过度程序」（过度验证 67 例、重实现管道 30 例）。</description></item><item><title>AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-ai4ai-test-time-transfer-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-ai4ai-test-time-transfer-paper-reading/</guid><description>Salesforce AI Research 联合 Notre Dame、UIUC（Heng Ji）提出强到弱推理时脚手架（Strong-to-Weak Scaffolding）：用强 builder 模型为弱 target 模型自动构建推理时 harness，无需任何参数更新即可在四个 Theory-of-Mind 基准（3900 项）上将 GPT-5.4-mini 从 0.488 提升到 0.912（+0.423）。机制分析表明增益主要来自把不稳定的自然语言推理卸载为确定性代码（r=0.72），而非更长推理链或更多采样。这是对传统训练时蒸馏的一条互补路线，也直接印证了 harness 工程作为独立工程对象的价值。</description></item><item><title>ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-combodied-agents-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-combodied-agents-paper-reading/</guid><description>Bang Liu 团队 38 页范式论文，提出继 Digital Agents（数字状态）和 Embodied Agents（物理状态）之后的第三种 Agentic AI 行动基底——Combodied Agents（以人的演化状态为核心）。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架，并把&amp;rsquo;保留并增强人类 agency&amp;rsquo;首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。</description></item><item><title>Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-harness-if-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-harness-if-paper-reading/</guid><description>ByteDance Seed 团队提出的 Harness-IF 把「编程 Agent 是否真的在遵守指令」这件事第一次变成了可量化、可归因的规则级测量问题。它构造了 642 条原子规则的库，实例化出 60 个多轮编程任务，在 5 个可配置的「指令表面」(系统提示/工具描述/技能描述/项目文件/用户指令)上分别打分；更重要的是，它用 Against-Prior Accuracy(AP-Acc)把「模型本来就是这么做」的巧合从「真正遵从指令」中剥离出来——12 个前沿模型无一例外都在反先验规则上表现更差，平均落差 5.81 分。配套的 E0 冲突实验还揭示了一个反直觉结论：表面优先级并不服从提示深度，SP/PF/UI 同居首位，而工具描述和技能描述垫底。这篇精读从背景、定位、问题、解法、证据、根源、知识反推到通用灵感，完整拆解这项与 Harness 评估方向高度相关的工作。</description></item><item><title>Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-mendel-godel-machine-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-mendel-godel-machine-paper-reading/</guid><description>LMU Munich 团队提出的 Mendel Gödel Machine (MGM)，将孟德尔遗传学中「受控比较分离遗传效应」的原理引入自改进编码智能体。在 HGM 的树搜索框架之上，MGM 新增两种自我修改算子——反应规范突变（跨任务比较同一基因型）和跨谱系杂交（跨谱系比较同一任务），在不增加任何额外任务评估成本的前提下，把 Qwen3.6-35B-A3B 在 Polyglot 上的成绩从 50.8% 拉到 93.3%，以约 117× 更少参数超越闭源 GPT-5；进化的脚手架迁移到 DeepSeek-V4-Pro 后在完整 Polyglot-225 上达 96.9%。本精读覆盖其生物学启发、三种算子机制、加性适应度景观下的收敛性证明、实验证据与通用性灵感。</description></item><item><title>SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-skillzip-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-skillzip-paper-reading/</guid><description>深度精读阿里+浙大+杜克联合提出的 SkillZip——首个无需任务回放（evaluation-free）的 Agent 技能压缩方法。它把&amp;rsquo;自进化积累的技能&amp;rsquo;视为一份带类型签名的契约，用&amp;rsquo;解释一次，引用多次&amp;rsquo;的直觉统一了规则共享、作用域提升、工作流复用与例外编码，形式化为一个带硬覆盖约束的类型化最小描述长度（MDL）目标。实验显示：平均压缩 31.2%，性能甚至略超未压缩技能，压缩速度比最强基线 SkillReducer 快 3.5 倍，且零次任务 rollout。</description></item></channel></rss>