State of Thought Enables Endogenous Reasoning 精读

测试时推理的现有范式要么给模型套外部推理程序(CoT/Plan-and-Solve),要么暴力扩展搜索(Self-Consistency/MCTS)——控制信号都是外生的。NTU 提出 State of Thought(SoT):从模型内部信息传递提取紧凑动力学-几何状态,582 参数控制器在冻结 backbone 上按当前推理状态选择性激活历史推理支持——推理变成’证据上的状态条件化过程’。16 数据集×3 LLM:量化/通用/符号代码/长上下文推理平均提升 1.34×/1.62×/1.76×/2.51×,同时 token −62.6%、延迟 −44.6%;training-free 与 embedding-only 设定下仍保留 38.2%/36.5% 增益,证明内生状态信号真实存在且可低成本利用。

September 17, 2026 · 2 min

AlgoEvo × MOSCOPT × SkillLift:Skill 优化三部曲 精读

三篇同日论文从三个角度推进 skill 优化。AlgoEvo(港城大):把算法发现 agentic 化——design skill hub 解耦范式知识与发现引擎,三层经验库(经验卡/经验树/跨任务固化)组织搜索轨迹,6 任务匹配或超越专用方法且评估数与 token 大减。MOSCOPT:skill 池+gating skill 联合优化——EditAdam 双态维护+三阶段交错更新,免梯度单调改进,突破’单模板优化’的协同缺失。SkillLift:稀疏 oracle→稠密 rubric 双层优化——冻结 rubric 作廉价代理引导 skill 修订,解耦搜索与 oracle 成本。本精读合并解读 skill 优化的三条进化路径:知识组织、多技能协同、评估降本。

September 16, 2026 · 2 min

Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents 精读

临床 Agent 的’执行差距’:急诊整班次模拟(CES)中 Agent 多能给出正确诊断(4.39/5)却无法完整及时执行关键动作(2.94/5/3.34/5)——诊断对但病人死的结构性失败。Asclepius 三件套:换班间用 trace 反馈重写操作手册的自进化 harness、高风险规程外置的临床技能库、按病人队列隔离的三个子 Agent。held-out 批次上 critical-action correctness +22%(p=0.024)且诊断精度保持。本精读覆盖执行差距的三失效模式操作化与’操作手册级’harness 演化的医疗安全意义。

September 16, 2026 · 2 min

Atria Dawn: The Dawn of Agentic Superintelligence 精读

上海人工智能实验室发布 744B MoE 开源 Agent 基座 Atria Dawn Preview:以 Verifiable Experience Pipeline 把训练信号锚定在可执行环境与外部可验证结果上,16 基准中 5 个登顶(Terminal-Bench 2.1 = 90.2、SWE-bench Pro = 74.7);更独特的是把自身 769 条任务记录的 R&D 过程作为人机协作案例研究——1/3 任务被人类评为无 AI 不可行。本精读覆盖可验证经验管线的设计逻辑、五榜登顶的机制根源、以及模型报告与 HAI 研究双重身份的方法论价值。

September 16, 2026 · 2 min

Dream-RSI: Recursive Self-Improvement through Evolving Worlds 精读

RSI(递归自我改进)的核心瓶颈是探索策略管理:固定策略无法适应搜索空间扩张,在线策略优化又受困于长程 rollout 的延迟昂贵反馈。Dream-RSI 的关键洞察是——积累的发现历史本身就是已实现搜索空间上的重放模拟器,把探索策略的改进从昂贵的真实环境 rollout 搬到廉价的历史重放(做梦即训练)。Lasso 求解器发现任务上 agent 调用较 SimpleTES 削减 162×,held-out 运行时 3587→2931ms。本精读覆盖三环循环机制、重放模拟器的信息学根基与发现求解器的算法细节。

September 16, 2026 · 2 min

Fabrication After Tool Failure × Why LLM Agents Collapse:Agent 诚实性与执行差距双面镜 精读

两篇同日论文从微观与宏观两面照出 Agent 的可靠性盲区。微观(Fabrication After Tool Failure):工具失败被强制隔离后,14.10% 回应不诚实——失败是否被信号化几乎完全主导诚实性:status:error 时 0.0% vs status:ok+坏值时 45.3%,九个生产框架无一幸免;有效防御的关键是为模型命名一个’可处的状态’而非删除指令。宏观(Enforcement Gap):Emergence World 三种崩溃(Grok 犯罪/GPT 瘫痪/Claude 举报)统一归因于’审计看到但控制器无视’——不到 20 行代码的修复降低攻击成功率 4 倍。本精读合并解读’诚实性由环境信号塑造’与’检测-执行断裂’两条机制链。

September 16, 2026 · 2 min

HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning 精读

同一模型在不同 harness(系统提示/工具 schema/控制循环/轨迹格式)下表现不均——多 harness 共同训练时每个优化步选哪个 harness 是被忽视的调度问题。HarnessBandit 用双信号在线调度:learnability(批平均绝对优势,还有多少可学)× transferability(梯度 sketch 余弦,学了是否白学),bandit 采样决策。6 harness 在 ClawGym 训练,held-out 任务与 held-out harness 双评测均优于混合批次训练。本精读覆盖双信号的互补性设计与 DeepSeek 产学研背景下的调度理论落地。

September 16, 2026 · 2 min

ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement 精读

harness 自改进的泛化性危机:在评测基准上演化=对测试集过拟合,单轨迹更新把系统性缺陷与实例细节纠缠。ModularRSI 三重解法——benchmark-disjoint(2000 个外部演化任务与评测基准不相交)、对比式信用分配(同任务成功/失败轨迹对比聚合跨任务证据)、模块化定位(缺陷归因到 harness 具体组件)。DeepSeek-V4-Flash 骨干上 SWE-Bench-Verified 73.40→76.45、TerminalBench 2.0 47.57→52.43,演化 harness 可跨基座迁移。本精读覆盖三大缺陷的诊断逻辑与对比式信用分配的因果推断本质。

September 16, 2026 · 2 min

MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding 精读

自主编码 Agent 除功能正确性外还须在整个开发生命周期遵循过程指令与约束,但现有基准只测最终功能或单轮指令——多轮 Agentic Coding 的指令遵循是评测空白。MTAC-IFBench:多轮渐进式指令 + 6 主类/18 子类约束(平均 7.04 轮、91.33 约束/实例),每约束配 checklist 实现可验证评估。结果揭示残酷现实:最强 GLM-5.2 仍有约 20% 过程约束失守,多数 LLM 完美合规轮次 <10%。本精读覆盖’过程合规’与’功能正确’的分离测量及 checklist 化评测的构造方法。

September 16, 2026 · 2 min

PMPA × SkillSecurer × SkillAtlas:Skill 与记忆安全三连 精读

三篇同日论文从攻击、防御、资源三面拼出 skill/记忆安全的完整地图。PMPA(复旦):harness 持久记忆投毒——恶意指令藏进良性外部源诱导 Agent 写入持久记忆,OpenClaw ISR/C-ASR 73.7%/55.5%、Claude Code 66.9%/81.7% 且良性性能保持。SkillSecurer:红蓝 Agent 对抗扫描 skill 注入漏洞,9 威胁类型注入级评估,最佳后端唯一 100% 检测率,skills.sh 热门 skill 17%+ 有漏洞并实测触发事故。SkillAtlas:3014 案例/6589 轨迹的托管攻击轨迹库,42.5% 成功案例首轮失败后才成功,轨迹标签把 pre-execution guard 精度提至 0.770。本精读合并解读攻击面(记忆写入)→防御(红蓝扫描)→基础设施(公共案例库)的完整安全链条。

September 16, 2026 · 2 min