Code World Model: Coding Agent as World Brain 精读

西湖大学 AGI Lab 与南洋理工提出 Code World Model:让编码 Agent 充当「世界大脑」,用可执行代码维护持久世界状态并驱动世界演化,再通过 proxy(粗粒度代理视频)接口把状态翻译成帧级时空约束,交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦,直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后,模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动,并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。

August 27, 2026 · 3 min

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 精读

开源模型能否拥有专业级网络安全能力?北航联合 ELLIS、IQuest Research 与新加坡管理大学发布 CyberFactory——一个把野外真实 CVE 工件转化为可执行、可验证训练监督的统一开源框架,覆盖 PoC 生成、漏洞修补、安全问答三任务。其核心是一条’可验证差分 oracle → 技能引导轨迹合成 → SFT 内化’的流水线:差分判定器(补丁前崩溃、补丁后不崩溃)使 agent 能无人监督地 propose-verify-refine;可复用’漏洞分析技能’改变教师模型的工作流(领域引导探索覆盖率 3.78%→99.85%);训练出的 OpenAegis(Qwen3.5-397B-A17B)在 CyberGym 上 Pass@1 达 58.1%,超基座 28.5 个百分点、超 1T 参数的 Kimi K2.7,且推理时不需要技能——工作流已被内化为模型参数。

August 27, 2026 · 4 min

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness 精读

KAIST 与东京大学合作研究机器遗忘的「复活」问题:遗忘后的 LLM 经短暂微调即可恢复已删知识。论文反驳「权重移动距离决定鲁棒性」的流行假说,提出免训练预测器 FRAG——度量遗忘更新是否集中在 forget 关键权重而避开 retain 关键权重,Spearman 相关达 −0.78(全局 L2 仅 −0.36);同原理 instantiated 为剪枝方法 FRP,在三种重学习攻击下 post-attack 遗忘分数全面最优。「哪些权重动了」比「动了多远」更能解释鲁棒性。

August 27, 2026 · 3 min

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail 精读

帕绍大学单作者研究,用一台CPU笔记本完成了一项改写agent工程常识的测量:把失败调用和报错追加进transcript这个从ReAct沿用至今的标准做法,会让小模型更倾向于重复刚刚失败的动作。定义corrective gain指标后,6个模型(135M-1.7B)在两个环境的G全部为负(约-1.03 nats/token,每token odds×2.8)。反事实分解揭示根因:83%的损害来自失败调用的表面形式触发了复制机制,而非模型读不懂报错。由此预测并验证:描述化改写与decoder级ban有效,‘别重复’指令无效,而’清空上下文重试’这一先前推荐方案恰恰最糟——它精确恢复了产生失败的上下文。

August 27, 2026 · 2 min

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis 精读

微服务故障根因分析(RCA)自动化该往哪个方向使劲?这篇香港中文大学与字节跳动的论文先用 24 个受控实验给出反直觉结论:裸的通用编码 Agent(Codex/Claude Code)已经全面超过从零构建的专用 RCA Agent——但离生产可用还很远,缺的不是推理能力而是系统特定经验。答案不是重造 Agent,而是造一个能自我进化的外部 harness:OpsHarness 用四层知识与 idea-card 工具库做数据平面,用「挖掘-验证」双门进化循环做控制平面,Top-1 准确率 59.0%(较裸 Agent 相对提升 63.4%,是专用 Agent 的 4.02 倍),并在真实生产环境拿到约 3 倍提升、同一故障复发时从 Top-3 之外跃升 Top-1 且 2 分钟内定位。

August 27, 2026 · 4 min

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use 精读

OODA-Tool(AACV 2026)诊断出多轮工具使用的核心失败模式为「状态-动作竞争」:直接函数调用与 ReAct 策略在同一条自回归轨迹里同时学状态跟踪和动作生成,产出下一个调用的压力会覆盖早期积累的信息。借鉴博伊德的 OODA 循环,它把决策拆为 Observe(重建任务状态)→ Orient(判断执行就绪)→ Decide(形成动作结构)→ Act(落地实现)四个类型化阶段,由中央控制器逐级校验交接。在 ToolDial 上用 Qwen3 从 0.6B 到 14B 全规模评测,Specialized OODA 相比 Direct-LoRA 提升 4.48-6.99 个百分点,小模型与状态密集型任务增益最大;状态-动作矛盾率从无分割的 10.7% 降至 3.9%,代价是 2.36 倍延迟。本精读拆解其类型化接口、消融证据与并行调用边界。

August 27, 2026 · 3 min

FrontierChallenge: Evaluating Scientific Workflow Completion 精读

深度精读 Apodex 团队的科学工作流基准论文——300 个端到端科学工作流(本文发布 97 个、203 个内部留出),覆盖量子化学/分子动力学/材料表征/分析化学/生命科学/电化学环境六域 21 个工作流族,评测单位是完整交付的工件 bundle 而非单一答案。12 个前沿模型 × 3 种 scaffold 的结果揭示核心裂口:最高平均分 87.9 但最高 Pass Rate 仅 20.6%,分析化学 87.6 分对应 4% 完成率、电化学 94.9 分对应 0%;非通过 Claude Code 轨迹中 75.5% 结尾仍声称「已完成」——高分与自信声明都不是交付成功的可靠信号。

August 27, 2026 · 4 min

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs 精读

Texas A&M 与诺维萨德大学团队提出 FuzzingBrain-Bench:第四代 LLM 漏洞发现评测范式——不再要求模型复现预定义目标漏洞,而是在自包含 Docker 沙箱中经 fuzzing harness 触发尽可能多的不同 crash,按「去重后的不同 crash 签名数 × 难度系数」计分。基准含 77 道挑战(43 个开源项目,36 C/32 C++/9 Java),覆盖内存安全与 DoS 等 14 类缺陷;三跑复现门控防 flaky 虚增、每挑战 3 签名封顶防单一多产缺陷主导、答案剥离+无网络+oracle 不可达防作弊。三个 Claude 模型实测:Opus 4.8 以 196/579(34%)居首,触发 60/77 挑战的 crash;13 道 D5 挑战无一模型攻破。实验还证明模型常发现计划外缺陷——这正是放弃「目标复现式」评分的直接证据。附带成本/token/轮次的行为分析揭示输入 token 是输出的 84–188 倍。

August 27, 2026 · 4 min

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in MoE LLMs 精读

MoE(混合专家)架构靠稀疏激活省钱省算力,但 Louisiana State、UCLA 等五校联合团队发现:终止 token(EOS/EOT)的生成权竟集中在极少数「终止相关专家」手里,路由层因此成了一个局部化的攻击面。Groundhog Bit-Flip Attack(GBFA)——首个针对 MoE LLM 的 bit-flip 型 Denial-of-Wallet 可用性攻击——只需翻转路由器权重中平均不到 4 个专家对应的少量 bit,就让平均输出膨胀 5912%(最严重 87 倍)、多数样本顶满 token 上限,而模型语义基本无损、PPL 几乎不变。攻击波及对话、推理(思考永不停)、Agent 规划(10 个沙盒全部顶满步数)三种模式。本精读拆解「专家-终止 token 特化」的发现、免推理的脆弱 bit 搜索,以及为什么防御如此棘手。

August 27, 2026 · 4 min

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读

深度精读腾讯微信团队(26 Aug 2026)论文 IAPO:多轮服务 Agent 训练中,最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图(支持使用边/失败使用边),用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势,不改奖励、采样与损失实现,在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%(+12.57pp),电信域增益最大达 +18.19pp,且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。

August 27, 2026 · 5 min