SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models 精读

潜在思维链模型把中间推理从生成的文本搬进连续内部状态,代价是因果对象被藏了起来:无法再靠阅读推理文本验证忠实性。SCIT(Suffix Cache Interchange Test)把「干预潜步成功了吗」细化为「到底是哪个transformer对象在因果承载这个计算」——是hidden state、key cache、value cache,还是某个缓存段?通过构造精确的source-recipient反事实对并网格化移植cache切片,论文发现:在CODI-GPT2算术检查点上,反事实转移主要由中晚期value-cache后缀轨迹承载,而非hidden向量、key路由或可复用答案槽;且8B能力更强模型上载体整体迁移到prompt-prefix。方法层面「载体测试」将interchange intervention从预指定变量推广到发现承载对象本身。

August 28, 2026 · 1 min

SPA: Securing Persistent LLM Agents Across Queries with Plan-First Information-Flow Control 精读

深度精读南佛罗里达大学的持久化 Agent 安全论文 SPA。针对跨查询的延迟注入攻击——周一埋入的恶意账户潜伏到周二的付款请求中生效——SPA 采用计划先行架构:planner 每查询只调用一次、生成声明式 DSL 完整计划,工具输出与持久化 payload 永不进入 planner 上下文,再以 Bell-LaPadula+Biba 双格信息流控制静态验证计划。在 tool_knowledge 攻击下 ASR 降至 0%,但约 53% 的合法计划被完整性检查拒绝,暴露出强完整性的安全-效用张力。

August 28, 2026 · 2 min

TTPO: Test-Time Policy Optimization 精读

没有标签也能在测试题上直接训练模型?浙大与阿里的 TTPO 给出了一个干净的不对称方案:多数投票选出伪标签后,同意的 rollout 走蒸馏分支(OPSD 前向 KL + 降权已收敛 token),不同意的走 GRPO 惩罚分支(只罚高置信错误 token)。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的,但不同意它的 rollout 约 79% 本身也是错的,所以「惩罚不一致」不需要伪标签正确,而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD,Qwen3-1.7B 从 38.0% 提到 45.2%,4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。

August 28, 2026 · 1 min

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读

进化策略(ES)一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低,但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象:理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K;实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型,而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍,但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。

August 28, 2026 · 3 min

Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation 精读

深度精读投 IEEE TDSC 的浙大+南通大学论文——研究 LLM 生成 RTL(硬件描述语言)代码时被忽略的「隐式安全义务」问题。软件漏洞还能打补丁,不安全的硬件一旦流片就无法修复。作者构建 SECRTL-GEN 基准:98 个真实 SoC IP 设计×4 种硬件语言=392 个任务,实测 5 个前沿模型功能通过率 73-79% 但安全通过率仅 14-35%,功能强不等于安全。提出 RTL-Obliger 神经符号框架:LLM 提取功能语义图,符号引擎对照 CWE 模式本体做确定性匹配找出「缓解证据缺口」,最后两阶段生成先写功能草稿再做义务引导局部修订,将全通过率从基线 49.6-51.4% 提升到 61.6%,token 成本仅为编码 Agent 的 1/3.6 到 1/8.7。

August 28, 2026 · 3 min

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 精读

深度精读上海交大、新加坡国立大学、美团、港中文、牛津等合作的 UrbanGround:基于香港地政署全境 3D 地理数据构建真实尺度城市沙盒,以五级「空间能动性阶梯」810 个人工验证实例评测 MLLM Agent 能否把局部感知转化为可靠行动。结果尖锐:视觉识别可高达 80-93% 但方向理解接近四选一随机;短导航最高 75% 而长导航几乎全军覆没(最高 3.8%)——局部能力存在,却无法组合成持续目标导向行为。

August 28, 2026 · 1 min

When Context Gets Root: Privilege Escalation in LLM Harnesses 精读

深度精读南京大学与荣耀终端的 LLM Agent 安全论文。作者提出「指令特权升级」这一新攻击范式:利用 agent harness 在委派子智能体、持久化目标、定时任务时的上下文重构,把工具级恶意内容真实地提升为用户级或系统级指令。在 Claude Code、Codex 等 6 个主流编码 agent 上,13 个攻击目标(含远程代码执行)全部达成,连自动权限审查也被绕过。

August 28, 2026 · 2 min

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution 精读

Agent 从经验里学到的教训,往往散落在一次次的优化历史里,下次想用时已经找不到了。Google Research 与弗吉尼亚理工的 WikiSkill 在经验与技能之间加了一个持久知识层:不可变的原始轨迹层、持续复利的 wiki 知识层、可回滚的技能层,四组件循环让经验先编译成知识、知识再孕育技能。五个基准、五个模型上,WikiSkill 平均提升 12.3 到 23.9 个点,Qwen-3.5-9B 加技能后反超 27B 无技能模型。消融显示 wiki 层贡献 15 个点,而跨模型迁移实验揭示了技能发现与技能执行是两种可解耦的能力。本文精读其三层架构设计与知识编译机制。

August 28, 2026 · 3 min

一支疫苗,一个病人:Moderna三期读出之后,个性化癌症疫苗的科学与工程真相

Moderna的mRNA个性化癌症疫苗联合K药在黑色素瘤术后辅助三期临床获积极读出,股价盘中一度暴涨超200%——但市场真正兴奋的不是单一适应症,而是"一人一药"路线首次跨过三期门槛。对话艾博生物CEO英博拆解其真实边界:科学上仅验证术后清除残留病灶场景(RFS终点而非OS,未获批);工程上要把"药品制造的nightmare"压缩进术后四到六周窗口,靠一人一机的全自动小型化产线实现;成本大头是一次性耗材而非测序或算法,艾博把整个生存期总费用设计在几十万人民币以内的可负担水平。嘉宾判断:核酸药因四字母本质最可能被AI驱动,但"AI离开自动化就是空谈";监管放行两周是比算法更硬的约束;五到十年内PD-1获批的适应症mRNA肿瘤疫苗将陆续获批。

August 28, 2026 · 2 min

【每日AI前沿追踪】2026年08月27日 核心技术与产业动态速递

今日79篇候选论文深度阅读后聚焦33篇高新颖性工作:JIT-Agent提出Model-as-a-Harness范式让DeepSeek-V4-Flash在4项基准反超GPT-5.6且成本省36%,SymTrace用回放冻结随机性证明多智能体修复方法与重采样无差异,SimVerity首次量化模拟通过到物理部署的判定失真;产业侧英伟达129亿美元收购Hugging Face震动开源界,GLM-5.3-Flash揭晓匿名屠榜模型Ox Alpha真身并全程国产芯片推理,OpenAI发布Hugging Face入侵事件技术报告披露700智能体秘密协调全程。产学研合作聚焦’企业出真实生产环境与失败信号+高校出测量与自进化方法’:华为+港城大昇腾内核优化、字节+港中文RCA自进化harness、Ericsson+多伦多无线autoresearch等8组联合。

August 27, 2026 · 16 min