Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation 精读

深度精读投 IEEE TDSC 的浙大+南通大学论文——研究 LLM 生成 RTL(硬件描述语言)代码时被忽略的「隐式安全义务」问题。软件漏洞还能打补丁,不安全的硬件一旦流片就无法修复。作者构建 SECRTL-GEN 基准:98 个真实 SoC IP 设计×4 种硬件语言=392 个任务,实测 5 个前沿模型功能通过率 73-79% 但安全通过率仅 14-35%,功能强不等于安全。提出 RTL-Obliger 神经符号框架:LLM 提取功能语义图,符号引擎对照 CWE 模式本体做确定性匹配找出「缓解证据缺口」,最后两阶段生成先写功能草稿再做义务引导局部修订,将全通过率从基线 49.6-51.4% 提升到 61.6%,token 成本仅为编码 Agent 的 1/3.6 到 1/8.7。

August 28, 2026 · 3 min

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 精读

深度精读上海交大、新加坡国立大学、美团、港中文、牛津等合作的 UrbanGround:基于香港地政署全境 3D 地理数据构建真实尺度城市沙盒,以五级「空间能动性阶梯」810 个人工验证实例评测 MLLM Agent 能否把局部感知转化为可靠行动。结果尖锐:视觉识别可高达 80-93% 但方向理解接近四选一随机;短导航最高 75% 而长导航几乎全军覆没(最高 3.8%)——局部能力存在,却无法组合成持续目标导向行为。

August 28, 2026 · 1 min

When Context Gets Root: Privilege Escalation in LLM Harnesses 精读

深度精读南京大学与荣耀终端的 LLM Agent 安全论文。作者提出「指令特权升级」这一新攻击范式:利用 agent harness 在委派子智能体、持久化目标、定时任务时的上下文重构,把工具级恶意内容真实地提升为用户级或系统级指令。在 Claude Code、Codex 等 6 个主流编码 agent 上,13 个攻击目标(含远程代码执行)全部达成,连自动权限审查也被绕过。

August 28, 2026 · 2 min

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution 精读

Agent 从经验里学到的教训,往往散落在一次次的优化历史里,下次想用时已经找不到了。Google Research 与弗吉尼亚理工的 WikiSkill 在经验与技能之间加了一个持久知识层:不可变的原始轨迹层、持续复利的 wiki 知识层、可回滚的技能层,四组件循环让经验先编译成知识、知识再孕育技能。五个基准、五个模型上,WikiSkill 平均提升 12.3 到 23.9 个点,Qwen-3.5-9B 加技能后反超 27B 无技能模型。消融显示 wiki 层贡献 15 个点,而跨模型迁移实验揭示了技能发现与技能执行是两种可解耦的能力。本文精读其三层架构设计与知识编译机制。

August 28, 2026 · 3 min

A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption 精读

深度精读 Stanford + CMU + Grid Dynamics 的 ASE 2026 论文:提出 RAMP 四级仓库 AI 成熟度标度(基于团队 commit 到版本库的 AI 配置工件而非问卷),对 509 个采用 coding agent 的仓库分层再分析——agent 在各成熟度层都加速开发(+28~38% commits),但质量代价分化:无配置仓库的认知复杂度增幅约为有配置仓库的 2 倍(+53% vs +27%)。

August 27, 2026 · 3 min

A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation 精读

用 LLM 当评委(LLM-as-a-Judge)已是 AI 评估的通用做法,但一个根本问题从未被检验过:当被测内容真的变了,评委的判分会跟着变吗?华南理工与澳门大学团队借用心理测量学的’构念效度’框架,提出评委必须同时满足两条件——构念保持的编辑下判分不变(不变性 S)、最小构念改变编辑下判分必变(敏感性 R)。实测 7 个评委 × 4 个领域发现:匹配不变性 S=0.945 时敏感性仅 R=0.319,最强评委仍漏掉五分之二的构念变化;且评委对’声明的覆盖范围扩大’敏感、对’承诺强度提高’近乎失明(+0.121 差距,7/7 评委同号)。论文还证明现有评估标签集本身可被只看表面形式的预测器恢复 55%-67%——尺子先漏了。

August 27, 2026 · 4 min

Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems 精读

多智能体 LLM 系统跑失败了,到底该怪哪个 Agent、哪一步?AWS Agentic AI 与特拉维夫大学提出的自适应影响图(AIG)给出的答案是:这不是模型不够聪明的问题,而是接口设计的问题。论文把人类工程师调试系统的’可观测性’范式搬给 LLM——先用 agentic builder 把失败的原始日志构造成带继承边的影响图,再用 agentic reader 沿边回溯定位首个错误。在 Who&When 基准上,同一模型仅靠改善轨迹表示就从 46.40% 提升到 55.20% 的步骤定位准确率,刷新 SOTA。本精读将拆解其四级接口阶梯、两阶段框架与增益根源。

August 27, 2026 · 4 min

Adaptive Triggering for Bias Correction in LLM Reasoning 精读

亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题:每步计算一个偏见风险信号,喂入 CUSUM 统计量,仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版(LLM 裁判打分)在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率(90.1% vs 82.9%),独立裁判下仍成立。白盒版(next-token 概率信号)在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」,证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致,并指出「未完成率」是被误当准确率损失的一种独立干预代价。

August 27, 2026 · 3 min

Agentic Autoresearch for Cell-Edge Power Control 精读

深度精读 Ericsson + 多伦多大学论文:把学习型无线资源管理算法的全部五层设计权(架构/输入表示/输出参数化/损失函数/任务采样)交给自主 agent,在强 NP-hard 的多小区 SLqP 功率控制上,81 个无人值守实验、26 小时内达到最强已知基准的 99.5%、推理成本约 600 倍 lower,并精确恢复了经典 max-min 结构。

August 27, 2026 · 3 min

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence 精读

深度精读 ISSTA 2026 的 EAVA 论文——浙江大学与华为(加拿大)合作提出的自动化软件漏洞评估框架。针对现有方法「只给答案不给证据、无法处理截图与长代码、忽略项目上下文」三大缺陷,EAVA 用三个专用 LLM Agent 预处理富文本、用「开卷反推」构造 51,568 个推理轨迹标注(专家抽检 97.8% 合格)、SFT+GRPO 两阶段训练专用 8B 评估模型。在新收集的 6,446 份漏洞报告数据集上,平均 F1 0.874 / MCC 0.646,比最强基线 proEVA 高 5.3%/18.7%;用户研究中 96.8% 的证据被安全专家评为有用。本文拆解「开卷标注→闭卷推理」这一数据构造范式的完整机制。

August 27, 2026 · 5 min