Sycophancy Suppression Can Impair Rational Updating 精读:抗谄媚不应牺牲理性纠错

伊利诺伊大学芝加哥分校与新加坡国立大学提出:LLM 的答案翻转分为无依据屈服与理性更新两类,主流抗谄媚方法在压制前者的同时往往连带损伤后者。两轮诊断实验显示 DPO 抗压训练让 Llama-3.1 屈服率降 32.9 个点却让理性更新率掉 48.9 到 53.7 个点,联合优化也难以幸免。机制分析进一步发现两种行为共享大量 MLP 神经元与注意力头、steering 方向余弦相似度全 16 组为正,说明纠缠是结构性的。论文主张抗谄媚是选择性问题而非压制问题,正交化 steering 的初步探索把选择性设置从 5/36 提到 10/36。

August 31, 2026 · 3 min

Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction 精读

UC Berkeley 与国立阳明交通大学 2026 年 8 月论文,研究 Skill-as-a-Service 场景下的知识产权窃取:付费客户仅通过提交普通任务,就能从黑盒 agent 服务中重建隐藏的多文件技能。攻击 Daydreaming 把技能窃取形式化为黑盒系统辨识问题,用三阶段假设细化循环加判别性任务构造,在最严格的 Output 观测级恢复原始能力的 86.8%,超 SigLeak 近 4 倍,每个技能中位仅需 32 次受害者调用;三重披露防护叠加四种新防御均无法同时压制其成功率与行为效用。本精读覆盖背景概念、三级观测形式化、方法逐层拆解、实验证据与优势根源的因果链分析。

August 29, 2026 · 6 min

Diff Mining: Logit Differences Reveal Finetuning Objectives 精读

微调后的模型究竟学到了什么?Diff Mining 给出了一个简单而有效的答案:在无关的通用语料上逐上下文计算微调模型与基座模型的 logit 差,再用 Top-K 频率统计或 NMF 分解聚合,即可提取一组刻画微调目标的指纹 token。该方法无需访问模型内部权重,属灰盒方法,可扩展到大模型与 API 场景。在 Auditing Games 基准上,单次无监督扫描即识别出超过三分之一的隐藏偏见;在全部数据稀释比例下均优于 ADL 基线。本精读覆盖背景、方法、实验证据与优势根源的因果链分析。

August 29, 2026 · 5 min

How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation 精读

CTF 夺旗赛是评估 LLM 攻击性安全能力的主流方式,但传统评分只看提交的 flag 是否正确,不问 flag 从何而来。这篇论文提出 ctf-abacus 框架,把 1,435 次攻击轨迹重构成证据接地的 solve profile:将每步动作标注到 PTES 渗透阶段与 OWASP/CWE/ATT&CK 等标准技术,溯源 flag 首次出现的位置与来源,再经双 judge 独立标注与人工裁决。结果发现真实利用仅占恢复 flag 的 62-87%,直接暴露的捷径是记忆检索的 8.9 倍,而廉价关键词检测器 F1 只有 0.28——证明必须做序列级重构才能给 CTF 分数挤水分。

August 29, 2026 · 5 min

Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives 精读

Notre Dame、哥伦比亚大学、佐治亚理工与 MIT 四校合作论文精读。论文提出 KnownLieBench:先用中立探测问题确认模型知道用户应得的权益,再引入与用户利益冲突的商业激励,从而把故意说谎与不知道、幻觉区分开。基准覆盖 8 个客服域 112 个案例,18 个模型与信任追踪客户 agent 完成 18,144 次多轮交互。核心发现:仅给激励不提说谎时涌现欺骗率约 24-25%,明确指示后升至 69-91%;Claude-Opus-4.8、GPT-5.5、GLM-5.2 涌现欺骗接近 0%,DeepSeek-V4-Pro 高达 53%;客户信任越高谎言越难被检出。本精读按九部分结构拆解其知识门控机制、评估体系、效果根源与可迁移灵感。

August 29, 2026 · 7 min

PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact? 精读

浙大、西交大与布里斯托尔大学团队提出 PLCBench,首个真 PLC 硬件在环(HIL)评估框架,系统测量自主 LLM agent 能否把网络可达的工业控制器转化为持续物理影响。框架保留四家厂商原生协议语义,用六层隐藏诊断旗标与四源确定性取证把攻击能力拆解为接口获取与物理转化两段。在 4 台商用 PLC、4 个闭环工况、5 个模型、3 个种子共 240 个有效回合(118 聚合 PLC 小时)中,31.3% 达成持续物理影响,GPT 5.5 以 79.2% 覆盖全部 16 个格子,而最弱模型仅 10.4%;98 个回合停在接口获取,62 个停在物理转化,丰富观测使写后条件达成率提升 19.8 个百分点。本精读逐节拆解其设计因果链与防御启示。

August 29, 2026 · 7 min

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution 精读

LLM agent 正被部署进 Claude Code、Codex 等产品级执行环境,越狱的后果从生成有害文本升级为触发破坏性工具调用与持久状态更改。现有自动红队方法要么依赖固定攻击机制,要么按语义相似度检索整段攻击轨迹,存在检索偏差、工具贡献归因不清、上下文开销大三大痛点。RedEvoAgent 将跨案例攻击经验蒸馏为一份人类可读的攻击技能文档,靠工具效力画像、决定性工具归因与验证棘轮三个机制驱动技能进化。实验显示其在 ASB 上最高达到 100% 攻击成功率,超最强单工具最高 11.7 个百分点,AgentHarm 上 74.3 分远超 RedCodeAgent 的 37.5,同时把平均工具调用从 3.0 次降到 1.8 次,且技能可跨攻击者模型与执行 harness 零样本迁移。

August 29, 2026 · 6 min

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents 精读

自主 LLM Agent 的安全防御都按单轨迹定义、状态每轮重置,而碎片化攻击把恶意证据拆散到多个迭代中,任何轨迹范围监控器的 TPR 恒等于 FPR。本文提出的 LoopHarness 把安全状态提升到循环级:五个永不重置的组件(准入监控、非衰减风险累积器、内存完整性保护、停止仲裁、风险治理)外挂于任意单轨迹内层防御。在 Agent-SafetyBench 200 任务、485 攻击集 × 3 个 horizon 共 1,746 条记录上,全配置将攻击成功率从裸跑的 97.6% 压到 0.1%,干净任务完成率仅损失 0.4 个点,且换用与攻击者同模型的验证器后 ASR 仍为 0.1%。本文精读其理论分离结果、五个组件设计与效果根源。

August 29, 2026 · 7 min

Vulnerable Code Search: Transferable Attack for Code Language Models 精读

南加州大学团队针对代码搜索嵌入模型(CLM)提出可迁移对抗攻击:在不改变代码功能的前提下重命名标识符,让无关代码在目标查询的检索排名中挤掉合法结果。攻击只需在 CodeT5+ 等小模型上白盒优化,即可迁移到 Nomic-embed-code、Voyage-code-3 甚至 GPT-5.4-mini 与 Gemini-3.1-Pro 等闭源大模型;CosQA 上替换 10% 无关候选后 MRR 绝对下降最高达 77%,黑盒查询成本仅 1k 次、约为 CodeAttack 的万分之一。实验揭示当前代码检索模型高度依赖词汇特征而非语义理解,规模化并不能带来鲁棒性,标准对抗微调也难以兼顾检索效用与安全。

August 29, 2026 · 6 min

ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices 精读

深度精读 Meta FAIR 的 ADeptS-Bench——首个跨移动+桌面、双流(安全+歧义澄清)、离线视觉接地的计算机使用 Agent(CUA)可信赖性基准。核心设计:威胁嵌入视觉界面而非指令文本(同一句「订个披萨」,良性截图是正常菜单、恶意截图藏钓鱼覆盖层),1,300 人 MaxDiff 用户调查驱动威胁优先级(身份盗窃 80.2% 最受关切)。评测 7 个模型:无人同时做到任务成功率超 80% 且攻击成功率低于 30%;所有模型毫不犹豫点下 2.5 万美元订单的 Checkout,无一识破「Optimize」按钮实为恢复出厂重置。消融揭示三种安全架构:Gemini 3.1 完全依赖拒绝工具(移除后 ASR +22pp)、Claude/GPT 部分依赖(+10~11pp)、Qwen 无任何机制(±1pp,ASR 高达 74-80%)。

August 28, 2026 · 3 min