PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems 精读

深度精读北京大学、小米 LLM-Core、香港大学与中国人民大学合作的 PersonaForge。真实 agent 使用中 75.9% 为多轮交互(中位 10 轮用户消息、均值 99 次工具调用、38.7% 含显式纠错),而训练数据几乎全按『首条消息信息完备』合成——供需严重脱节。PersonaForge 用四维人物空间、SOUL 行为控制与逆向深度构建(从真实种子查询反推画像)合成 6.3K 多轮训练数据,并构建 138 题人工标注基准。SFT 后 Qwen3.5-27B 综合分 +4.1%、MiMo-V2-Flash +15.7%,交互轮数与工具调用显著减少;消融证明连接记忆是最关键组件。

August 31, 2026 · 4 min

Privacy Without Regret: Differentially Private Inference-Time Alignment 精读

印度理工坎普尔提出推理时对齐的差分隐私方法 PrivBoN 与 PrivITP。核心洞察是:差分隐私与抗 reward hacking 本质上是同一个干预——把 Best-of-N 的硬 argmax 软化。PrivBoN 在奖励分数上加尺度 σ=2Δr/ε 的 Gumbel 噪声,等价于指数机制实现 ε-DP,同时等价于 KL 正则化对齐;当隐私预算超过阈值 ε* 时,隐私要求的噪声恰好就是对齐最优的正则,隐私零成本。PrivITP 进一步用 χ² 正则化拒绝采样加两阶段高斯机制,把正则参数与隐私参数解耦,隐私代价只随实际停时增长。实验中弱奖励模型下 BoN 出现负提升(GSM8K 上 −5.18%),而 PrivITP 反而 +0.81%,并在固定隐私预算下靠 FSRC 组合多答约 3 倍查询。

August 31, 2026 · 4 min

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests 精读

编程智能体的能力几乎都用 SWE-BENCH 系基准衡量,但其任务来自精修的 GitHub issue——长、结构化、信息丰富;真实用户请求却往往短、随意、信息稀疏。成均馆大学团队先定义六类信息分类学与四个语言学维度,量化出残酷的错位:仅含问题陈述的请求占真实提示的 88% 却只占基准任务的 7%,87% 的真实提示口语化而 94% 的基准问题书面化。据此构造 381 个多变体任务族(族内共享任务与 gold patch、只变信息组合与风格),评估七个模型发现真实输入平均拉低解析率 6.4 个百分点、足以改变排名;受控消融进一步定位:期望行为 [D] 与动机 [M] 是关键信号(+6.8 到 +9.9pp),复现步骤与环境信息只增加 token 却无可测收益,语言风格几乎不影响性能。本文按九部分结构精读这个『表达方式可被逐字段归因』的评估范式。

August 31, 2026 · 4 min

REPLICANT: Learning Policies for Evading and Hardening Malware Detectors 精读

伦敦国王学院、Alan Turing研究所、UCL、鲁汶大学等多机构联合提出REPLICANT,把Android恶意软件的问题空间逃逸从『逐样本优化』重构为『策略学习』:在严格label-only黑盒威胁模型下,用分层PPO学习改什么(能力选择)与何时查(查询时机),产出的策略可跨样本、跨检测器架构、跨特征空间迁移——全部1764个代理/目标组合平均ASR 78.8%,比最强基线相对提升20.9%-39.2%;策略迁移(78.8%)远超样本迁移(43.3%,相对+82%)。反哺防御侧,AT-REPLICANT靠随机策略训练全程收集多样对抗样本,使白盒REPLICANT与APG残余ASR压到17%以下,而AT-APG对REPLICANT_WB仍暴露62.4%漏洞;针对时间漂移提出的RAL把主动学习与对抗训练交织,同时保住性能(49.0)与鲁棒性(0.6%)。总计379,680次攻击评估为该领域迄今最大规模。

August 31, 2026 · 2 min

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation 精读

LLM 能不能认出自己写的文字?这个『自生成文本识别(SGTR)』问题直接关系到 AI 安全:控制协议(蜜罐、受信编辑)和多智能体防合谋都依赖模型无法分辨内容来源,而 LLM-as-a-Judge 评估则可能因评审认出自己的输出而产生系统性偏袒。以往研究结论互相矛盾——有的说模型识别能力很强,有的说不超过随机。本文用『操作化』框架化解了冲突:识别精度随评估格式(成对/单条)、会话格式(用户标签/助手标签)与任务域(摘要/对话/安全问答/代码)大幅波动。核心发现是『质量启发式』主导混杂:模型倾向把自认为高质量的文本归于自己(识别精度与 Arena Elo 分差正相关 R²=0.23-0.34)。SFT 训练可提升 SGTR 并跨操作化迁移,还会放大 AlpacaEval 2.0 评审的自偏好;对抗训练则能把偏好重定向到任意目标模型。

August 31, 2026 · 2 min

Sliding-window beats linear attention 精读

深度精读微软 Applied Sciences Group 的评测批判型论文:后训练线性注意力(LoLCATs、MOHAWK、QRWKV 等)一直以『低成本解决 KV 缓存膨胀』为卖点,但从未与真正的强基线——免训练的带注意力 sink 滑窗注意力 SWA(64,4) 公平比较。本文在 11 个基础模型(1.3B 到 70B)上补上这场缺失的对比:短上下文 SWA 恢复基线平均性能 99.0%,长上下文 S-NIAH 与 BABILong 上领先 2 到 10 倍,且零后训练 token、解码最快、内存最低。一篇动摇整个『线性化改造』研究方向价值主张的论文。

August 31, 2026 · 5 min

SPT: Skills as Pre-Training Data for Agentic Language Models 精读

深度精读北京邮电大学与清华大学论文 SPT。论文提出把公开的多文件技能包当作预训练中段(mid-training)数据:清洗 ClawHub 上 38,040 个技能包构建 SkillCorpus(约 3.48 亿 token),用 Reference Insert 序列化策略把被引用文件插入到指令首次提及处,使引用距离缩短 94.92%。7B 模型四个 Agent 基准平均分从 28.50 提升到 53.46(+24.96),通用能力几乎无损,30% 技能混合配比效果最佳。

August 31, 2026 · 4 min

String: An Agentic OS Where Every App Is a Markdown File 精读

LLM Agent 正在成为一种新的软件用户,但它们用的界面全是为别人设计的:网页为人眼而生,JSON schema 为程序而生,而 Agent 每一轮都要为自己看到的每样东西重新付费。首尔国立大学与 H1R.AI 的 String 开源运行时把这个问题当成操作系统问题来解:一个 SFMD(String 风格 Markdown)文档声明应用的视图、类型化动作、导航与凭证,运行时负责发现、校验、执行、状态与机密,Agent 只需两个动词——/open 看与 /act 做。SkillsBench 87 任务上六个模型成功率与精选技能持平(51.8% vs 50.5%)且完成片段 token 平均省 33.5%;常驻接口稳定在 53 token 对比全 schema 的 103,518;分阶段披露被因果实验证明有效——tier-2 细节提前一轮展示就损失 11.6 至 23.3 个准确点。

August 31, 2026 · 5 min

Survival-Guided Length Control for Efficient Diffusion Language Models 精读:用生存分析一次前向测出生成长度

扩散语言模型(DLM)迭代去噪生成文本,但标准 AOAR 解码对全体样本使用统一的保守长度预算 Lmax=1024,大量去噪步浪费在精修真实结束位置之后的冗余画布上。本文把生成长度选择重新表述为 [EOS] token 上的离散时间生存问题:对长 mask 画布做一次前向传播,把各位置的 [EOS] 概率解释为危险率,经均场近似连乘得生存曲线,再用期望等于生存概率求和的标准恒等式闭式算出期望长度,作为该样本的解码预算。方法免训练、即插即用,在 LLaDA-8B-Base 与 Dream-7B-Base 上取得 3.1-6.6 倍解码加速(instruct 模型最高 7.3 倍),任务精度变化全部落在标准差之内;固定均值长度消融与逐步漂移分析进一步证明逐样本长度预测的必要性。

August 31, 2026 · 3 min

Sycophancy Suppression Can Impair Rational Updating 精读:抗谄媚不应牺牲理性纠错

伊利诺伊大学芝加哥分校与新加坡国立大学提出:LLM 的答案翻转分为无依据屈服与理性更新两类,主流抗谄媚方法在压制前者的同时往往连带损伤后者。两轮诊断实验显示 DPO 抗压训练让 Llama-3.1 屈服率降 32.9 个点却让理性更新率掉 48.9 到 53.7 个点,联合优化也难以幸免。机制分析进一步发现两种行为共享大量 MLP 神经元与注意力头、steering 方向余弦相似度全 16 组为正,说明纠缠是结构性的。论文主张抗谄媚是选择性问题而非压制问题,正交化 steering 的初步探索把选择性设置从 5/36 提到 10/36。

August 31, 2026 · 3 min