SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 精读

深度精读 SHE 论文——复旦、阿里达摩院、莱斯大学等多校合作提出 Safety Harness Evolution,将 Agent 安全 harness 解构为 System Prompt / Rule Bank / Safety Memory / Tool Policy 四个责任显式、独立可进化的制品,并通过归因引导的进化循环把轨迹失败转化为结构化诊断、局部精化与安全-效用验证。在 Agent-SafetyBench 上攻击成功率(ASR)相比静态 SafeHarness 降低 3.1 倍,同时良性任务效用不降反升;进化后的 harness 还能零成本泛化到 held-out 的 AgentHarm 基准并跨 Agent 模型迁移。本精读按九部分结构展开:从 Agent 安全 harness 的’整体黑盒’困境,到 SHE 的’免疫系统白细胞规则集’类比,再到归因引导进化与’精准医疗 vs 全身化疗’的范式对照。

August 11, 2026 · 10 min

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min

Stealing Reasoning Traces from Proprietary LLM APIs 精读

深度精读 arXiv:2608.09867——主流 LLM 提供商隐藏的加密推理块被全面击穿。论文发现加密块在跨会话、跨用户、跨模型间完全可互换,攻击者可借弱模型之手解码强模型加密推理,绕过反蒸馏机制;从 31 万公开推理块中恢复出 367 条 PII 和 182 条凭证,并可实现不可见提示注入。负责任披露后提出加密层与系统层双重缓解方案。

August 11, 2026 · 6 min

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring 精读

深度精读 COLM 2026 论文 SWE-Bench ProMax——字节跳动与香港科技大学合作的专家策划多语言代码重构基准。170个实例覆盖7种编程语言,平均每实例修改11.4个文件、261.6行代码。揭示近60%未解决的 SWE-bench Verified 实例存在过窄或过宽的缺陷测试,前沿模型甚至能逐字复现训练数据中的 gold patch。在两种 Agent scaffold 下,最强模型解决率仅41.2%,证明基准未饱和。多阶段专家策展流程从源头堵住测试质量和数据泄漏两大漏洞。

August 11, 2026 · 8 min

TEPA: Revoking Stale Memories for Conflict-Robust Language Agents 精读

深度精读 TEPA 论文——首次将 Agent 长期记忆的’记忆污染’形式化为可证伪性问题,提出可撤销的证据-记忆机制,让有效性成为记忆的显式状态。在完全反转场景下,append-only 跌至 0.210(甚至低于无记忆基线 0.309),而 TEPA 保持 0.950。真实文件执行场景同样再现这一模式,MemoryAgentBench SH-6k 上匹配强 last-write-wins 缓存(0.890)。边界测试揭示多跳和超长上下文是下一阶段架构挑战。

August 11, 2026 · 8 min

「模型能力已经够了,要卷就卷 Infra」|对话戴冠兰:从 Cloudflare 到 Runta,为十亿个 Agent 造执行底座

Runta 创始人戴冠兰(前 Cloudflare/Kong 核心)在十字路口播客中提出核心判断:模型能力爬坡已放缓,真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮(a16z 领投,Jeff Dean、李飞飞天使),定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力,让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。

August 10, 2026 · 2 min

【每日AI前沿追踪】2026年08月10日 核心技术与产业动态速递

Meta开源30B Muse Glimmer本地智能体模型;RL多任务训练的理论突破揭示SFT冲突根源;CLI Agent脚手架解耦实现跨scaffold迁移;AI记忆管理从存储走向生命周期可撤销。产业动态涵盖扎克伯格超智能宣言、宇树IPO、AI智能体越权攻击等重磅事件。

August 10, 2026 · 4 min

富二代为小六做Steam游戏:一场古典闹剧,与独立游戏开发者的真实生存图鉴

基于独立游戏开发者炒饭(橘子班)8月8日直播整理。一位北方富三代为了取悦被包养的’五太太’——一位有’明星梦’的前小主播——专程飞到武汉请炒饭策划一款Steam恋爱模拟器,复刻了’煤老板投资影视剧塞小三’的古典套路。炒饭婉拒深度参与,只提供策划建议,并预言项目八成做不出来。这场闹剧之外,直播还触及了独立游戏圈的几条真实生存逻辑:旧作免费更新以规避粉丝期待落差、国产Galgame因个体户属性反而不怕节奏攻击、AI做游戏前期有用但debug是地狱、矿卡逆势涨价折射的硬件市场畸形。

August 10, 2026 · 1 min

【每日AI前沿追踪】2026年08月09日 核心技术与产业动态速递

8月9日:苹果千问合作落地Mac端Apple智能;OpenAI下一代模型代号Doug曝光为史上最大预训练;GPT-5.6联手Fable 5证明25年MIMO通信难题;Google DeepMind拆解与Hassabis或离任;xAI发布Grok Image 2.0局部编辑升级;学术聚焦WorldClaw大规模Agentic 3D世界生成、MASS多人世界模型权威共享状态、经济世界模型六级能力蓝图。

August 9, 2026 · 2 min