Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents 精读

北京大学提出’本体信任’(ontological trust)这一新问题定义:长程agent的关键监督问题不是每步是否合规,而是不断演化的轨迹前缀是否仍对应用户授权的任务——漂移可以静默累积,每步都合规但整体已偏离。RGE监视器沿Role/Goal/Evidence三轴分解信任,LLM仅用于推导结构化表示,状态更新与干预决策全部确定性,输出可重放可审计的信任轨迹。在OSWorld/FinanceBench/EICU-AC跨域语料上,RGE的Drift F1超过93%且良性覆盖率≥95.8%,并实证了伪一致性检测受任务完成是否外部可见的结构性限制。

August 20, 2026 · 1 min

Bounded Agents: Delegation Security for Multi-Agent AI Systems 精读

独立研究者 Xabier Muruaga 提出 Agentic Principal Chain(APC),把提示注入的安全后果定性为授权架构问题而非模型鲁棒性问题:有外部通信工具权限的 agent 可被诱导渗出文档,没有该权限的 agent 无论注入什么都渗不出。APC 沿 principal 到 principal 的委派链跟踪会话级授权状态,用六项授权检查对照累积会话状态评估每个请求,范围与预算沿链继承且只收不扩,composition closure 拦截’每步合法但组合违禁’的动作序列,决策在模型之外强制执行。3154 实例评测显示:AgentDojo 四域渗出率 75-100%→0%,InjecAgent 全部 544 个数据窃取案例被阻断,意图绑定使破坏类攻击 38.6%→4.0%、操纵类 90.5%→12.1%,授权延迟 P99 仅 0.24ms,代价是 949 个任务-注入对上效用下降 8.6/13.9 个百分点。

August 20, 2026 · 6 min

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety 精读

UNC教堂山分校Tianlong Chen组联合UCF、密歇根州立发布HarnessRisk——首个覆盖agent harness全生命周期的安全基准:把harness安全组织为配置/能力扩展/运行时/状态持久化/动作控制/事件恢复六个运营阶段,128个沙箱案例每个配对良性用户目标与嵌入不可信工作流制品的对抗指令。14个模型-harness配置的评估揭示:攻击成功率12.6%-80.9%波动,配置阶段最脆弱,同一模型跨harness的ASR差4.3倍——安全是部署配置的属性而非模型属性,且风险识别不等于安全行动。

August 20, 2026 · 2 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC联合KUKA、上海交大、浙大发布SemaPLC——一个项目接地、验证门控的PLC代码生成agent harness。它由常规工具组装而成,却由一条严格的完成纪律统治:agent不许凭自判断宣布完成,只有工具日志确认的规格审计、编译、运行时三类外部检查全部过关才准交付;任何编辑作废全部旧判定并重跑全部检查。在117个独立POU任务上它让全部7个模型拿到最高严格通过率(均值72.6%,超最强基线8.8个百分点);在65个真实工厂项目任务上,其动态行为分52.2碾压基线最高31.4——静态分相近的方法在运行时被彻底分离。编译通过≠跑得对,执行才是生成控制逻辑最忠实的检验。

August 20, 2026 · 6 min

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence 精读

多智能体系统的可靠性论证普遍依赖“组件可靠度相乘”,而这一步的前提是各组件失败相互独立。本文用18000次预注册确认性任务实测发现:同一模型的两份拷贝在90%的失败任务上共同失败(log OR=6.66,ϕ=0.916),独立性假设被数据彻底推翻;而拟合依赖模型的替代方案会随数据增多而覆盖率崩塌。作者给出矩集线性规划证书:对任何依赖结构免假设且尖锐,矩族从10个增至14个就把认证下界从0.2455抬升到0.4116,并配套任意停止有效的e-process序贯证书(type-I误差≤0.0471)。换模型显著降低相关性、换厂商无效——冗余设计的多样性应选在模型轴上。

August 17, 2026 · 5 min

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents 精读

自改进 LLM Agent 会把成功经验沉淀为可复用技能,但如果某次“成功”本身是不安全的,会怎样?本文精读港城大与阿德莱德大学的论文 Practice Makes Unsafe:作者提出技能劣化(skill misevolution)概念——不安全捷径随有用流程一起被写入技能库,攻击输入消失后危害仍持续。论文给出 SKILLMISEVO-GYM 生命周期测试框架、SKILLMISEVO-BENCH 冻结基准与 SAFEEVOLVE 治理包装器,实验发现 21 个进化配置全部产出不安全技能、3 个恶意任务即可使新会话攻击成功率从 16.0% 升至 35.3%,而 SAFEEVOLVE 能将不安全检索率降低 26.7 个百分点、良性效用仅损失 0.4 分。

August 17, 2026 · 4 min

RSI比Coding Agent大得多:对话田渊栋,递归自进化为什么是阶段式突破而非渐进攀升

前Meta FAIR研究员田渊栋创立Recursive Superintelligence(A轮6.5亿美元,估值46.5亿美元)后首次系统阐述RSI:它比coding agent大得多、难得多;完全自动化不会很快发生,递归会先发生;智能发展是S型曲线而非scaling law的平滑攀升,这恰恰给了初创公司窗口。他们的第一阶段成果在算子优化、NanoChat训练和NanoGPT SpeedRun三个方向取得SOTA,用一套通用系统击败了专业GPU团队。田渊栋认为AI终将从炼金术变成化学,可解释性是少数派但正确的路。

August 7, 2026 · 1 min

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act 精读

本文形式化定义了’记忆不确定性下的安全承诺’问题——Agent在记忆过时、冲突或被污染时不应执行不可逆的外部动作。SafeCommit在Agent推理与外部执行间插入风险控制层,利用保形预测构建可能潜在世界集合,仅当动作在每个保留世界中安全时才允许执行。在校准世界覆盖下,不安全认证承诺概率被数学保证不超过目标水平α。

August 6, 2026 · 2 min

Token Maxing退潮,Agent开始干活——亚马逊云科技中国峰会探展复盘

2026年过半,AI产业从年初"Token Maxing"的狂热转向"Token Minimizing"的理智。本期《硅谷101》走进亚马逊云科技中国峰会,实地探访AI在短剧出海、金融量化、药物研发、游戏开发、端侧硬件与安全攻防等领域的真实落地——不再是PPT,而是已经在产生价值的业务。

July 7, 2026 · 1 min