CapScope: A Capability-Scoped Harness for Prompt-Injection-Resistant Coding Agents 精读
编码 Agent 沙箱内的工具天然携带’环境权威’——命名一个资源就能操作它,间接提示注入正是利用这一点让 Agent 干用户没让干的事。北大团队的 CapScope 不让模型识别恶意文本,而是在 harness 层做能力作用域授权:从可信输入导出任务级权限上限,每个 sub-agent 持有独立的类型化能力集(存于模型上下文之外),每次工具调用逐主体检查。300 组对照实验:注入生效 ambient 权威 47/75、静态全局策略 33/75、CapScope 仅 3/75,而任务完成度 68/75 基本无损。论文已被 LMPL'26(ACM SIGPLAN 工作坊,Oakland)录用。