Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay 精读

深度精读 arXiv:2608.05784——独立研究者 Nossa Iyamu 提出的 Activity Frames,一个零模型、确定性的屏幕活动编译管道。它将屏幕捕获流分割为携带应用、站点、时序、输入量和证据指针的『活动帧』,在 128,756 帧、51 活跃天的真实语料上把单日上下文从 126,812 token 压缩到 1,469 token(86×),编译延迟仅 68ms,下游问答准确率 98.4%(LLM 摘要仅 66-80%),幻觉率 0%。同一编译器还首次测量了代理成本模型假设但从未实测的两个参数:Routine Overhead Ratio R=60-343x 和可委托复发率 h=7.7%(样本外)。核心洞察:把『解释』从『测量』中剥离,用最无趣的确定性代码填补捕获与记忆之间的缝隙。

August 8, 2026 · 8 min

LLMs Get Lost in Evolving User Intent 精读

本文精读 Microsoft Research 团队发表于 2026 年 7 月的论文《LLMs Get Lost in Evolving User Intent》。论文提出一个将任意静态单轮基准测试转化为动态多轮对话的框架,通过三种意图转移(论点揭示、论点修正、函数切换)模拟用户意图的真实演化过程,同时保留原始评估协议实现免标注的自动验证。跨数学、Text-to-SQL、搜索、编程四个领域的实验揭示了一个一致现象:在单轮设置下表现优异的模型,一旦用户意图动态演化,性能便大幅下降,最严重时直接归零。这一发现暴露了静态评估的盲区,对协作式 Agent 的未来发展具有关键启示。

August 1, 2026 · 5 min

FastContext: Training Efficient Repository Explorer for Coding Agents 精读

深度精读微软 FastContext 论文——把代码仓库探索从主 Agent 中剥离、交给一个专门训练的小模型来干。用 4B-30B 的专用探索模型替代昂贵的探索过程,端到端解决率最高提升 5.5%,主模型 token 消耗最高降低 60%。从编码 Agent 瓶颈分析、模型分工解构、SFT+RL 训练配方,到必要知识反推与通用性灵感,全面拆解这项将仓库探索’模块化、可训练化’的工作。

June 17, 2026 · 5 min

GPS: Graph-Guided Proactive Information Seeking in Large Language Models 精读

深度精读北京大学 ICLR 2026 论文 GPS,提出用 DAG 显式建模文档中的条件规则结构,通过图遍历引导 LLM 在 RAG 系统中高效主动追问,成功率超最强基线 7.5%,追问效率提升 4.2%。

May 26, 2026 · 4 min