SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories 精读

深度精读浙江大学 ZJUNLP 团队 SkillAdaptor 论文——一个免训练的步骤级技能自适应框架。从 Skill/Harness 概念补全、步骤级归因 vs 轨迹级反思的核心区别、三阶段适应流水线(归因-修改-资格验证)、必要知识反推到通用性灵感提取,全面拆解这项在 WebShop/PinchBench/Claw-Eval 三个基准上均优于基线的创新工作。

June 3, 2026 · 4 min

Yunjue Agent: 零起点原位自进化智能体系统精读

深度精读 Yunjue Agent 技术报告——首个完全可复现的零起点原位自进化 Agent 系统。从自进化 Agent 三大支柱(工具/上下文/工作流)背景补全、四类自进化方法定位、工具进化为关键路径的问题抽象、多 Agent 协作+并行批进化+进化泛化损失指标详解、必要知识反推到通用性灵感,全面拆解这项在5个基准上零起点超越专有系统的开创性工作。

June 2, 2026 · 4 min

Agent新基建,如何让一人企业做全球生意

阿里巴巴国际业务总裁张阔深度分享:B2B贸易正在走向A2A(Agent to Agent),Accio产品MAU已达千万。从AI Native产品范式、Agent工作流设计、token经济学,到一人企业如何借助AI做全球生意——一个传统互联网无法改变的30万亿美元存量市场,正被AI重新撬动。

June 1, 2026 · 2 min

Skill0.5: Joint Skill Internalization and Utilization for OOD Generalization in Agentic RL 精读

深度精读 Skill0.5 论文——华东师大 × 美团联合提出的首个区分通用技能内化与任务特定技能利用的 Agent RL 框架。从 Skill/Harness 概念补全、四代技能增强方法演进定位、双范式困境的问题抽象、难度感知路由+特权蒸馏+反捷径利用三大机制详解、必要知识反推到七条通用性灵感,全面拆解这项在 OOD 泛化上大幅超越全部基线的创新研究。

June 1, 2026 · 5 min

Never Stop Learning: Continual Learning 与 Self-Iteration 综述精读

深度精读 DeepSeek 研究员陈德里(Deli Chen)的持续学习与自我迭代综述——首个统一 LLM 持续学习与自我改进两大研究方向的全景式综述。从三轴分类法、五大方法族、收敛性定理、多模型实验验证到六大开放挑战,全面拆解这篇47页、151篇参考文献、由 Deli AutoResearch 框架协作完成的重量级研究。

May 31, 2026 · 3 min

聊聊Harness时代AI-First的组织架构:从信任人到信任AI

基于《硅谷101》播客深度总结。AI Agent公司Creo(25人,99%代码由AI编写)三位联合创始人亲述:从Prompt Engineering到Harness Engineering的进化、AI-First的真正含义、开发流程彻底重构(6周→1天)、产品经理角色消解、工程师分为架构师与操作者、以及从’信任人’到’信任AI’的组织变革。

May 31, 2026 · 1 min

硅谷101 5月观点总结

整理自硅谷101五月发布的五期播客节目,涵盖 Token 经济学、Google Gemini 发展历程与出走创业、机器人数据困境、AI Agent 社交革命、DeepSeek 与模型效率突围等话题。共5大主题,每期以"新变化"+“作者观点+解释"双维度整理,附4条跨期交叉洞察,让没看过原节目的读者也能快速理解观点背后的推理逻辑。

May 28, 2026 · 1 min

An Empirical Study of Proactive Coding Assistants in Real-World Software Development 精读

深度精读 arxiv:2605.05700——首次大规模收集1246名工业开发者的真实IDE交互轨迹,揭示LLM模拟数据与真实开发行为的显著差距(Sim2Real Gap),构建首个真实场景主动式意图预测基准ProCodeBench,发现当前最强模型Pass@1仅13.57%。模拟数据不能替代真实数据,但可作为预训练补充。

May 27, 2026 · 4 min

RGAO 精读:多智能体代码生成的检索条件化拓扑选择与可证明预算守恒

深度精读 arxiv:2605.05657——提出 RGAO 架构,通过检索代码仓库提取结构复杂度向量来动态选择编排拓扑,配合预算代数系统实现静态预算守恒。误路由率从 30.1% 降至 8.2%(p<10⁻⁶),预算验证在任何 LLM 调用前完成。首次将检索条件化路由与形式化预算代数组合,产生两者单独都不具备的可证明安全性。

May 27, 2026 · 7 min

Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning 精读

深度精读 UIUC NeurIPS 2025 论文——首次将 LLM 模型路由从单轮一对一映射升级为多轮序贯决策过程。Router-R1 将路由器本身实例化为 LLM,通过强化学习训练其交替执行’思考’和’路由’动作,动态整合多个 LLM 的互补优势。在 7 个 QA 基准上平均 EM 达到 0.416,超越 RouteLLM、GraphRouter、FrugalGPT 等 14 种基线方法,同时通过成本奖励实现性能-成本 Pareto 优化。

May 27, 2026 · 4 min