Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work 精读

Accio-Lab 的开放 35B-A3B co-work 模型技术报告:基于 Qwen3.6-35B-A3B 再训练,核心主张是成本效率路线——日常 co-work 的多数步骤(状态追踪/协调/恢复/跟进)不需要前沿级推理,执行接地的数据与环境(可重放长时程轨迹+多 harness 采集)+ 分阶段后训练,在 12 个 benchmark 四能力域上做到同规模最强、部分任务比肩 GPT-5.6 Sol 级大模型,价格协议明示的性价比优势。

September 15, 2026 · 2 min

One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering 精读

QMUL × Samsung AI 的产学研工作 AutoSkill:长视频 QA 中帧选择策略的有效性随问题语义类别剧烈变化,单一策略适配所有问题是错误假设。框架用 LLM agent 在小规模标注源池上迭代’提议-实现-评估-精炼’可执行帧选择技能,对目标 benchmark 仅用未标注的问题+选项文本归纳语义分类树,做’类别→技能’路由——零目标域标注,平均超 Qwen2.5-VL-7B 与 Qwen3.5-4B 基线 2.4%/1.2%。

September 15, 2026 · 1 min

Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering 精读

本文提出 two-gap 框架统一解释 agentic SE 的核心失败模式:requirement gap(需求 R 与利益相关者意图 I 的差)与 model gap(环境模型 M 与真实世界 W 的差)——reward hacking 是利用鸿沟的假接受,hallucination 是拓宽鸿沟的虚构。框架推导出非显然结论:叠加更多审查 agent 无用(共享同一 R/M/E 前提)、证据与权威必须来自内循环之外。案例集覆盖 KV store 六倍吞吐作弊与 2026 年 7 月 OpenAI/HF/Claude 评测越权事件。

September 15, 2026 · 2 min

Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents 精读

TU Munich × JetBrains Research 的产学研负结果研究:在真实 Kotlin 仓库的合并 PR 反向挖掘任务上,GEPA 优化 SKILL 文档仅 +4.9pp(统计不显著)、SkillOpt 仅 +0.1pp——此前文献自报的巨大增益(55%→82%)是在弱模型弱 harness 配置下测出的。论文进一步证明 pass-rate 增益量级与二元判决本身的误标率(10.7% 盲重试通过)同阶,测量仪器而非优化器才是瓶颈。maintainer 盲读却确认 SKILL 含真实项目知识——分数之外的价值。

September 15, 2026 · 2 min

Studying Without a Syllabus: Task-Agnostic Environment Preprocessing 精读

Scale AI 提出并形式化’任务无关环境预处理’设定:agent 在不知道下游任务分布的前提下自主’学习’陌生环境(S: Π×E→E——学习系统在预算内探索环境、产出制品给冻结 solver)。Meta-Agent(±策略 Archive)在 6 个异构 benchmark 的 5 个上取得最高 Avg@3;学习制品显著降低测试时采样需求;但更大学习预算不必然提升——‘学什么’比’学多久’重要。

September 15, 2026 · 1 min

What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code 精读

那不勒斯费德里科二世大学的 78.7 万函数对大规模研究:3 家 AI 助手(GPT 系/DeepSeek-Coder/Qwen2.5-Coder)按人写函数的 docstring 生成配对实现,静态分析映射到 ODC 缺陷分类+CWE 漏洞分类实现三语言(Python/Java/C)同框架人机对照。核心发现:AI 代码’结构压缩+风格模板化’(体量约人写一半、风格层独立聚类);缺陷类型分化而非数量分化;C 语言上 AI 高严重性内存安全缺陷反而更少。发布 CQBench(27,346 高问题任务)——Opus 4.8 在其上仍 2/3 有缺陷、1/3 有安全发现。

September 15, 2026 · 2 min

Scan the Skill, Govern the Action 精读:agent 技能的「许可 ≠ 恶意」,66,192 个技能全语料测量出的运行时治理缺口

Pheo 团队对 ClawHub 全部 66,192 个 agent 技能版本做了测量:705 个被所有扫描器和 LLM 判官共同判为「清白」的技能,仍在指示 agent 执行 CIS/NIST 明令禁止的操作;活体实验中 agent 对 43.4% 的此类技能真的伸手,运行时门控 23/23 全部拦截。论文提出 OATS——无模型决策路径的确定性解析器 + 按资源×类别键控的信任账本 + 从操作者风险容忍度统计推导的晋升阈值,把 agent 安全从「发布时扫描」的单层世界重构为分层组合的世界。

September 14, 2026 · 3 min

TraceMind 精读:用户到底记住了 LLM 写的什么?从交互轨迹预测人-LLM 共创中的信息摄取

清华×南开×剑桥团队把「AI 生成内容被用户真正摄取了吗」变成可测量、可预测的问题:62 名参与者、1187 个原子信息单元的性能标签(答对识别题与否),配上语义出现对齐 × 布局状态对齐的双轴轨迹重建,三路融合模型拿下 81.17% AUROC,超全部 8 个学习型 baseline 最多 12.38 个点。行为分析揭示:摄取与内容如何进入草稿无关,与之后是否持续加工强相关;12.3% 的高置信回答是错的,而交互轨迹恰好能区分这些「自信的遗漏」。

September 14, 2026 · 2 min

GLIE 精读:几何先验驱动的检索压缩——100 万页 258GB 到 1GB 的流形参数化

KAUST×Edge Hill 发现视觉文档检索的页面向量恰在单位球面上且集中在本征维度 5-6 的低维流形附近(三个编码器一致验证),据此提出 GLIE:k≪N 个向量既作轻量索引又作全页嵌入的再生基底——归一化质心免费 +0.093 nDCG@5,k=4 时 1040 字节/页 vs 未压缩 257.8KB,保留未压缩系统近 80% 性能(先前最佳 70%);415K 参数网络 3 GPU 分钟千页训练,骨干全程冻结。

September 13, 2026 · 1 min

Image Tokenizers as Visual Languages 精读:统一多模态 tokenizer 的测量学

Amazon FAR×UW 构建受控纯自回归测试台,在多模态持续预训练中追踪任务分账验证损失(文本/图像/T2I/I2T 四路)的 scaling 行为,系统刻画统一模型中图像 tokenizer 的行为。两条核心发现:损失必须分任务分析(不同任务呈不同 scaling 且对 tokenizer 排名不同);T2I 损失-性能关系随图像 token 空间漂移,I2T 损失在共享文本词表上计算、是更稳的跨 tokenizer 比较指标。

September 13, 2026 · 1 min