Using Agentic AI for Contextualized and Multifaceted Code Review at Ericsson 精读

AI 编码 Agent 让代码生产提速后,评审成为新瓶颈——但现有 LLM 评审方法缺乏项目特定上下文且少有工业验证。Ericsson 与 Blekinge 理工按 Design Science Research 流程合作:多智能体 + 项目特定上下文知识,跨可读性/可维护性等四维度识别代码变更反模式。200+ 识别问题全部由 Ericsson 开发者人工验证:96% 识别正确、69% 被评’重要’。本精读覆盖工业实证方法论(DSR)、项目上下文注入的机制与’开发者认可度’作为工业评审 Agent 的黄金指标。

September 16, 2026 · 2 min

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读

ZGCM-1 技术报告解读:中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一(AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%),Agentic Search 与大数量级前沿模型竞争。配方亮点:混合 RL + Agent-SFT(verifier-successful 15,748 轨迹子集)与 AI-Native R&D——用 30B token 代理模型做混合物搜索,把配方探索成本降一个量级后再全量训练。本精读按’开放配方’口径解读其训练经济学与开放科学价值。

September 16, 2026 · 1 min

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 精读

数千个持有真金白银的 LLM 交易 Agent 在生产环境里到底干了什么?DX Research Group 交出首份人群规模实录:两个生产系统六个月、750 万次模型调用、30 万链上动作。四个硬发现:运营层(滑块、渲染列表、下单路径)对行为的解释力碾压策略文本;仓位 sizing 对波动率完全失明(每个波动分位中位杠杆都是 5×);Agent 捕获不到自己够到的收益(43.2% 仓位曾浮盈 300bps,其中 49.3% 负收尾);以及一个诚实的 null result——两个 fleet 都没有方向性优势,前沿模型对打决策质量统计上不可区分。

September 10, 2026 · 2 min

兰小欢:重要的事,大多无法预测|把握自己能把握的,做难的事

《置身事内》作者兰小欢在"大方之谈"访谈中反复回到同一组命题:真正重要的事都难以预料,可预测的事都不重要;宏观不可知,个体能把握的只有自己的微观世界。他谈飞升即走的焦虑与"继续做"、百万册畅销书背后的"懵"、AI从工具变成深度协作的伙伴(一天用十小时就不叫工具)、出海"谁做难的事谁就有真正的进入壁垒",以及人多的地方"至少是平均的选择"。这是一期经济学家的非典型访谈:不谈预测,谈在不确定世界里怎么做事、怎么自处。

September 10, 2026 · 1 min

通专融合、转换层与不可外包的使命感:AI科学家周伯文的世界观

澎湃《大方之谈》第十九期对话上海人工智能实验室主任周伯文。他主张 AGI 是通用与专业的融合,并将其落成「智者SAGE」三层架构;节目最新鲜的信息是他自称首次公开的「转换层」主张——防止行业 know-how 随使用反馈沉入基础模型层,他举例称 Claude 每推出一个行业插件,对应行业股票总市值最多被打掉 40%。他还重述了 1905 年思想实验:AI 若能推导出广义相对论,科学发现就从偶然变成必然;而人的使命感、批判性与品味不可外包。

September 10, 2026 · 2 min

83亿虚拟人格,与一门押注未来的生意:AI模拟离预测人类还有多远

硅谷101本期梳理 AI simulation 赛道:从斯坦福小镇 25 个智能体到哈佛、MIT 两百多位科学家参与、镜像全人类 83 亿人格的 Matrix 项目,再到 Simule(估值超 20 亿美元)与 Aaru(估值近 10 亿美元)两条商业化路线——前者高保真还原个体,后者群体规模换速度。节目核心判断是:这类公司的估值并非由当前营收支撑,而是提前押注未来的决策市场;真正卡住这门生意的,是评估标准缺失、预测无法自证的验证悖论,以及指数膨胀的算力成本。

September 9, 2026 · 2 min

Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读

Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象:每条推理轨迹仅监督 1–2 个关键 token(占全部生成 token 的 0.05%)即可匹配甚至超越全 token 训练的推理激励,跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一’有效学习不需要 token 密集’的证据链及其对后训练范式的改写意义。

September 8, 2026 · 2 min

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 精读

流式视频理解的主流范式是’存历史、按需检索’,但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为’检索并内化’:分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆,用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1,全部 SOTA。

September 7, 2026 · 2 min

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 精读

滑铁卢大学×哈佛的 Compile by Training 把’编译’概念引入神经函数:教师模型从自然语言规格合成监督数据,训练 LoRA 适配器特化冻结的 Qwen3-0.6B 解释器,产出可存储、可版本化、可组合的 .paw 程序。在 PAW 快速编译器零精确匹配的 FuzzyBench-Hard 上语义准确率从 0.224 提升至 0.836,编译仅需约 50 秒。本文精读其’训练即编译’范式、分钟级编译服务工程与速度-精度新权衡点。

September 7, 2026 · 3 min

LatentPress: Context Compression Beyond Text and Vision 精读

压缩后的上下文通常仍以文本或图像这两种’给人看’的形式存在。LatentPress 提出第三种表示:小型 writer 把对话/文档直接写成连续记忆 token,冻结解码器经输入嵌入接口读取,推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准(0.504 vs 0.490),写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。

September 7, 2026 · 3 min