SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 精读

深度精读 SearchSwarm——首个系统探索如何让 Agent 学会「委派」的工作。论文设计了精巧的 Harness 引导主 Agent 将子任务分派给子 Agent,用合成的轨迹数据通过 SFT 将「委派智能」内化到模型权重中。30B 参数的小模型在 BrowseComp、GAIA 等四个基准上达到同规模最佳,甚至超越 10 倍参数的模型。更令人惊喜的是,委派训练的智能还能泛化到单 Agent 设置和开放式研究任务。

June 12, 2026 · 3 min

Self-Harness: Harnesses That Improve Themselves 精读

深度精读上海人工智能实验室 Self-Harness 论文——首个让 LLM Agent 自主改进自身操作套件(Harness)的范式。从 Harness 概念补全、三大范式对比定位、三阶段闭环机制详解、模型特异性验证到通用性灵感提取,全面拆解这项在 Terminal-Bench-2.0 上取得高达 21.4% 绝对提升的开创性研究。

June 12, 2026 · 5 min

SpaceX要让太空算力从科幻走向现实,但它划算吗

SpaceX在2026年6月完成1.75万亿美元人类史上最大IPO,招股说明书中将火箭发射、星链与xAI打包上市,并披露了太空数据中心计划。本期节目邀请了SpaceX相关人士和火箭爱好者,用第一性原理拆解太空数据中心的物理极限与经济可行性,从发射成本、散热难题、太空辐射到碎片风险逐一论证,同时延伸讨论了月球派与火星派的路线之争、太空主权法律空白等前沿话题。

June 12, 2026 · 1 min

【每日AI前沿追踪】2026年06月11日 核心技术与产业动态速递

6月11日AI前沿速递:Google DeepMind发布DiffusionGemma——26B MoE扩散文本生成模型,本地推理速度提升4倍;Anthropic Claude Fable 5安全护栏争议持续发酵——模型被曝故意降智且对用户不可见,微软已限制员工使用;小米开源MiMo Code V0.1终端AI编程助手;华为云发布CloudRobo端到端具身AI平台与AgentArts企业级智能体平台;Role-Agent提出双角色进化机制突破Agent技能学习瓶颈;Workflow-GYM评估计算机使用Agent长时任务能力;Retrospective Harness Optimization通过自偏好优化改进Agent能力。

June 11, 2026 · 2 min

Agentic Coding驱动工业制造通往自主通用智能

基于机器之心直播分享整理,深圳大学苏向宇博士介绍了被 ICRA 2026 接收并获选自动化领域最佳论文的工作 AIML(Industrial Multi-Robot Task Planning and Program Generation using Large Language Models)。该工作提出了一个利用大语言模型自动完成工业产线多机器人任务规划与执行程序生成的框架,核心思想是让 LLM 负责语义理解,用结构化工具保证约束满足和可执行性,实现了跨产线、跨任务的零样本泛化能力。

June 11, 2026 · 1 min

SpaceX崛起史:一切,为了去火星

硅谷101实地探访SpaceX位于德州博卡奇卡的Starbase发射基地和洛杉矶总部,并邀请SpaceX前高管回顾公司从濒临破产到成为全球商业航天巨头的历史。内容涵盖猎鹰一号的三次失败与第四次成功、NASA商业航天计划如何拯救SpaceX、火箭回收技术的突破、星链的商业飞轮效应、载人龙飞船与波音Starliner的对比、猛禽发动机的创新、不锈钢舰体的选择逻辑、以及Starship如何成为通往火星的关键一步。

June 11, 2026 · 1 min

【每日AI前沿追踪】2026年06月10日 核心技术与产业动态速递

6月10日AI前沿速递:Anthropic发布Claude Fable 5与Mythos 5——多项基准SOTA,安全护栏引发社区激烈争议;Cohere开源North Mini Code——3B活跃参数专攻Agentic Coding;Google Gemini 3.5 Live Translate公开预览支持70+语言;小米MiMo V2.5-Pro-UltraSpeed突破千tokens/s输出;Claude Managed Agents新增定时运行与环境变量存储;SWE-Explore以98票登顶HF日榜——编码Agent仓库探索基准;Agents’ Last Exam:250+行业专家共建1000+真实经济任务评估体系;FlashMemory-DeepSeek-V4实现500K超长上下文KV Cache压缩90%+。

June 10, 2026 · 3 min

QUBRIC: 协同设计查询与评分标准,突破可验证奖励的强化学习瓶颈 精读

深度精读 Amazon 与佐治亚理工学院联合发表的 QUBRIC 论文——一个协同设计查询(Query)和评分标准(Rubric)的框架,通过关键点锚定的查询重写、对比式评分标准生成和可学习性过滤,突破传统 Rubric-based RL 中’评分标准质量受限于查询结构’的根本瓶颈。在 ArenaHard 上取得 +5.5 的增益,并零样本迁移到法律、道德、叙事推理三个未见基准上,平均提升 +6.3 分。本文揭示了查询与评分标准的结构耦合关系,为将 RL 扩展到不可验证领域提供了实用路径。

June 10, 2026 · 4 min

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective 精读

深度精读上海交通大学张拳石团队 arXiv 2026 论文,从交互视角揭示 SFT 在 LLM 中的真实作用机制——主要是在极短窗口内去除噪声交互,而非学习新的可靠表征。这一发现为早停策略提供了可解释的理论依据,有望节省 30%-50% 以上的训练算力。

June 10, 2026 · 3 min

Skill-RM: 通过 Agent Skill 统一异构奖励评估标准 精读

深度精读中山大学、香港中文大学、北京大学、ETH苏黎世与阿里巴巴通义千问团队联合发表的 Skill-RM 论文——将奖励建模重新定义为可复用的’奖励评估技能’(Reward-Evaluation Skill),通过结构化的 Agent 技能编排异构评估资源(评分准则、验证器、检查清单、聚合规则),在 RewardBench2、RM-Bench、JudgeBench 三大基准上全面超越传统 LLM-as-a-Judge 和专用奖励模型,为 LLM 后训练提供统一、可解释、可扩展的奖励信号框架。

June 10, 2026 · 4 min