FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 精读

AnalogyAI 发布 FM-Bench:让 LLM agent 经营一家足球俱乐部 20 个游戏年,通过 26 个工具在约 340-400 个决策节点上转会、谈判、投资、排阵容,由确定性引擎累计出唯一终分(无 LLM judge)。基准将管理者的四大压力——隐藏信息、累积后果、反适应市场、多目标压力——全部机制化,并以 Solo(1 模型对 15 脚本)与 Arena(15 个 LLM 同世界头对头)双轨评测 15 个前沿模型。结果:claude-fable-5 以 90.94 登顶(达特权 oracle 的 95%),规模、价格、厂商均不预测排名,token 花费与得分零相关;区分模型的是管理行为——终局前削减慢回报投资、保持现金部署、提前开启续约。Arena 中联赛冠军在 10 个模型间轮换,首次游玩的人类垫底模型榜。

August 20, 2026 · 5 min

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety 精读

UNC教堂山分校Tianlong Chen组联合UCF、密歇根州立发布HarnessRisk——首个覆盖agent harness全生命周期的安全基准:把harness安全组织为配置/能力扩展/运行时/状态持久化/动作控制/事件恢复六个运营阶段,128个沙箱案例每个配对良性用户目标与嵌入不可信工作流制品的对抗指令。14个模型-harness配置的评估揭示:攻击成功率12.6%-80.9%波动,配置阶段最脆弱,同一模型跨harness的ASR差4.3倍——安全是部署配置的属性而非模型属性,且风险识别不等于安全行动。

August 20, 2026 · 2 min

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 精读

SemComp-Bench由中国科学技术大学联合FrameX.AI与中山大学提出,定义了结果导向的语义任务完成视频生成任务:给定参考图像与指令,要求生成视频既达成指定结果,又与参考保持任务相关的语义接地(如把钞票折成乌龟,结果必须是那张钞票折成的乌龟)。团队从Koala-36M约2万条视频经四阶段管线构造1273个结构化实例,并设计OA/GR双维度VLM评测协议。七个代表模型中最高OA仅37.8%,I2V全面碾压T2V(37.8% vs 4.4%),brief指令下OA暴跌至1.7%,GR与OA排名显著错位,揭示了当前视频生成模型会生成却不会完成任务的系统性缺口。

August 20, 2026 · 4 min

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows 精读

字节跳动Seed联合南京大学发布StartupBench——首个从市场验证的AI创业产品反推任务的E2E agent基准。方法论颠覆在于任务来源:不是研究者预设什么能力重要,而是系统研究哪些AI产品已被真实付费采用,把其工作流翻译为六领域(医疗/金融/法律/管理/STEM/教育)多格式交付任务,以细粒度rubric评分。结果揭示’高分低完成’剪刀差:Kimi-K3平均73.67%但严格达标完成率仅29.55%,无模型超1/3——瓶颈已从执行工作流转移到稳定产出可直接商用的交付物。

August 20, 2026 · 2 min

Recursive Harness Self-Improvement 精读

Sakana AI 与 UC Berkeley 提出 RHI(递归式框架自改进):把多智能体框架当作提示词级对象,仅用当前与上一版本的自我比较来迭代优化,少数几轮就能让低推理强度的 Agent 超越同族最高推理强度设置,同时把推理成本降低最高 60%。本文从 Harness 是什么、模型-框架协同进化讲起,拆解 RHI 的轨迹局部目标、算法流程、信息论隐式目标,并提炼可推广的通用性灵感。

July 23, 2026 · 6 min

2026-06 LLM 代码生成领域综述:357 篇全文通读

代码生成领域综述。从 B23 软件工程桶 770 篇筛出 358 篇逐篇下载全文 PDF 通读(非仅摘要),聚焦 pass@k 失效、仓库级定位与探索、代码幻觉、AI 代码的审查信任与组织影响、评测有效性、形式化验证等议题,识别出隐形彩票、验证地平线、substrate collapse 等 12 个新颖问题与研究范式转移。

July 17, 2026 · 3 min

2026年 Coding 方向 Benchmark 全面调研:33个可用仓库 + 12个未来方向预测

通过40轮迭代搜索arxiv上596篇论文,逐一验证GitHub仓库可用性,最终筛选出33个有公开可用代码仓库的coding方向benchmark。覆盖仓库级SE、代码审查、形式化验证、硬件RTL、安全等12个方向,并预测代码重构(当前0个可用仓库)、安全联合评估等12个值得做的未来方向。

July 3, 2026 · 9 min