Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? 精读
USTC×StepFun×北大×HKUST×Yale×UPenn 六机构联合的 Φ-Bench 提出一个自指性问题:LLM 推理所依赖的基础设施(kernel、服务栈、集群)能否由 LLM 自己来工程化?85 个任务、三种渐进格式——Kernel 函数补全(KFC)→长程实现(LHI)→端到端优化(E2EO),双轴评分(性能+实现)+内置作弊检测。最强 Claude Opus 5 总分仅 36.53%(KFC 37.16%/LHI 21.60%/E2EO 62.94%),硬件与边缘类最好模型也仅 5.4%——‘造物者维护造物’的能力缺口被量化暴露。