Agent Seer: Synthesizing Scenarios from Specification Understanding 精读
Apple 团队提出 Agent Seer,一条仅以 MCP 工具规范为输入的四阶段流水线:工具语义解释、分层场景生成、mock 输出合成、数据接地多轮扩展,无需人工标注与真实工具执行即可产出完整评估 harness。在 7 个开源 MCP 规范(14–64 工具)上生成 337 个场景,平均工具调用正确性 0.911、对话连贯性 0.855,6 个中型规范实现工具 100% 覆盖。论文进一步给出三个反直觉发现:参数 schema 复杂度是质量变化最强相关因子而工具数量作用正交、argument 值准确性是主导失败模式、跨家族 judge 复验确认结论稳健。本精读逐部分拆解其方法设计、实验证据与优势根源。