ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 精读
上海交通大学提出ABSeeker,通过答案回溯线索恢复(ABCR)和线索锚定步级评分(CASS),将搜索Agent训练中稀疏的轨迹级结果监督转化为密集步级奖励。基于Qwen3.5-4B仅用8.5k样本,ABSeeker在BrowseComp上达55.3%,匹配约30B级Agent性能。本文深入解析答案回溯信用分配的机制设计、实验证据与优势根源。