Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents 精读
北京大学提出’本体信任’(ontological trust)这一新问题定义:长程agent的关键监督问题不是每步是否合规,而是不断演化的轨迹前缀是否仍对应用户授权的任务——漂移可以静默累积,每步都合规但整体已偏离。RGE监视器沿Role/Goal/Evidence三轴分解信任,LLM仅用于推导结构化表示,状态更新与干预决策全部确定性,输出可重放可审计的信任轨迹。在OSWorld/FinanceBench/EICU-AC跨域语料上,RGE的Drift F1超过93%且良性覆盖率≥95.8%,并实证了伪一致性检测受任务完成是否外部可见的结构性限制。