Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning (NFV) 精读
NFV(Microsoft Research,单作者 Shuvendu K. Lahiri)让 AI Agent 当形式验证语言的前端:Python 开发者用自然语言问’这个函数对不对’,Agent 把程序与规范翻译到 Dafny,由成熟验证器逐条机器检查,证明可查、缺陷有 witness。在 206 条数据集上 57.3% 的条目给出机器检查证明 @92.2% 精度——而 LLM-as-judge 直接判定的精度只有 72% 且无 artifact;无纪律的’LLM+验证器自由证明’更是 98% 的正确程序和错误程序都被’证明’(精度 50%)。关键机制是’无证明即弃权’与 staged discipline(溯源标签+冻结翻译堵死为证明而改代码的捷径)。