论文链接:Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization 发表时间:2026年9月(arXiv:2609.05258,HF Daily Papers) 机构:Cardinal Operations(杉数科技)× 上海交通大学——产学研合作:杉数贡献真实运筹优化咨询场景与业务规则,上交大负责基准设计与框架实现 领域标签:cs.AI / LLM 智能体 / 运筹学 / 交互式基准
一、论文背景
LLM 正在成为运筹学(OR)建模助手:用户用自然语言描述业务问题,模型产出数学规划模型。演示视频里这一过程行云流水——但真实 OR 咨询的第一现场是这样的:客户说"帮我排个班",没说加班上限、没说是否允许连排、没说法定休息间隔。目标、约束、业务规则经常缺失或含糊。
缺失的规格不是小事:不同的隐含假设会导出完全不同的数学规划——排班问题里"是否允许连排"直接改变约束结构与可行域。
概念铺垫:
- 数学规划(mathematical program):目标函数+约束集合的形式化优化问题;
- 前置澄清(pre-formulation clarification):在建模之前通过提问补全规格——专业 OR 咨询师的日常工作流;
- 静默假设(silent assumption):模型不问也不说,自己默默填一个默认值——这是最危险的失败,因为产出看起来完整,结构上却错了。
现有评测(OptiMusa、RouteLLM 类建模基准)全部假设规格完整,从头到尾没有测过"模型知不知道自己该先问"。
二、论文定位和关联工作
| 谱系 | 代表 | 核心思想 | 与本文的区别 |
|---|---|---|---|
| NL-to-OR 建模基准 | OptiMusa、Chain-of-Experts 等 | 自然语言→数学规划 | 假设规格完整,无澄清环节 |
| 澄清式对话系统 | 主动问答/意图澄清 | 通用澄清策略 | 无"规格缺口是否改变规划结构"的判断 |
| 需求工程 | 软件需求获取研究 | 需求不完备性 | 未与数学建模的 formal 后果连接 |
| τ^τ-Bench(同日) | 客户委托环境 | 劣构需求交付 | τ^τ 测整体交付,本文聚焦"建模前澄清"这一个决策点并给出形式化度量 |
定位结论:本文把"澄清"从对话技巧升格为可精确评测的决策问题,与同日 τ^τ-Bench 的失败模式发现(“几乎不与客户沟通”)互相印证——一个是评测证据,一个是解法框架。
三、问题定义
具体问题:面对不完整的 OR 请求,LLM 应该在什么时候问什么、什么时候停。
核心抽象——选择性完备性决策:澄清不是越多越好(交互有成本、用户会烦),也不是越少越好(静默假设会错)。正确的形式是一个决策问题:
- 给定:部分公开描述 D_pub、隐藏结构化槽位集合 S*(会改变规划结构的规格项)、有界交互预算 B;
- 求:一个澄清策略 π,在 B 内最大化 exact slot recovery,同时最小化静默假设与不必要提问;
- 核心张力:每个未恢复槽位都有"问错成本"(问了但不关键)与"不问风险"(静默假设致规格错)。
精妙之处:基准把槽位分为规格关键(formulation-critical)与规格无关两类——只有前者会改变数学规划的解空间。因此 optimal 策略不是"恢复所有槽位",而是精确识别并只恢复关键缺口。“知道什么值得问"被量化了。
四、问题解法
4.1 OR-Clarify 基准
- 每个任务:完整业务问题被刻意抽走若干槽位,留下部分公开描述;
- 交互环境:一个模拟用户持有隐藏槽位的真值,agent 的每次提问消耗交互预算;
- 两种模式:开放式提问(自由表述)与 choice-based(选择题式,降低表述歧义、纯测决策);
- 度量四件套:slot recovery(恢复率)、stopping behavior(何时停)、silent assumptions(静默假设率)、interaction cost(交互成本)。
4.2 InterOPT 两阶段框架
- Dynamic Gap Search(缺口诊断):对当前已知规格做结构化分析,识别未解决的规格关键缺口——哪些缺失项会改变规划结构;
- 交互控制:根据缺口的规格关键性决定下一步——问最有信息量的缺口、或宣布完备并停止。
设计哲学:先诊断、后交互——把"问什么"从语言直觉变成结构分析的结果。
五、评估指标与实验证据
| 指标 | InterOPT 表现 | 说明 |
|---|---|---|
| exact slot recovery(choice-based) | 大幅超越全部基线 | 主指标:精确恢复全部关键槽位 |
| exact slot recovery(open-ended) | 与最强先验方法持平 | 开放表述模式下竞争力保持 |
| 静默假设率 | 显著低于盲目建模基线 | 直接对应"规格错误"风险 |
| 交互成本 | 低于穷问式基线 | 不牺牲恢复率的省问 |
实验设计如何证明论点:
- choice-based 模式剥离了提问的表述技巧,纯测决策质量——InterOPT 在此大幅领先,证明增益来自缺口诊断而非话术;
- 开放模式保持持平,说明框架在真实对话形态下不付出代价;
- 四个度量维度共同刻画"选择性完备性"的完整画像:恢复多、假设少、问得少、停得对。
六、效果优势的根源解释
Baseline 的失败结构:现有建模 LLM 的隐含策略是"拿到什么就建什么”——训练分布里规格几乎总是完整的,模型从未被迫学习"缺失检测"。结果是要么静默假设(错误规格、解完全偏),要么模板化穷问(浪费预算在无关细节上)。
InterOPT 的根本改变:把澄清决策从"语言层面的直觉"迁移到"规划结构层面的分析"。Dynamic Gap Search 检查的不是"用户没说什么",而是"已收集的规格在数学规划的结构下还缺什么关键件"——缺失检测的参照系从语言完整性换成了解空间完整性。
因果链:参照系更换 → 每个候选问题的信息价值可以被结构分析排序 → 交互预算集中投放在规格关键缺口上 → exact slot recovery 提升、静默假设与冗余提问同时下降。
反事实:去掉缺口诊断、只保留提问预算控制,恢复率回落——证明增益不在"少问",在"问对"。
七、必要知识反推
领域知识层:
- 运筹学建模的业务常识:哪些规格项(容量、时限、连班规则)真正改变规划结构;
- 真实 OR 咨询的沟通流程——杉数的业务经验直接定义了"槽位关键性"的标注体系。
方法论知识层:
- 基准设计中的隐藏真值+有界交互范式;
- 决策类评测的表述控制(choice-based 消融话术干扰);
- LLM agent 的对话状态管理。
工程知识层:
- 模拟用户的实现(一致性、抗诱导);
- 数学规划求解器用于自动验证"槽位是否规格关键"(改变约束是否改变可行域/最优解)。
融合的关键节点:企业经验告诉你"哪些缺失会致命",求解器工程让"会致命"可以被机器自动验证——两者的融合使 OR-Clarify 的槽位标注摆脱纯人工主观性。
八、论文中可以提取的通用性灵感
“知道何时不完备"是独立于求解能力的元能力
- 核心思想:在任何建模/生成任务中,识别"规格缺口是否致命"应被独立评测与训练。
- 论文证据:choice-based 与 open-ended 的分离评测设计。
- 推广场景:需求分析 agent、代码评审(补全缺失的边界条件讨论)、医学问诊分诊、法律咨询。
静默假设应成为一等评测指标
- 核心思想:产出"看起来完整"但默默填充默认值的系统,比明确承认不知道的系统更危险。
- 论文证据:silent assumptions 作为四大量度之一。
- 推广场景:RAG 系统的拒答评估、自动报告生成、数据分析 agent。
以"结构后果"而非"语言完整性"定义信息需求
- 核心思想:问什么不应由"话里缺了什么"决定,应由"缺失改变什么结果"决定。
- 论文证据:formulation-critical 与 formulation-agnostic 槽位的区分机制。
- 推广场景:诊断决策(检验项目的边际信息价值)、实验设计(哪个测量最改变结论)、产品需求访谈。
剥离表述变量的 choice-based 消融是通用评测技巧
- 核心思想:先把决策从话术中剥离测决策力,再放回开放形态测综合力。
- 论文证据:两种模式结果分离归因。
- 推广场景:任何交互能力基准的构建。