TACIT-SWITCH: Cost-Aware Model Escalation for LLM Agents from Censored Supervision —— 精读

论文链接:https://arxiv.org/abs/2608.27911

发表时间:2026 年 8 月 28 日(arXiv:2608.27911v1,cs.LG)

发表机构:北京师范大学统计学院(第一作者雷济安)、香港理工大学应用数学系(通讯作者 Huang Jian)

领域标签:cs.LG;LLM 路由、生存分析、序贯决策、Agent 成本优化

这是一次非常鲜明的学科跨界:作者团队是纯粹的统计学背景(统计学院+应用数学系),没有 AI 大厂或 AI 实验室参与,却把生存分析里一套成熟到近乎古典的工具(1982 年的混合治愈模型、1976 年的区间删失、1992 年的 AFT)精准地砸在了 LLM Agent 路由这个热点问题上。AI 使用声明中提到 OpenAI Codex 辅助编程与稿件编辑,离线教师由 DeepSeek V4 Pro 担任。


一、论文背景

1.1 Agent 部署的可靠性-成本两难

小模型便宜但不可靠,大模型可靠但昂贵——这是 LLM Agent 落地最现实的矛盾。一个多步交互式 agent 可能要跑几十步,每步都是一次模型调用;全部用 27B 模型,成本可能数倍于 4B/9B 模型,但小模型在长轨迹任务中容易陷入循环、违反协议、进度停滞等持续性失败模式,一旦陷进去,后面所有步都在浪费钱。

1.2 路由是一个序贯决策问题,不是一次性选择题

对单轮请求来说,路由就是生成前选个模型的静态问题(RouteLLM 干的事);FrugalGPT 用学习到的级联在失败后升级。但在交互式 agent 里,每一步动作都改变后续决策所处的状态,而循环、协议违规、停滞这些失败证据往往随轨迹展开才逐渐浮现。太早移交给大模型浪费小模型的成本优势;太晚移交可能已无可挽回。论文把这个问题定性为可恢复性感知的停时问题:判断是否、以及何时把控制权交给强模型。

1.3 已有路线的决策点都不对味

论文用一张图把现有方法按决策时机分成四类:任务级路由(执行前选一次)、SWE-Router 式固定前缀(跑 K 步后做一次继续/重启决策)、ReDAct 式步级局部干预(单步延迟,之后控制权回到小模型)、EvoRoute 式子任务级反复选模。本文研究一种不同的控制结构:自适应定时、单向后不可逆的永久移交——一旦交出控制权,本回合剩余动作全部由强模型完成。这个结构的直觉是:如果证据已经累积到需要强模型,情况通常不会自己好转。

1.4 学监督标签为什么难:反事实与歧义

学习『何时移交』最自然的监督是每一步都标注『此刻该不该移交』,但这需要从每个中间状态分别跑两个模型——反事实代价高昂。更麻烦的是『不该移交』标签本身有歧义:可能是轨迹还没烂到需要干预,也可能是强模型根本救不了这个任务。这两个不确定性(能不能救 vs 何时救)混在一起,直接学一个二分类必然被污染。这正是统计删失数据的经典困境,也是本文方法论的切入口。


二、论文定位和关联工作

2.1 谱系一:请求级与级联路由

RouteLLM 从偏好数据学习生成前的模型选择;FrugalGPT 学习级联,失败后逐级升级。这一谱系不观察演化中的轨迹,决策是静态的。TACIT-SWITCH 与之的区别在于把决策放到轨迹内的自适应时刻,利用运行时证据。

2.2 谱系二:步级局部干预

ReDAct 做不确定性感知的单步延迟(下一步还给回小模型),TRIM 假设有划分好的推理步骤与步级正确性分数。这类方法保留小模型控制权,适合『偶尔需要帮忙』的场景;但小模型的持续性失败模式(一错到底的循环)恰恰需要永久移交才能止损。论文将其作为主要 baseline 之一(Step Deferral)。

2.3 谱系三:固定前缀决策

SWE-Router 在固定 K 步前缀后做一次继续/重启决策。它的问题在于时机僵化:前 K 步可能已经错过最佳窗口,或还不足以暴露问题。论文实现了它的忠实类比作为 baseline。

2.4 谱系四:生存分析与删失统计(方法论血统)

这是本文真正的学术血统:Farewell 1982 与 Kuk & Chen 1992 的混合治愈模型把『是否会发生』与『何时发生』分开建模,本来用于癌症治疗中长生存期患者比例的估计;Turnbull 1976 处理只知事件落在某区间的删失观测;Wei 1992 的加速失效时间(AFT)模型把对数事件时间回归到协变量。人类干预标签的思想来自机器人学习领域的 Spencer et al. 2020。TACIT-SWITCH 的贡献是把这些零件组装成 agent 路由的学习器——迁移的关键洞察是:『强模型救得回的任务』对应治愈人群,『移交阈值』对应事件时间,教师粗窗口对应区间删失。

2.5 定位总结

方法决策时机决策结构是否用轨迹证据
RouteLLM / FrugalGPT执行前 / 级联失败后静态选择 / 升级否
ReDAct / TRIM每步局部、可逆是(单步信号)
SWE-Router固定前缀 K 后一次继续/重启部分(前缀)
TACIT-SWITCH自适应单向永久移交是(累积风险)

本文的位置:首个把区间删失生存分析引入 LLM Agent 模型升级决策的工作,用『教师标注窗口+配对 rollout 结局』这一廉价监督形式学习永久移交策略,并给出教师区间噪声下的有限样本稳定性保证。


三、问题定义

3.1 从工程困扰到统计结构

具体问题:预算约束下何时永久移交控制权。直接形式化是带约束的优化:在期望成本不超过预算的约束下最大化期望成功率。但这个公式没有回答监督从哪来——真正的难点在标签的结构。

论文的抽象洞察是:把移交决策放到一个习得的累积风险尺度上,而不是固定时间步上。具体做法:

  • 每个决策检查点 t,把已观察轨迹前缀映射为非负诊断向量 u_i(t)(重复/无效动作、不确定性、进度停滞等信号);
  • 学习非负权重 w(和为 1),得步级风险 r_i(t) = w·u_i(t),累积风险 R_i(t) = Σ r_i(s)——因为各量非负,R 单调不减,证据只积累不消退;
  • 对配对强 rollout 成功的回合,设潜在移交阈值 κ_i > 0,对应首越步 τ*_i = inf{t : R_i(t) ≥ κ_i}。

3.2 TACIT 监督的构造

训练数据来自每个任务跑一遍完整 Cheap rollout 与一遍完整 Strong rollout 的配对结局。记 A_i 为 Cheap 成功、B_i 为 Strong 成功,四种结局的处理:

结局类型含义似然贡献
AB=01Cheap 败、Strong 成配对强成功层;教师区间(或时间缺失)
AB=11双双成功配对强成功层;右删失
AB=10Cheap 成、Strong 败操作性治愈分量
AB=00双双失败操作性治愈分量

关键在 AB=01 的情形:离线教师通读失败的 Cheap 轨迹与成功的 Strong 轨迹,标出一个粗窗口——移交看起来有用且恢复仍然可行的检查点区间。单个检查点按一步区间处理,给出 R_i(a_i−1) < κ_i ≤ R_i(b_i) 的区间删失约束。只有 AB=01 接受教师窗口。

3.3 与深度学习的类比

可以这样理解这个抽象的精妙之处:『移交阈值 ≈ 深度学习中的学习率调度』——不是在固定 epoch 做决定,而是让一个单调量自己触发。两个不确定性的分离则像把『这题能不能做对』(分类)与『要花多少步才能做对』(回归)拆开建模,前者用逻辑斯蒂、后者用 AFT。

3.4 形式化目标

最终模型是乘积形式 q_i(t) = π_γ(x_i) · F_{β,s}(R_i(t)|x_i):前者是配对 Strong rollout 成功概率的估计,后者是在成功条件下阈值已被越过的条件概率。部署时在每个检查点计算 q̂_i(t),一旦超过阈值 α 就永久移交;α 在开发集上按成本预算选定后冻结,线上不需要教师。作者很诚实:教师是看完实现轨迹才标窗口的,这种粗化机制未必可忽略,所以式(7)只是工作似然,不声称对轨迹或教师标注的生成模型。


四、问题解法

4.1 发生率-阈值模型(incidence–threshold model)

三个经典统计工具的组装:

  • 混合治愈模型:把人群分成『不发生事件』的治愈部分与『会发生事件』的风险部分——对应『强模型救不回』与『救得回』;
  • 对数正态 AFT:成功条件下 log κ_i = x_i·β + s·ε_i,阈值随任务特征变化;
  • 区间删失:教师窗口 [a_i, b_i] 只约束阈值落在一个区间内。

参数 θ = (w, γ, β, s) 联合估计:w 是风险诊断权重(单纯形上),γ 是逻辑斯蒂系数,β/s 是 AFT 系数与尺度,γ、β 的非截距项加 ℓ2 正则。似然的三个分支分别处理治愈分量(1−π_i)、教师区间(π_i·[F(U_i)−F(L_i)])、右删失(π_i·[1−F(C_i)])。

4.2 理论保证:教师区间噪声下的稳定性

定理 1 给出有限样本界:若至多比例 ρ_T 的记录教师区间有误,在局部正则假设下,被污染的经验目标在干净总体目标极小点的邻域内有唯一驻点,参数误差与移交分数误差均为 O(√(p/n) + ρ_T)——两项分别对应有限样本波动与教师区间污染。直观理解:教师标错一小部分窗口不会摧毁学到的策略,错误率以线性方式进入误差界。这为『粗窗口监督可用』提供了理论背书。

4.3 部署算法

R ← 0;控制器 ← Cheap
while 回合未完成且预算未尽:
    若控制器是 Strong:执行一步 Strong 动作,继续
    获取 Cheap 检查点证据 e_t(ALFWorld 为动作后;DABench 为未执行提案)
    R ← R + ŵ·u(e_t);q ← π̂·F̂(R|x)
    若 q ≥ α:
        控制器 ← Strong,永久生效
        若 e_t 是未执行提案则丢弃,立即执行 Strong 动作
    否则:执行 e_t

因为诊断量非负、R 单调不减,切换时刻就是首个满足 q ≥ α 的检查点,调低 α 不会推迟越界。α 从低到高扫出一条成功-成本操作点族,开发集上在预算内选成功率最高的点后冻结。

4.4 特征工程(轻量是刻意的)

  • ALFWorld:12 维任务向量(请求状态、任务形式、目标类别、容器类型、可见实体数)+ 5 个步级诊断(重复动作、短循环、选中动作不确定性 1−exp(−NLL)、无效生成/回退、观测不变零奖励);
  • DABench:2 个任务特征(答案元数、精度指示)+ 8 个提案诊断(格式/协议违规、执行失败、重复、停滞、剩余工具预算压力、缺乏近期进展、与任务语义不匹配)。

整个模型是逻辑斯蒂+AFT 的浅层统计模型,联合拟合用 Adam 五到六次重启加早停。没有深度网络、没有强化学习——这是统计学家式的克制:监督结构才是问题核心,函数族不必复杂。


五、评估指标与实验证据

5.1 三层实验设计

论文用三层实验递进验证,每层回答不同的问题:

  1. 正确设定下的模型恢复(统计一致性):数据直接从 AB-AFT 模型生成,检验估计器能否恢复参数与预测——1500 次拟合全部收敛,样本量翻四倍参数 RMSE 约减半,held-out q(t|x) 的 RMSE 从 n=500 的 0.0203 降到 n=8000 的 0.0052,符合 n^{-1/2} 速率。这一层证明估计器本身没病。
  2. 机制仿真下的决策效用(模型错设定下的稳健性):数据由一个十步三状态的类 agent 路径-状态过程生成,不服从拟合模型——检验的是拟合出的策略是否仍然有用。8000 训练、4000 开发(成本上限 16)、20000 测试,100 次独立重复。
  3. 真实交互 agent 实验:ALFWorld 与 DABench。

5.2 主指标:等成本下的成功率

机制仿真(核心对照):Pure Cheap 44.59%、Pure Strong 84.88%。在几乎相同的实现成本(15.91-15.95)下:

策略成功率相对 TACIT 差距
Task Router62.40%−11.12pp
Step Deferral62.98%−10.54pp
SWE-Router 类比66.13%−7.39pp
TACIT-SWITCH73.52%—

每一次重复中增益都为正。这个指标衡量的本质能力是:利用轨迹证据判断强模型何时更有用——三类基线分别代表『不看轨迹』『只看单步』『看固定前缀』,TACIT 用累积风险在自适应时刻决策。

信息消融(机制仿真内):等成本下 Full(任务特征+在线风险)73.51%,仅任务特征 66.62%(−6.90pp),仅在线风险 71.35%(−2.17pp)。在线风险贡献更大,但任务特征在风险之外仍添信息——两者互补。敏感性扫描进一步显示:任务特征 AUC 从 0.55 升到 0.72 时成功率从 71.56% 升到 74.87%;累积风险 AUC 从 0.60 升到 0.85 时从 67.38% 升到 77.96%——信息质量单调转化为决策收益。

5.3 真实 agent 实验

ALFWorld(文本家务任务,134 个未见回合;Qwen3.5-4B 或 9B 配 Qwen3.6-27B):

配对Pure Cheap最佳基线TACIT-SWITCHPure Strong
4B→27B1.5%Task Router 45.5%48.5%(成本 191.1)50.7%(成本 230.5)
9B→27B12.7%SWE-Router 35.8%45.5%(成本 165.1)50.7%

4B 配对下 TACIT 以 9.5pp 的显著优势超过 Task Router,逼近纯 27B 的成功率而成本更低;对 SWE-Router 的增益 bootstrap 区间 [17.2, 35.1](4B)与 [2.2, 17.9](9B)均不含零。1000 训练回合的大规模复核中两组配对仍居学习策略之首(55.1% 与 58.0%)。

DABench(数据分析 agent,Test67;9B→27B):TACIT 73.1%(49/67)为全部策略最高——包括超过 Pure Strong 的 68.7%——且平均成本 19.81 是所有学习策略中最低,Strong 调用占比 33.3% 也低于 SWE-Router 的 47.3%。对 SWE-Router 的增益区间 [−3.0, 14.9] 含零,作者如实标注为提示性而非结论性。

5.4 鲁棒性检查

  • 教师噪声:20% 区间挪一步的教师噪声下 q 的 RMSE 仅从 0.0075 微涨到 0.0077;翻转 Strong 结局的噪声影响大得多(0.0208)——教师标窗口可以粗,配对结局标错才是致命的;
  • 防泄漏纪律:所有策略的超参(包括 SWE-Router 的前缀长度与阈值)在开发集选定后冻结,测试集只评一次;成本以 4B 等价单位计(27B 每调用记 6.75),教师标注成本不计入部署成本。

5.5 证据链评价

这组实验设计的说服力在于层次分明:第一层排除『估计器自身有偏』,第二层排除『只在正确模型下有效』,第三层落到真实 agent。更难得的是作者对不显著结果的坦率(DABench 区间含零)与对 4B 场景的自我解读(Strong 占比 79.5%,主要证明的是频繁移交下延迟移交仍有收益)。


六、效果优势的根源解释

6.1 基线输在哪里(机制层面)

  • Task Router(62.40%):只用任务特征在执行前押注。它的信息上限就是任务特征的 AUC(约 0.6),看不到轨迹里逐渐累积的失败证据。机制仿真里它的成功率甚至低于 Pure Cheap 加 Strong 的任何智能组合方式——因为押错的任务整个回合用错模型。
  • Step Deferral(62.98%):只用最新一步的风险,单步干预后控制权还给 Cheap。小模型的持续性失败是状态性的——错误已经写进轨迹(走错房间、拿错物品),把方向盘还回去,它大概率继续错。单步信号也噪声大(AUC 0.691 vs 累积风险 0.774)。
  • SWE-Router 类比(66.13%):固定前缀 K 步后一次性决策,错过 K 步内未暴露、K 步后迅速恶化的一切窗口;且决策是重启——丢掉已推进的进度重新来。

6.2 TACIT-SWITCH 的三处根本性改变

  1. 单调累积风险作为决策尺度。把『何时移交』从时间轴搬到风险轴:同样的失败程度,步数多的任务在风险轴上早已越过阈值,步数少的还没到。聚合多个弱信号(重复、无效、停滞)成单调量,既降噪又天然给出停时语义(首越时)。这直接对应机制仿真里累积风险 AUC 0.774 显著高于单步 0.691 的事实,也是 Step Deferral 差距 10.54pp 的来源。
  2. 两个不确定性解耦。q = π(x)·F(R|x) 的乘积结构里,π 管『这个任务强模型救得回吗』(任务级、执行前可估),F 管『现在是不是最佳时机』(轨迹级、随证据更新)。AB=00/10 进入治愈分量而非硬标签,避免了『不该移交』歧义对训练的污染。反事实价值显著:信息消融显示仅用任务特征损失 6.90pp、仅用风险损失 2.17pp,两者乘积结构各司其职。
  3. 永久移交的结构假设与问题匹配。对持续性失败模式,止损必须不可逆——这正是对 Step Deferral 优势的根源。同时 π 的门控防止『强模型也救不回』的任务浪费预算(DABench 上 Strong 占比仅 33.3% 却拿到 73.1%),这是对 Pure Strong 的成本优势来源。

6.3 因果链小结

诊断聚合(单调累积风险)→ 信号质量提升(AUC 0.691→0.774)→ 时机判断更准;发生率-阈值分解 → 歧义标签不再污染训练 → 两个信息源互补增益(6.90+2.17pp);永久移交 → 与持续性失败模式的结构匹配 → 对可逆干预基线的优势。反事实检验:把教师窗口换成 20% 挪一步的噪声,RMSE 几乎不动(0.0075→0.0077)——粗监督够用的论断经过直接压力测试。

6.4 局限(作者自陈)

只允许一次永久移交,不建模可逆或反复切换;操作点依赖应用给定的成本函数(本文用参数量加权调用数作代理);依赖配对离线 rollout 与教师区间,系统性标注偏差或分布漂移会影响学到的策略。


七、必要知识反推

假设让一个没有背景的人重做这项工作,最少必须掌握什么?

7.1 领域知识层

  • LLM Agent 的运行结构与失败形态:步级检查点、动作后观测、提案式决策(ALFWorld 与 DABench 的检查点语义不同,算法要分别适配);循环、协议违规、停滞这些持续性失败模式的可观测信号(重复动作、NLL、无效生成等)。没有这些,设计不出有效的诊断向量。
  • 模型成本结构:参数量与推理成本的近似关系(4B 等价单位的换算),才能定义有意义的成本预算问题。

7.2 方法论知识层

  • 生存分析全家桶:混合治愈模型(Farewell 1982)、AFT(Wei 1992)、区间删失(Turnbull 1976)。不仅要会用,还要能看出『治愈=救不回、事件时间=移交阈值、区间=教师窗口』这个同构映射——这是全文的灵魂。
  • 删失机制的不可忽略性(Heitjan & Rubin 1991):教师是看完轨迹才标窗口的,粗化机制与结果相关,标准似然解释不再严格成立。意识到这一点并退守『工作似然』立场,是统计训练的体现。
  • 经验过程基础:sub-Gaussian 集中、覆盖网论证、强凸性——定理 1 证明的全部工具。
  • 路由文献谱系:知道 RouteLLM/FrugalGPT/ReDAct/SWE-Router 各自的决策结构,才能定义『永久移交』这个差异化问题并设计公平对照。

7.3 工程知识层

  • 基准协议与防泄漏纪律:train/dev/test 三分、开发集选操作点后冻结、配对 bootstrap 置信区间、McNemar 类配对检验的意识。
  • 教师标注流水线:用 DeepSeek V4 Pro 只标 AB=01 训练轨迹、标记语义(步 t 后移交对齐到 t+1 提案)、教师解释不用于拟合。
  • 轻量优化工程:单纯形参数化(softmax 加固定一个 logit消歧)、正尺度 softplus、数值地板 1e-12、多重启早停。

7.4 知识融合的关键节点

  • 节点一(同构发现):『学习移交时机的监督是删失的』×『生存分析有现成的删失工具箱』→ TACIT 监督表示。两个相隔四十年的领域在一个表示层上咬合。
  • 节点二(不确定性拆分):『不该移交有歧义』×『治愈模型恰好拆分两类人群』→ 发生率-阈值分解。把标注歧义转化为模型结构的自然成分。
  • 节点三(决策尺度转换):『固定步数时机僵化』×『风险单调累积』→ 累积风险尺度上的首越时。把停时理论的应用对象从时间换成学习到的量。

八、论文中可以提取的通用性灵感

灵感一:粗窗口监督 + 删失建模 = 廉价监督的正确打开方式

核心思想:当精确标注每个决策点太贵时,让专家标一个粗区间,用区间删失吸收不确定性——标注成本降一个量级,信息几乎不损失。

论文证据:教师只标 AB=01 轨迹的短窗口;20% 区间挪一步噪声下 q 的 RMSE 仅从 0.0075 到 0.0077;理论界 O(√(p/n)+ρ_T) 说明误差对窗口噪声一阶线性。

推广场景:教育领域教师只标『这道题在第 3-5 分钟时最值得提示』;医疗方案的干预窗口标注;代码评审只标『这一段里有个 bug』;RAG 中检索质量的大致档位标注。

灵感二:把『会不会发生』与『何时发生』拆开建模

核心思想:混合事件中两类不确定性性质不同,硬拆成一个模型会互相污染,乘积结构(发生率×条件时机)是干净的解法。

论文证据:AB=00/10 进入治愈分量而非负样本;消融显示任务特征与在线风险互补(6.90+2.17pp);DABench 上 Strong 占比 33.3% 拿到超过 Pure Strong 的成功率。

推广场景:客户流失预测(永不流失的客户 vs 流失时点);设备维护(不可修 vs 可修故障时点);裁员/招聘决策(该不该换人 vs 何时换);投资止损(标的没戏 vs 还没到卖点)。

灵感三:在习得的单调量上定义停时,而不是在原始时间上

核心思想:决策时机应该绑定在反映状态的累积量上,让首越时自然给出停时——同样的绝对进度,不同任务的相对危险度不同。

论文证据:累积风险 AUC 0.774 对单步 0.691、任务特征 0.605;风险 AUC 扫描单调转化为成功率(67.38%→77.96%)。

推广场景:早停以验证损失而非 epoch 计;自适应课程推进以掌握度而非题量计;医患随访以累积风险评分计;熔断机制以市场压力累积而非跌幅计。

灵感四:结构化的浅模型可以打赢黑盒深模型(在监督结构对的时候)

核心思想:问题的瓶颈若是监督信号的结构而非函数复杂度,一个正确分解的浅层统计模型配好特征就能超过复杂基线。

论文证据:逻辑斯蒂+AFT 的参数量级模型在等成本下超过学习级联、微调 7B 价值头的 SWE-Router 类比(73.52% vs 66.13%);全部特征是手工设计的十几个量。

推广场景:冷启动推荐先用分层统计模型;金融风控评分卡的生命力;小样本生物统计;任何标注昂贵、先验结构清晰的领域。

灵感五:不可逆干预对持续性失败模式是必要的

核心思想:当失败是状态性的(错误已写入轨迹/环境),可逆的局部干预治标不治本,止损需要一次性、不可撤销的控制权转移。

论文证据:Step Deferral 单步干预后控制权还给 Cheap,62.98% vs 73.52%;ALFWorld 4B 配对下 TACIT 延迟移交仍比 Task Router 高 3pp(45.5% vs 45.5% 持平的对比中 Strong 占比 72.8% vs 92.3%)。

推广场景:自动化运维中人工接管的永久性(回滚前不还给自动系统);项目救火时换负责人而非加帮手;危机公关的一次性权威介入;法务中的保全措施。

灵感六:部署成本与训练成本要分开记账

核心思想:离线收集监督(教师标注、配对 rollout)是一次性沉没成本,不计入部署;线上策略本身应近乎免费。

论文证据:教师只出现在训练期,部署时只需每步更新 R 并查一个乘积公式;SWE-Router 的价值头调用要计入成本(每调用 1.75 单位)而 TACIT 的打分几乎无成本。

推广场景:蒸馏后的轻量部署;离线 RL 的成本观;规则引擎 vs 在线推理服务的成本核算;咨询报告 vs 常驻顾问。


附录:方法一页图

训练期(一次性,离线)
  每任务并行跑 Cheap 与 Strong 全回合 → (A, B) 配对结局
  AB=01:教师(DeepSeek V4 Pro)标粗移交窗口 [a, b] → 区间删失
  AB=11:右删失;AB=00/10:治愈分量
  最大似然联合估计 θ = (w, γ, β, s)
  开发集按预算选 α 后冻结

部署期(无教师,近乎零开销)
  每检查点:R += ŵ·u(e_t)   (非负诊断 → R 单调不减)
  q = π̂(x) · F̂(R | x)       (能救回的概率 × 时机已到的概率)
  q ≥ α ? → 永久移交 Strong : 继续 Cheap

一篇示范了『带着成熟工具箱跨界的统计学家能给 AI 基础设施带来什么』的论文:问题定义的翻译(停时+删失)、监督表示的设计(TACIT)、模型的克制度与理论的严谨度,都值得 Agent 方向的研究者精读。