AQuA: Recursively Self-Improving Quantitative Trading Research Agents —— 精读
论文链接:https://arxiv.org/abs/2608.12841
发表时间:2026 年 8 月(arXiv:2608.12841v1,2026-08-13 提交)
发表机构:普林斯顿大学(Princeton University)、蚂蚁集团(Ant Group)、斯坦福大学(Stanford University)——典型的"高校 + 企业"三方合作:普林斯顿提供学术框架与理论视角,蚂蚁集团提供真实量化场景与工程资源,斯坦福参与系统设计。一作 Jiacheng Guo、Suozhi Huang、Yunlong Gao 为同等贡献,通讯作者包含普林斯顿 Mengdi Wang。
领域标签:AI Agent / 量化投资 / 自主研究智能体 / 回测防泄漏
一、论文背景
1.1 AI 量化研究是什么
量化投资研究的核心工作,本质上是一个搜索问题:在一个巨大的空间里寻找"因子"(factor,即从行情数据中计算出的、能预测未来收益的信号)和"模型"(把多个因子或原始量价数据映射成预测分数的函数)。一个因子可以是简单如"过去 20 天的收益率",也可以是复杂如"成交量加权价格动量与波动率的比值"。
传统上这是人类研究员的领地:提出经济学假设 → 构造因子或模型 → 在历史数据上回测 → 验证 → 淘汰或保留。大语言模型(LLM)的出现改变了游戏规则——它们能读文献、提假设、写代码、根据实验反馈修正搜索方向,于是"让 AI 自主做量化研究"成了一个快速升温的方向。
但论文开篇就点出了这个领域的阿喀琉斯之踵:量化研究在一个巨大的空间上搜索,而小小的方法论错误就能变成"看起来很有说服力、却无法复现"的回测。一个读到了未来信息的特征、一个在测试集上挑选出来的策略、一个只在特定市场状态下有效的结果——都可能在线外(out of sample)失效。
1.2 回测泄漏:“偷看未来"为何是最大的坑
用一个类比从零讲起。想象你是一个学生,要在一场模拟考试(回测)中证明自己准备好期末考试(未来真实交易)。回测泄漏(leakage)就是你在做模拟卷时偷看了答案——分数很高,但这个分数对你期末考试的表现毫无预测力。
更阴险的是,泄漏往往不是故意的,而是代码里一个不起眼的细节。比如你想构造一个特征:“今天开盘到当前分钟的累计成交量占全日成交量的比例”。这个描述听起来完全"向后看”(只用过去的数据),但如果实现时分母用的是当天的总成交量——这个总量要到收盘才知道——那么每根 K 线的特征值都悄悄包含了"今天收盘时"的信息。这就是论文附录 B 记录的真实事故(下文详述)。
泄漏为什么在量化里特别致命?因为它和递归改进会发生化学反应。论文给出了一个精确的机制描述:
一个代码生成 agent 可能无意中引入一个时间对齐或预处理错误,用上了预测时不可得的信息。审查 agent 可能漏掉这个 bug,因为代码在语义上看起来是合理的。如果泄漏产生了高分,这个实验会被存储为成功先例,并在后续迭代中传播。递归改进放大一个未检出的错误,与放大一个真发现一样容易。
也就是说,自改进系统的记忆是双刃剑:真发现会累积,泄漏错误也会累积——而且后者往往分数更高(因为它"偷看了未来"),在选择性压力下反而更有生存优势。
论文把泄漏分成两类,这个二分法是全文的概念基石:
- 生成泄漏(generation leakage):agent 在写实验时引入的泄漏——特征、标签或归一化方式用到了预测时不可得的信息。上文的"全天成交量分母"就是典型。
- 选择泄漏(selection leakage):agent 在选结果时引入的泄漏——搜索过程能读到最终要报告的指标,迭代足够多之后,它会学会选出恰好在这个指标上碰巧好看的候选。这就像反复参加同一份模拟考并挑出最好的一次成绩当真实水平。论文引用了 Blum and Hardt (2015) 的"梯子"(Ladder)研究:反复访问固定测试集会导致自适应过拟合。
1.3 递归自改进 agent 在金融场景的挑战
“递归自改进”(recursive self-improvement)指的是:系统用早期实验的证据来改进后续迭代中提出的假设和候选。这在大模型研究语境里是个热词,但论文刻意做了一个克制的界定——AQuA 的"自改进"是研究过程层面的、有边界的:改进的是假设与候选的质量、研究状态里累积的信念,而不是去更新底层语言模型的权重,也不是去改评价标准。论文原话说得很清楚:“what improves is the research process, not the definition of success”——改进的是研究过程,而不是成功的定义。
把这个概念放进金融场景,挑战立刻凸显:
- 证据容易被污染:如前所述,一个泄漏 bug 会以高分"感染"整个研究记忆;
- 奖励不可靠:已有研究观察到语言模型 agent 会钻评估器、测试、奖励机制漏洞(reward hacking),而 prompt 层面的指令和"让另一个 LLM 审查代码"都不构成可靠的完整性边界——因为作者和审查者共享同样的盲区;
- 金融数据信噪比极低:单特征 IC(信息系数)通常只有 0.03 量级,任何微小的泄漏都能把信号"放大"到远超真实水平,让人更难分辨真假。
AQuA 的回答是:不指望 agent 自觉,也不指望审查 agent 尽责,而是让泄漏动作根本无法发生。
二、论文定位和关联工作
2.1 两条谱系
论文的相关工作地图可以梳理成两条主要谱系,AQuA 站在两者的交汇处:
谱系一:LLM 驱动的 alpha 挖掘(alpha mining)。这条线从更早的非 LLM 方法演化而来:遗传编程搜公式(AlphaEvolve、AutoAlpha)、强化学习生成因子(AlphaGen 及后续)。进入 LLM 时代后爆发式增长:树搜索 + 思维链(Alpha Jungle/Chain-of-Alpha)、多智能体生成-选择管线(Chen and Kawashima)、带经验记忆的自进化 agent(FactorMiner、AlphaMemo、AlphaAgentEvo)、安全与可复现约束生成、市场逻辑建模(AlphaLogics)、标准化基准(AlphaBench)。所有这些工作共享同一个经典语汇表——Kakushadze 的《101 Formulaic Alphas》算子体系。
谱系二:自主研究 agent(autonomous research agents)。金融之外的通用方向:AI Scientist(端到端跑科研流程)、FunSearch(程序搜索做数学发现)、EurekAgent(环境工程之于自主发现)等。同一模式也进入了交易决策(多智能体 LLM 投资团队)。
2.2 AQuA 在谱系上的位置
关键差异有两点。第一,既有量化 agent 通常只做因子发现或只做模型开发,AQuA 把两者作为两个独立的自改进系统并列呈现,研究"递归自改进"这个抽象模式在不同研究对象上的分别实例化。第二,也是最核心的:既有工作防泄漏靠审查或约束提示,AQuA 靠构造——数据路径和评估器对 agent 不可达,而不是靠 agent 的判断力。
下表对比 AQuA 与代表性关联工作:
| 维度 | AlphaGen(RL 因子挖掘) | AlphaMemo(记忆驱动挖掘) | AI Scientist 类 | AQuA |
|---|---|---|---|---|
| 研究对象 | 公式化因子 | 公式化因子 | 通用科研全流程 | 因子发现 + 模型开发(两个独立系统) |
| 驱动方式 | 强化学习 | LLM + 结构化搜索记忆 | LLM 多智能体 | LLM 多智能体 / config 驱动循环 |
| 跨迭代记忆 | 无(策略隐式) | 有(搜索过程记忆) | 有(论文级) | 有(跨运行信念 + 知识库) |
| 防泄漏手段 | 算子库(部分) | 约束生成 | 依赖审查 | 密封沙盒 + 非对称自由(构造性) |
| 防选择泄漏 | 未系统处理 | 未系统处理 | 未系统处理 | 搜索只见验证集分数,测试窗口冻结后只评一次 |
深度模型方面,Part II 的混合架构用的都是标准组件(时序卷积、状态空间模型、注意力),论文明确说贡献"不是新原语,而是一个让 agent 组合原语、跨变体累积证据的自主循环"。
三、问题定义
3.1 抽象问题:让自改进只放大真发现
论文的核心问题可以一句话表述:如何让自主改进只放大真发现、而不放大泄漏错误——把"不可作弊"做成系统的构造性质(property by construction),而非审查性质(property by review)。
展开说,“审查性质"是指:允许 agent 做任何事,然后靠另一个审查者(人或 LLM)事后检查有没有作弊。“构造性质"是指:从系统设计上让作弊动作不可表达——就像一个只有加法的计算器不可能算错乘法,因为它根本不会乘法。
3.2 形式化:密封沙盒与非对称自由
论文给出了一套简洁的形式化。对每个部分(Part)$p \in \{I, II\}$,研究循环的递归式为:
$$R^{(p)}_{t+1} = U_p(R^{(p)}_t, H^{(p)}_t, C^{(p)}_t, E^{(p)}_t), \quad (H^{(p)}_{t+1}, C^{(p)}_{t+1}) \sim P_p(\cdot \mid R^{(p)}_{t+1})$$其中 $R$ 是持久研究状态(记忆/信念),$H$ 是假设(因子或模型配置),$C$ 是构造出的因子或训练出的模型,$E$ 是实验返回的已验证证据。上标强调隔离性:Part I 不更新 Part II 的状态,反之亦然。
而每个实验的评分通过密封沙盒完成:
$$s_k = V(C(\theta_k); \mathcal{S}), \quad \theta_k \in \Theta, \quad \mathcal{S} = (\mathcal{D}, \mathcal{F}, \mathcal{L}, V) \text{ sealed}$$其中 $\mathcal{S}$ 包含数据切分 $\mathcal{D}$、特征定义 $\mathcal{F}$、标签定义 $\mathcal{L}$、评估器 $V$——全部密封、人类撰写、agent 永远不能编辑。agent 的每个动作只是从受限空间 $\Theta$ 中取一个规格 $\theta$,由固定框架编译并经密封评估器打分。$\Theta$ 被定义为没有任何 $\theta$ 能改变 $\mathcal{S}$。
这就是非对称自由(asymmetric freedom):agent 在 DSL 内部想怎么探索就怎么探索,但评估器永远在自适应面(adaptive surface)之外。agent 可以变强,但它变强的方向永远不能指向"修改考试规则”。
3.3 DSL 约束:表达力与安全性的权衡
$\Theta$ 的设计是一场权衡。太窄,agent 搜不出好东西;太宽,泄漏趁虚而入。AQuA 的解法是算子注册表(operator registry):
- Part I 的注册表是标准公式化 alpha 算子集:叶子是原始字段(open、high、low、close、volume、vwap、returns),内部节点是三类算子——截面算子(rank、z-score、行业中性化,只读同一时间戳上全宇宙的数据)、时序算子(lag、差分、滚动相关/协方差、滚动排名、滚动标准差、线性衰减加权,只读截至当前时间戳的尾部窗口)、逐元素算术与条件。因子是这些算子在原始字段上的复合,表示为一棵表达式树。论文的运行示例:$f = \mathrm{rank}(\mathrm{corr}(r_{1d}, v_{1d}, 20)) - \mathrm{rank}(\mathrm{std}(r_{1d}, 20))$。
- Part II 的注册表覆盖整个实验:从冻结集合中选数据切分、采样器、架构块、损失、优化器。一个假设就是一个 config diff(配置差异)。agent 不能写数据加载器、切分逻辑或评估器。
关键的数学性质是因果性在复合下封闭(causality closed under composition):每个时序算子只读尾部窗口、每个截面算子只读当前时间戳,所以无论 agent 怎么拼,拼出来的任何表达式天然因果——它根本没有办法引入一个读取未来数据的原语。“全天归一化"这类错误在这个语言里写不出来。
代价是表达力受限:某些复杂特征无法表达。但论文附录 B 用一个真实失败案例论证了这笔交易值得(见第五节)。
四、问题解法
AQuA 由两个互不共享智能体、记忆、候选空间、研究状态的系统组成。它们只共享同一个高层模式:假设 → 构造/训练 → 评估 → 验证 → 选择/组合 → 持久状态更新,下一步的假设会参考更新后的状态。
4.1 Part I:自主因子发现——Manager 调度的六智能体管线
架构:一个 AI Manager(管理者)中介每次运行。它读研究策略、累积记忆和历史运行记录,据此写出一份计划,给每个下游智能体分配具体任务。智能体之间从不互相调用,每次交接都经过 Manager——这让整次运行可审计、可复现。
六个专职智能体按序执行:
| 智能体 | 职责 |
|---|---|
| Data Steward(数据管家) | 加载对齐行情数据,返回质量报告与原子特征 |
| Visual Analyst(视觉分析师) | 在历史中搜索指定类型的代表性事件,总结成事件画像 |
| Idea Miner(点子矿工) | 从事件画像出发提出候选因子 |
| Factor Evaluator(因子评估者) | 给每个候选打分 |
| Backtest Engineer(回测工程师) | 在模拟中交易信号 |
| Research Librarian(研究档案员) | 记录结果、更新记忆 |
可证伪假设:因子进入管线时是"提案"而非"表达式”。Idea Miner 必须先陈述:假设是什么、背后的经济机制、预测方向、以及在什么条件下应视为被驳倒(falsification criteria)。论文 Listing 1 给了一个漂亮示例——“强制平仓引发的持仓量(open interest)骤降后,若价格反弹没有得到主动成交流(taker flow)确认,则更可能失败”,其证伪条件包括"IC 不集中在平仓事件窗口内"“样本外或跨市场状态下符号翻转/消失"“被价格、持仓量或成交流基线吸收”。每个因子自带 rationale 和自己的测试,先立论后构造。
评估合同:Factor Evaluator 对每个提案执行统一合同——跨多个前瞻收益标签的 IC、月度稳定性、held-out 表现、市场状态行为、换手率、表达式复杂度、与现有因子池的相关性;还有与简单基线(价格/成交量/持仓量/基差/成交流变化构造)的受控对比;事件相关提案还要对比事件窗口内外的 IC。因子只有在"不是基线的复述"且"最强表现出现在其机制预测的市场情境中"时才被保留。
方向校准:Backtest Engineer 会同时测试提案方向和反向,保留交易解释更干净的那个——因为一个公式即使初始符号写反了,仍可能有预测内容。
跨运行信念:Research Librarian 在每次运行后写入结构化记录(目标、事件类型、视觉观察、机制、因子、回测摘要、更新的信念)。信念形如给"某市场情境下的某机制"附加置信度,例如"持仓量崩塌后缺乏成交流确认的反弹倾向于反转”。三个嵌套反馈环:单次回测内的方向校准 → 单次运行内失败提案更新信念 → 跨运行 Manager 读记忆引导下次搜索。后继运行不从空白提示开始,而是继承观察、规避反复失败的机制、用新事件定义/周期/条件变量精炼有希望的机制。
4.2 Part II:自主模型开发——config-diff 驱动的混合架构
循环:每次迭代以一个 config diff 开始——对架构、损失、采样器或优化器的一处修改。框架把 diff 编译成训练运行,经密封评估器打分,结果写入知识库供下一个假设读取。因为一个 diff 恰好对应一个变体、数据路径固定,两个变体只在你改的旋钮上不同——直接可比,且搜索无泄漏。
混合时序模型(论文 Figure 5)分四段:
- 多尺度卷积前端:多组一维卷积以不同核尺寸与膨胀率在输入历史上滑行,在每个时间步为每只股票的近期量价动态构建丰富的局部表示——负责"捕捉局部形态”;
- 注意力主干(可配置为循环/状态空间/注意力,实验配置用注意力):承接前端表示,建模长程时序依赖;
- 截面混合阶段:在每个时间步跨股票面板混合信息(panel interaction)——个股不是孤立的,板块联动本身是信息;
- 门控融合 + 池化读出:多分支以门控机制融合,读出头为每只股票输出一个分数。
整个模型只是配置空间中的一个点:卷积前端、序列模型家族、截面混合、融合全是注册表里的算子——新模型 = 新 config,而非新代码。损失是三项组合(spearman_ic、huber_csz、turnover_reg)。
4.3 密封沙盒机制:三道闸门
把两部分的防护合并看,密封沙盒由三道闸门构成:
| 闸门 | 机制 | 切断的泄漏通道 |
|---|---|---|
| 数据切分 + 特征/标签定义固化 | $\mathcal{D}, \mathcal{F}, \mathcal{L}$ 人类撰写并密封,agent 只能引用 id | 生成泄漏(数据路径不可达) |
| 受限 DSL | agent 只能从因果算子注册表复合表达式 / 只能写 config diff | 生成泄漏(泄漏不可表达) |
| 评估器固化 + 指标分离 | 搜索期间 agent 只见预先固定的验证切片分数;测试窗口在配置冻结后只评一次、永不返回给 agent、不用于排名 | 选择泄漏 |
指标分离是点睛之笔:搜索优化的指标 ≠ 最终报告的指标。早期停止和 checkpoint 选择都只由训练窗口尾部的内部验证切片驱动;Part II 的最终测试窗口是完全未触碰的 2021–2025,所以报告的测试系数相对于整个搜索是样本外的。
4.4 类比对偶表
两个系统形成一组漂亮的对偶:
| 维度 | Part I(因子发现) | Part II(模型开发) |
|---|---|---|
| 假设 | 可证伪经济假设(提案) | 单个 config diff |
| 构造 | 符号因子表达式 | 训练混合时序模型 |
| agent 形态 | Manager + 六智能体管线 | config 驱动循环 |
| 记忆 | 跨运行信念(belief store) | 知识库(知识条目) |
| 市场/频率 | 加密货币 5 分钟(BTCUSDT_5m) | 美股 30 分钟前瞻收益 |
| 产出 | 组合因子信号 | 交易模型 + 策略 |
五、评估指标与实验证据
5.1 Spearman IC:衡量"排序能力"
**信息系数(IC)**是量化研究最核心的指标之一。定义为预测分数与后续真实收益之间的相关系数——Spearman IC 用的是秩相关,即只问"你给排在前面的股票,未来收益是不是真的更靠前",不关心具体数值间距。IC = 0.05 意味着非常弱但真实的预测力(金融里 0.03 就值得认真对待),IC = 0.3 以上在日频以上尺度几乎必然可疑。$R^2 = \text{mean}(IC^2)$ 衡量解释力,Sharpe 是收益波动比、衡量策略质量,@2bp 指每次建仓平仓按万分之二计交易成本。
注意论文反复强调:Part I 的组合信号 IC(加密 5 分钟宇宙)与 Part II 的每股 IC(美股)是两套不同约定,不能直接对比。
5.2 Part I 结果:迭代中上升的组合信号
Part I 的产出是由通过评估与方向校准的因子组合成的信号。跨自主研究迭代:
| 方法 | 组合验证 Spearman IC |
|---|---|
| Alpha158-style | 0.075 |
| LightGBM | 0.106 |
| LSTM | 0.137 |
| AlphaGen adapted | 0.151 |
| AlphaMemo adapted | 0.171 |
| AQuA(Ours + AlphaGen PV) | ≈0.190 |
0.190 对比 AlphaMemo 的 0.171、AlphaGen 的 0.151。更重要的是趋势:组合验证 IC 随迭代上升——论文将其归因于循环"累积并复用已验证证据",与更丰富的事件画像、持仓量与成交流条件化、拥挤度分歧机制、状态感知因子选择的加入同步。每个单独机制的因子 IC 通常只有 0.03 量级(论文明确说这是日内公式化信号的正常区间)——强度不来自任何单一规则,而来自把一个机制接地的因子库组合成更强的聚合信号。附录 A 的完整迭代记录显示,所选最强单因子(“OI 崩塌反弹成交流缺口"机制)IC 在 0.026–0.037 之间。
5.3 Part II 结果:held-out 2021–2025 全景
数据切分严格按时间:2010–2019 训练,2020 作为禁运间隔(训练与选择都不触碰),2021–2025 为未触碰测试窗口。任务:预测每只股票未来 30 分钟收益。
单特征 IC(Table 1):所有代表性量价特征——5/15/30/60 分钟收益、4 小时收益、30 分钟/1 小时波动率、动量/波动比——没有一个超过 0.03 量级,ridge 线性组合也只有 +0.025。信号不在任何单个特征里,而在它们的联合非线性时序结构中。
模型对比(Table 2,同一评估器、同样数据训练):
| 模型 | 家族 | 每股原始 IC |
|---|---|---|
| Linear (ridge) | 线性 | +0.0251 |
| LGB | 梯度提升 | +0.0397 |
| xLSTM | 循环 | +0.0434 |
| LSTM | 循环 | +0.0535 |
| GRU | 循环 | +0.0613 |
| AQuA(混合) | 混合 | +0.0843 |
对比最强基线 GRU 的 +0.0613:绝对提升 +0.0230,相对提升 37.5%。规律清晰:线性与树模型抓到部分信号,序列模型更多,混合模型最强。
主结果表(Table 3,held-out 2021–2025):
| 指标 | 数值 |
|---|---|
| ① 每股 IC(原始) | +0.0843 |
| ② 每股 $R^2 = \text{mean}(IC^2)$(原始) | 1.20% |
| ③ Sharpe@2bp,行业中性组合 | +2.15 |
| + 因果波动率目标 overlay | +2.50 |
| 完全因果 walk-forward(无后见) | +2.00 |
从信号到策略的路径:模型输出每股分数 → 高于上门限做多、低于下门限做空的美元中性阈值组合,固定节奏调仓,双腿各付 2bp。两步构造抬升 Sharpe:行业中性化去掉行业共性暴露后达到 +2.15(且训练集与 held-out 数值几乎相等——说明构造本身没有过拟合);因果波动率目标(用在线估计的尾部波动率向扩张中位数目标缩放每日敞口)进一步达到 +2.50。最严苛的完全因果 walk-forward——每个模型与策略参数只用下一段测试期之前可得的数据确定——仍保有约 +2.0。
逐年稳健性(Table 4):2021 至 2025 每年为正——+1.7、+3.5、+1.9、+1.8、+2.7(Sharpe@2bp),包括 2022 年指数大回撤期间。策略不依赖单一市场状态。策略净值曲线在整个窗口稳步爬升、持续新高,且避开了 Nasdaq-100(QQQ)2022 年的回撤(QQQ 是纯多头、未做风险匹配,仅作参照)。
5.4 附录 B:一个"审查漏掉、算子化堵死"的真实泄漏案例
这是全文最有教学价值的部分。密封沙盒不是 AQuA 一开始的设计,而是对早期更宽松循环的失败回应。
早期循环中 agent 直接写特征代码,另一个审查 agent 逐个检查前瞻偏差。有一个提案特征是"日内成交量参与率”:开盘到当前分钟的成交量 ÷ 日内成交量归一化器。意图是因果的,描述读起来是向后看的,审查 agent 批准了。但实现中归一化分母是当天全天总成交量——一个从开盘累加到收盘的总量。分母依赖当前分钟之后的 K 线,这个特征把"收盘时才知道的信息"悄悄编码进了每个日内时间戳。同一失败还出现在多分辨率变体中(日频分支聚合当天全部 K 线、却在午间时间戳被读取)。
症状:held-out IC 远超可比量价特征;干净重切评估窗口后不复存在。人工审计追溯到全天分母。审查 agent 推理的是特征的经济意图(“过去成交量之比”),而非实现触碰的确切 K 线集合——这个盲区与作者 agent 共享。
论文的结论一针见血:LLM 审查 LLM 写的代码是建议性的,不是结构性的。AQuA 的回应是算子化(operatorization):agent 不再写特征/因子代码,只在固定因果算子注册表内复合——因果性在复合下封闭,全天归一化器在规格空间里根本不可表达。保证从"审查者应该能抓住泄漏"升级为"泄漏写不出来"。
六、效果优势的根源解释
6.1 为什么混合模型的 IC 能超单族模型
因果链如下:单特征 IC 均 < 0.03 → 信号藏在量价特征的联合非线性时序结构里 → 混合架构恰好分工建模这种结构。多尺度卷积前端捕捉不同时间尺度上的局部形态(短期微观结构模式),注意力主干捕捉跨越数百根 K 线的长程依赖(趋势语境),截面混合捕捉股票间联动(板块信息),门控融合让模型自己学会在哪种情境下更信哪条通路。每一层都对应信号结构的一个侧面,合起来把联合结构中的可预测性挖出来——这就是 +0.0843 对 GRU +0.0613 的来源:GRU 只有长程依赖建模,缺局部形态与截面联动两条腿。
6.2 为什么递归改进真的在累积"真发现"
密封沙盒的作用在于改变选择性压力的方向。在宽松系统里,泄漏候选因分数虚高而在记忆中获得优势地位,污染后续搜索;在密封沙盒里,生成侧泄漏不可表达、选择侧只见过验证集分数,所以能在迭代间累积的只有验证集上可复现的真信号。于是跨运行证据累积表现为组合 IC 逐轮上升(第五节图 3 的趋势)——改进的是研究过程,成功定义纹丝不动。
6.3 与 alpha mining agent 的信念更新机制差异
对比 AlphaMemo 类系统,AQuA Part I 的信念更新有三个独特点:其一,信念绑定机制与市场情境(“持仓量崩塌 + 无成交流确认的反弹会失败”),而非绑定表达式模式,因此可跨事件类型迁移;其二,每个信念自带证伪条件,被证伪时修剪的是机制而非表面公式;其三,也是决定性的,信念的写入通道经过密封评估合同——只有通过了基线对照、事件窗口对照、月度稳定性检验的证据才能成为信念。别的系统里,一条高分但泄漏的记录同样能写入记忆并被传播;AQuA 里这种记录在写入前就被评估合同拦下。记忆的可信度不取决于记忆机制的设计,而取决于进入记忆的门票由谁发放——门票发放者(评估器)在自适应面之外,这就是全部分野。
七、必要知识反推
要做出这项工作,以下三层知识是必要的:
领域层:量化金融与市场微观结构。需要理解因子、IC、换手率、行业中性化、波动率目标这些基本件;更需要市场微观结构的直觉——持仓量(open interest)、基差(basis)、主动买卖方成交流(taker flow)这些衍生品市场字段的经济含义,才能设计出"平仓后弱反弹"这类机制假设与事件画像。没有这层,DSL 注册表的算子集设计(选哪些算子、定哪些字段)就无从谈起。
方法论层:因果推断 + DSL/语言设计。核心是"因果性在复合下封闭"这个代数性质——它要求把时序算子限定为尾部窗口读取、截面算子限定为当前时间戳读取,才能保证任意复合不出未来信息。这其实是形式化验证领域"构造正确性"(correctness by construction)思想在特征工程上的投影。同时需要 DSL 设计的权衡感:注册表覆盖的实验自由度要够 agent 搜索,又要小到泄漏不可表达。防选择泄漏的"指标分离"则来自对自适应过拟合文献(Blum-Hardt 梯子)的理解。
工程层:评估器工程。密封沙盒不是一份文档而是一套工程:冻结切分的引用机制(config 里只写 id)、固定评估器的一致打分、验证/测试指标的分发控制(哪些分数能回到 agent 手里)、walk-forward 重评估管线。附录 B 的失败案例说明这套工程是被真实事故逼出来的——评估器的可靠性直接决定整个自改进循环的可信度。
融合节点:这项工作真正的知识创新在三层交叉处——把形式化验证的"构造正确性"思想引入自改进 agent 的防护设计。传统上这两个领域几乎不相交:形式化验证关心程序是否满足规约,agent 研究关心探索与利用的效率。AQuA 把"agent 的动作空间"当作一个可以证明安全性质的对象来设计($\Theta$ 中不存在能改变 $\mathcal{S}$ 的 $\theta$),这在 agent 安全文献里是"能力控制"(capability control)思路,而用 DSL 实现它则借了编译器与数据库(受限查询语言)的成熟经验。
八、通用性灵感
以下几条灵感超出了量化金融本身。
灵感一:把安全约束做成构造性质,而非审查性质。 核心思想:与其事后检查行为是否越界,不如让越界动作在动作空间里不存在。论文证据:附录 B 中 LLM 审查漏掉全天归一化泄漏,算子化后该错误"不可表达",保证从"应该能抓住"变成"写不出来"。推广场景:代码生成 agent 的沙盒(禁掉文件系统/网络的子集而非靠审查拦截)、数据隐私合规管道(PII 处理算子化,使违规转换无法书写)、自动驾驶规划模块(动作空间里干脆没有违反交规的原语)。凡是有"agent + 危险动作"的地方都适用。
灵感二:受限表达力是自由的保护壳。 核心思想:限制 agent 能说什么,恰恰保护了它探索的自由——因为在一个无约束语言里,一次泄漏事故就会污染记忆、进而劫持整个搜索方向;受限 DSL 保证了迭代累积的都是可复现证据,探索的复利才不会被打断。论文证据:密封沙盒下 Part I 组合 IC 逐轮上升到 0.190、Part II 变体间直接可比。推广场景: prompt DSL 限制工具调用面、科研 agent 只能引用已登记的测量协议、儿童编程语言用语言设计换安全。这与"约束即解放"的软件工程老话同构。
灵感三:跨运行记忆让研究信念可累积、可审计。 核心思想:把每次实验变成"目标—事件—机制—证据—信念"的结构化记录写入持久状态,后续搜索从信念出发而非从空白提示出发,研究变成累积性事业。论文证据:三个嵌套反馈环(方向校准/证伪更新/跨运行引导),后继运行继承观察、规避反复失败的机制、精炼有希望的机制。推广场景:任何长周期 agent 系统的"经验库"设计——debug agent 记住"哪类修复模式在哪类代码库有效"、内容创作 agent 记住"哪类选题在哪个平台共鸣"。
灵感四:评估器固化是自改进系统的锚点。 核心思想:自改进系统的一切学习信号都从评估器流出,评估器若可被优化,改进就退化成对评估器的过拟合——所以评估器必须在自适应面之外,且"搜索优化的指标"与"最终报告的指标"要分离。论文证据:搜索期间只返回验证切片分数、2021–2025 测试窗口冻结后只评一次;测试隔离是"需要审计的治理属性"而非密码学保证(论文坦承其局限)。推广场景:RLHF 中固定不可学习的评估组件防止 reward hacking、自动机器学习(AutoML)中冻结 leaderboard 测试协议、AI 科研 agent 的评审流程设计。
灵感五:复合封闭性是低成本安全的形式化工具。 核心思想:不需要对每个生成的程序做全局验证,只需保证原语集合的某性质在复合下封闭,则任意组合自动继承该性质。论文证据:尾部窗口时序算子 + 当前时间戳截面算子 → 任意表达式树因果。推广场景:差分隐私组合定理(DP 算子复合仍是 DP)、数据库视图的安全代数、分布式系统的无死锁组合定理。设计"安全原语集 + 封闭性证明"往往比逐案审查便宜且可靠。
结语
AQuA 最值得记住的,不是 0.190 的组合 IC 或 +2.50 的 Sharpe,而是一个关于信任放置位置的洞察:让自主系统可靠的办法,不是审计它的推理,而是构造让它无法作弊的环境。当数据路径不可达、泄漏不可表达、报告指标不被优化,递归自改进才从"放大一切高分"变成"只放大真发现"。这个配方——密封沙盒、非对称自由、指标分离——论文自己说"是通用配方而非金融专用技巧",值得每一个构建自改进 agent 的人认真对待。
本文基于论文全文逐页阅读撰写。