在量化投资领域,寻找 Alpha 因子如同大海捞针。传统方法依赖专家经验或静态数据,难以适应市场与学术前沿的快速迭代。即使引入大型语言模型(LLM),也面临语义漂移、因子冗余、流程割裂等核心痛点。
针对这些挑战,来自中南财经政法大学、清华大学和澳门大学的研究团队提出了 AlphaSeek——一个端到端的 LLM 驱动自动化因子挖掘智能体。其核心创新在于“轨迹级”因子演化框架:它将“提出假设→构建因子→回测验证→反馈优化”的完整研究过程封装为一个轨迹单元,以此进行进化。通过“并行方向扩展、变异、交叉”三大演化算子,AlphaSeek 既能保留已验证的有效逻辑,又能持续探索新方向,避免语义漂移和随机搜索的低效。同时,它构建了“挖掘-组合-回测”的自动化闭环,新因子能与现有最优因子库动态交互,在冗余约束下自迭代优化组合。
在沪深 300 上的实测中,AlphaSeek 以 8.28% 的年化收益率、1.29 的信息比率和仅 6.28% 的最大回撤,全面超越了所有主流方法,并在零样本迁移至沪深 500 时展现出强大的跨市场泛化能力,标志着量化因子挖掘正从“自动生成”迈向“自主研究”的新纪元。

简介
量化因子挖掘是量化投资的核心问题之一。其发展经历了从资本资产定价模型(CAPM)到 Fama-French 三因子模型、五因子模型以及后续众多实证研究的理论演进。为了实现自动化因子搜索,遗传规划(GP)和强化学习(RL)以及深度学习(DL)技术被广泛应用。近年来,LLM 驱动的因子挖掘方法发展迅速,通过自然语言理解能力扩展候选因子空间,并结合结构化搜索机制提高因子质量。
然而,传统方法(无论是手动构建还是自动化搜索)大多依赖于研究人员的主观经验或静态固定数据集。经典研究已证实,定价因子的盈利能力在学术发表后会显著衰减,这使得及时捕捉前沿的资产定价成果至关重要。遗憾的是,传统范式难以适应动态市场变化,也无法与最新的学术进展同步更新研究方向。更重要的是,这一关键差距在主流 LLM 驱动的因子挖掘框架中尚未得到充分解决,很少有研究建立从最新学术文献中自动提取潜在因子挖掘方向的机制。
尽管如此,LLM 驱动的智能体在因子挖掘中仍面临多重核心挑战:生成的因子表达式容易出现语义漂移和对历史数据的过拟合,同时多源信息整合能力不足。此外,当前大多数因子挖掘方向依赖于专家设计的范式,主观性强,导致挖掘出的因子冗余度高,限制了候选因子空间的多样性。而且,投资组合回测是一个短板,大多数研究侧重于单个因子的回测。现有方法试图通过自训练或多智能体协同框架解决部分问题,但难以同时平衡因子的多样性、鲁棒性和可解释性。
为了解决上述局限,本文提出的 AlphaSeek 是一个端到端的自动化量化信息挖掘智能体,其核心贡献如下:
- 自动化挖掘方向获取机制:能够自动检索并总结最新的量化金融学术论文,提取潜在的创新因子研究方向。
- 轨迹级因子挖掘框架:提出以轨迹作为优化单元,该轨迹包含了完整的因子研究生命周期。
- 端到端自动化闭环:构建了“方向探索 - 因子挖掘 - 投资组合回测”的自动化闭环,并实现了新因子与 SOTA 因子库之间的动态自交互优化。
相关工作
经典量化因子挖掘
经典的线性因子定价框架(如 CAPM、Fama-French 系列模型)奠定了现代因子投资的理论基础。然而,后续实证研究逐渐暴露了传统因子挖掘范式固有的瓶颈:大量已发表因子带来了严重的数据窥探和过拟合风险,且手动因子构建严重依赖专家经验,无法高效探索海量数据中的高维非线性特征空间。为突破这些限制,自动化因子搜索技术经历了长期发展,包括基于 GP、RL 和 DL 的方法。但这些传统方法都将单个因子表达式或策略权重作为优化核心单元,缺乏对因子研究全生命周期的完整记录和知识传承,未能建立对因子挖掘过程的全程约束机制,难以从根本上解决过拟合和泛化能力不足的问题,这正是本文所提出的轨迹级因子优化框架旨在解决的核心问题。
投资组合与回测优化
多因子投资组合构建和回测是将因子挖掘成果从理论研究转化为实际交易的核心环节。其核心目标是通过多因子融合增强组合的鲁棒性,同时控制交易成本和过拟合风险。经典的等权重组合方法为多因子组合构建提供了基本基准,后续研究发展出了风险平价、最大夏普比率、最小方差等优化方法。在回测优化方面,基于信息系数(IC)的因子相似度度量已成为主流方法,它能有效剔除因子库中高度相关的冗余因子,以降低组合的过拟合风险。然而,现有研究大多采用基于静态因子库的批量回测模式,缺乏增量式因子融合机制,未能实现新挖掘因子与现有 SOTA 因子库的动态协同优化,这是 AlphaSeek 要解决的关键问题。
基于智能体的 Alpha 挖掘
LLM 在量化金融中的应用已从早期的非结构化文本处理,迅速演变为代码和公式生成器,以及基于检索增强生成和提示工程的交易公式迭代演化方法。最新的研究前沿聚焦于将 LLM 的语义理解、代码生成和逻辑推理能力集成到智能体系统中,以实现动态市场环境下的自适应迭代。尽管取得了进展,现有的 LLM 驱动因子挖掘方法仍存在核心局限:在因子生成中面临较高的语义漂移风险,缺乏对挖掘管道的全流程风险约束,且难以同时平衡因子的多样性、鲁棒性和可解释性。
方法
问题设定
Alpha 挖掘:因子挖掘任务旨在从股票池和市场特征张量中学习有效的 Alpha 因子。一个 Alpha 因子可以表示为从特征到未来收益的映射。本文将 Alpha 因子挖掘形式化为以下优化问题:

其中,F 是所有可行因子表达式的空间,L(·) 衡量因子的预测有效性(由 IC 量化),R(·) 是正则化项,整合了复杂度惩罚、冗余惩罚和一致性惩罚,λ 是权重系数。
Alpha 挖掘轨迹:AlphaSeek 引入了市场投资假设来指导基于 LLM 的因子构建过程。每个完整的 Alpha 挖掘过程遵循从假设生成、因子构建到回测评估的端到端工作流,这被定义为一个挖掘轨迹 τ。轨迹的质量由其终端奖励衡量:

目标:AlphaSeek 的核心优化目标是求解最优的轨迹生成策略 π,以最大化生成挖掘轨迹的期望终端奖励:

AlphaSeek
AlphaSeek 的整体架构包含三个核心组件:方向生成、单因子轨迹策略挖掘和增量组合策略,实现了从原始数据到假设输入再到策略绩效输出的全自动化端到端闭环。

方向生成:专注于自动化获取新闻、学术研究等核心数据。对多源异构数据进行预处理和深度语义分析后,提取高相关性的信息,并输出一组因子挖掘方向集合。

轨迹挖掘:给定一个研究方向,通过“想法智能体”和“因子智能体”等工作流,完成从投资假设到符号化因子表达式、再到可执行代码的端到端构建。与传统方法不同,该模块创新性地提出了基于轨迹的因子挖掘范式,将优化单元从易变的“单因子”升级为覆盖因子研究全生命周期的“策略轨迹”,实现了因子研究知识的可追溯继承和全链路可解释性。策略轨迹的结构化定义通过伪代码在算法 1 中标准化。

约束控制:研究团队考虑了复杂度、冗余度和一致性作为约束控制,其表达式为:

其中,SL(f) 衡量因子符号长度,PC(f) 统计自由参数数量,log(1 + |F_f|) 约束因子对原始特征集的过度使用,三者共同控制因子复杂度。ER(f, h) 是综合适应度指数,用于评估因子的创新性及其与投资假设 h 的契合度,其定义为:

其中,S(f) 通过 AST 匹配衡量因子与现有因子库的最大结构相似度,以控制冗余。C(h, d, f) 计算因子假设文本、因子描述与因子表达式之间的语义一致性,以避免语义漂移,确保因子经济逻辑的可解释性。



自演化:设计了两个核心演化算子来替代传统 GP 的随机搜索模式:变异和交叉。变异通过自反思定位轨迹中的次优节点,进行局部正交重写,保留核心投资逻辑的同时探索独立的数据维度。交叉则融合来自不同并行方向的多条高收益轨迹的有效片段,生成新的策略轨迹,实现成功经验的协同放大。


自迭代投资组合:给定轨迹策略生成的因子集,本文设计了一个自动化的投资组合构建和回测迭代机制。该机制由综合策略表现驱动,在组合权重空间和模型配置空间中持续探索和优化,形成从策略构建到绩效反馈的全链路闭环。
该循环包括三个阶段:策略生成、执行与回测、绩效反馈与迭代。在第 n 轮迭代中,系统利用历史记录集自动生成新的策略构建假设 (w_n, Θ_n),其中 w_n 是组合权重向量,Θ_n 代表模型类别及其参数设置。回测阶段采用多维度绩效指标,包括年化收益率(ARR)、信息比率(IR)、最大回撤(MDD)和卡玛比率(CR)。系统通过对这四个指标进行加权得到综合得分 R_n,并为后续迭代提供优化信号。系统根据历史条件期望值动态选择更有可能提升综合绩效的搜索方向,实现组合权重和模型参数的自迭代优化。




实验
实验设置
实验使用沪深 300 指数的日频数据,涵盖 300 只大盘 A 股。数据集严格按照时间序列分为训练集(2016.1.1 - 2020.12.31)、验证集(2021.1.1 - 2021.12.31)和测试集(2022.1.1 - 2025.12.26),避免了前视偏差。回测基准为沪深 300 指数,并可扩展至沪深 500 等市场的零样本迁移实验。
主要结果
表 1 和图 1 报告了 AlphaSeek 与一系列机器学习模型、深度学习模型、因子库以及近期基于 LLM 的智能体因子挖掘方法在沪深 300 上的表现。总体而言,AlphaSeek 在所有对比方法中取得了最强的策略层面表现,实现了最高的年化收益率(ARR)8.28%,最优的信息比率(IR)1.29,最高的卡玛比率(CR)1.31,同时达到了最低的最大回撤(MDD)6.28%。这些结果表明,AlphaSeek 相较于传统的预测模型和最新的智能体基线,能产生更优的风险-回报权衡,表明其提出的端到端闭环能将挖掘出的因子转化为更稳健、更可部署的投资信号,而不仅仅是改善孤立的预测统计数据。

消融研究
演化挖掘组件的消融:如表 2 所示,完整模型取得了最佳结果,证实了将这些组件集成到一个统一的轨迹级演化管道中的有效性。移除“并行方向扩展”导致策略层面表现大幅下降,ARR 降低 5.80%,MDD 增加 4.77%,表明多样化规划主要提高了初始搜索方向的质量。移除“变异”导致预测质量下降最严重,IC 降低 3.25%,同时 ARR 降低 2.46%,MDD 增加 5.24%,表明变异对于有效的局部探索和轨迹精炼至关重要。相比之下,移除“交叉”导致预测指标下降相对较小,但可部署性表现明显恶化,ARR 降低 3.55%,MDD 增加 7.01%,表明交叉主要通过重组不同并行方向上的互补轨迹片段来增强鲁棒性。

一致性、复杂度和冗余度控制的消融:如图 4 所示,移除这三个控制中的任何一个都会导致性能明显下降,确认了它们是 AlphaSeek 的必要组成部分。移除“一致性控制”会降低整体结果,表明该约束对于保持生成因子在经济上的连贯性和可执行性很重要。移除“复杂度控制”也会削弱性能,但其影响在三者中最小,表明它主要通过阻止过于复杂的表达式来提高鲁棒性。相比之下,移除“冗余度控制”导致最严重的性能恶化,包括 IC 的最大降幅、ARR 降低 6.91% 以及 MDD 增加 12.10%,表明冗余过滤对于保持因子多样性和防止最终因子池中的无效集中尤为重要。

自迭代投资组合的消融:图 6 显示,AlphaSeek 在 IC、Rank IC、ARR 和逆 MDD 指标上始终优于没有自迭代的变体,总体雷达图面积更大。最大的增益出现在 ARR 上,表明自迭代对于将挖掘出的因子转化为有效的组合收益尤为重要。

更多分析
Alpha 挖掘效率分析:图 5 在年化超额收益(AER)与波动率空间中比较了不同方法,并通过标记大小编码 MDD,通过等绩效线编码 IR。AlphaSeek 位于图表的左上角前沿,表明它在超额收益和风险暴露之间实现了比竞争方法更优的平衡。特别是,与先前基于 LLM 的智能体相比,AlphaSeek 在更低波动率下获得了更高的年化超额收益,同时表现出明显更小的回撤,表明其优势并非来自承担更激进的冒险,而是来自于其机制提高了将预测信号转化为可部署策略回报的效率。

沪深 500 上的时间序列收益:图 2 展示了在沪深 500 上的时间序列收益,其中所有因子均在沪深 300 上挖掘,并直接迁移到沪深 500,未做任何针对该市场的重新优化。AlphaSeek 保持了最强的收益轨迹,并最终超越了所有竞争方法,表明其发现的因子在明确的市场范围转移下仍然有效,捕捉到了更具可迁移性的收益结构,而非数据集特定的模式。

总结
总体而言,本文提出了 AlphaSeek,一个端到端的 LLM 驱动的 Alpha 挖掘智能体,旨在解决主观方向设计、多源整合不足、语义漂移以及缺乏完整端到端因子发现管道等问题。具体来说,通过轨迹级因子演化框架,该智能体将优化单元从单个因子升级到完整的研究生命周期,实现了因子知识的代际传承和可解释性。通过自交互投资组合机制,构建了“挖掘-组合-回测”的全流程闭环。基于沪深 300 市场的实证结果表明,本文提出的方法在整体上优于主流基准方法,实现了年化收益率(ARR)8.28%,信息比率(IR)1.29%,最大回撤(MDD)6.28%,同时在因子预测指标上也具有竞争力,信息系数(IC)为 0.0454,并在沪深 500 的样本外数据集上取得了强大的时间序列收益表现。
如果你对这类量化研究工作感兴趣,欢迎到 云栈社区 一起交流。