过去几年,时间序列预测领域涌现出 PatchTST、TimesNet、iTransformer 等一系列基于注意力机制与通道独立的深度学习架构。它们在电力负荷、气象演变、交通流量等通用基准上不断刷新纪录,可一旦被量化研究员搬到股票收益预测场景,表现往往迅速滑坡。
多数分析习惯把这种衰退归咎于金融数据极低的信噪比或因子构造能力的欠缺。然而,上海黑翼资产与中国科学技术大学的研究团队在论文《RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting》中直指要害:深度时序模型在金融场景中的核心瓶颈,往往来自一个很少被质疑的基础设定——对固定历史回看窗口的刚性依赖。
研究证实,驱动资产价格变动的有效信息尺度本身是非平稳的,且在不同个股之间差异极大。采用单一固定的历史窗口必然陷入两难:窗口过短,缺乏足够的信息跨度来识别宏观结构变迁;窗口过长,又会把过往失效市场状态下的陈旧数据当作加性噪声引入当前决策。
针对这一问题,团队提出了名为 RAVEN 的自适应变长上下文混合专家网络。该模型放弃了人为硬性设定的窗口长度,在逆时序方向对量价切片的重要性进行动态打分,通过累积阈值机制自发为不同市场状态和不同资产切分出长短各异的嵌套前缀,交由不同时间尺度的专属专家编码。配合显式的表示解耦与全局宏观分支,RAVEN 在沪深300与标普500长达五年的样本外滚动检验中,相较各类前沿基准取得了显著的预测相关性与稳定性提升。根据论文披露,该系统在黑翼资产的量化实盘测试中实现了超越生产基线十个百分点以上的累计收益,目前正推进最终的在线集成。
核心观点
-
有效信息的时间尺度本身是不平稳的。 交通流或气象数据具有稳定的日夜周期,但股票对数收益率的能量频带随市场风格剧烈迁徙;暴跌时需要极短窗口保命,慢牛时需要长周期过滤噪音,固定窗口必然产生系统性错配。
-
时间前缀的嵌套拓扑保全了位置注意力的连贯性。 与常见的内容稀疏路由不同,RAVEN 按照逆时序累加重要性切分前缀;每个专家拿到的是连续且以最新时点为锚的历史片段,不会把时序语义切碎。
-
消除专家间的共线性比堆叠模型参数更关键。 长窗口严格包含短窗口的全部数据,若不做干预,多尺度专家极易学出高度趋同的特征;通过余弦相似度惩罚与负熵正则强行解耦表示,混合专家系统才不会退化为单尺度浅层网络。
-
单资产自适应无法替代全市场系统性风控。 模型的动态感知完全依托单票自身的历史量价,无法直接察觉期指基差大幅贴水或微盘股流动性踩踏;当全市场遭遇无差别杀跌时,单标的自适应仍需要组合层面的外部硬约束来保底。
固定窗口为什么在金融截面上必然碰壁
在物理世界里,时序系统大多受制于稳定的客观规律。道路交通流受早晚通勤驱动,能量在小波变换图谱上牢牢锁定在二十四小时周期带上,数年间几乎没有任何漂移。
股票的对数收益率则是另一番景象。论文以沪深300成分股中国巨石的五年日收益率做小波分解,其主导能量所在的尺度带始终处于漂移之中。2020年遭遇外部冲击与极端波动时,决定价格变化的核心能量完全挤在几天内的超短周期里。到了2021至2022年行业景气退潮的阴跌阶段,短线信号基本沦为无序杂音,数月维度的趋势能量才开始显现。而到了2023年底存量资金反复倒仓,高频波动又重新占了上风。
这种动态漂移直接推翻了一个隐含假设——存在一个通用的最优回看长度。
当行情遭遇集中踩踏或流动性紧缩时,真正决定次日走势的无非是近几个交易日的被动平仓盘与异常成交量。此时如果强行向模型塞入半年前横盘期的量价形态,失效的陈旧特征只会钝化风控响应,导致模型在破位断崖前反应迟钝。相反,在行业基本面主导的趋势行情中,三五天的切片又极易被主力试盘或短期获利了结的杂波误导。经典计量经济学中的异质自回归模型虽然尝试用日、周、月均线拼合多尺度特征,但预先设死的固定参数既无法自适应波动率聚类,也无法兼顾不同市值个股在记忆深度上的天然差异。
调和这种矛盾的办法,不是去人工猜测某一个折中窗口,而是把窗口长度作为由市场动态自行决定的变量。
逆序累积与嵌套前缀:让数据自己决定看多远
RAVEN 的设计重心,是将切片重要性打分与时间视界的决定权交还给数据分布。

在数据预处理阶段,模型遵循通道独立与实例归一化原则,将量价序列切分为若干互不重叠的切片。关键的改动在排序方式上:模型打破了常规的顺时序组织,直接把最靠近预测时点的即期切片放在序列第一位,更早的历史切片依次向后排布。这样做的好处很直接——后续所有关于注意力与时间跨度的操作,都死死锚定在最新发生的价格行为之上。
每个切片输入给轻量级多层感知机,映射为一个相对重要性权重。随后,系统启动累积重要性阈值机制,从最新切片开始向历史深处逐步累加权重,形成一条单调上升的累积曲线。
研究团队在这条曲线上设立了递增的截断门槛,默认设置为 0.3、0.6 与 0.9。当累积权重突破第一个阈值时截获的切片集合构成最短前缀,交由短周期专家处理;突破第二个阈值时截取的较长切片集合交由中周期专家;达到第三个阈值时产生最长切片集合,交由长周期专家。
这种设计形成了严密的前缀嵌套关系:短窗口是中窗口的子集,中窗口又是长窗口的子集。不仅如此,每个样本所分得的切片数量是完全动态变长的。遇到盘面剧烈震荡、最新信息密度极高的交易日,仅凭最新的一两个切片就能迅速积满阈值,促使专家组自动收缩回看视野;而在走势平稳、前期趋势具备参考价值的阶段,累积曲线增长平缓,促使长周期专家调用数十天的深层历史。
与自然语言处理中常见的根据词元内容特征进行稀疏分派的专家系统不同,RAVEN 的专家分工建立在连续的时间尺度之上。短周期专家专注于局部博弈,长周期专家专注于宏观格局,这避免了传统模型将破碎的时间切片随意拼凑所带来的时序上下文割裂。
嵌套重叠下的共线性危机与解耦设计
嵌套前缀机制保全了时序演进的连贯性,但在工程实现上也带来了副作用:输入重叠与表示共线性。
长周期专家观察到的输入严格包含短周期专家的全部切片。如果不加干预,两个编码器极易学出高度趋同的特征表示。如果在输出聚合阶段采用常规的平均加权或简单的 Softmax 门控,这种信息冗余不仅无法带来收益,反而在金融数据极低信噪比的环境下成倍放大噪声,让整个系统退化为单尺度模型。
这在实际中行不通。为了消除这种共线性传播,RAVEN 在特征融合阶段引入了相关性感知加权策略。各尺度的编码器将变长隐层向量经过无参数时序平均池化后,系统计算专家向量之间的成对余弦相似度矩阵。对于某个专家而言,只要它与其他专家在方向上高度相似,其正冗余惩罚分就会迅速上升。最终的专家权重由原始置信度除以该惩罚的指数项生成,在推断阶段主动压低雷同输出的表决权。
单凭推断时的加权惩罚并不能确保训练过程稳定收敛。论文在损失函数中显式加入了两个针对性的辅助正则项。
输入端要防范路由坍塌。由于归一化函数容易放大初始差异,权重极易瞬间全堆在第一个切片上,导致累积曲线在开端就触发全部阈值,使三个专家拿到完全相同的极短序列。模型为此引入了路由负熵惩罚,迫使切片重要性分布保持相对平滑,促使三个专家真正形成短、中、长尺度的分工。
输出端要防范表征退化。论文在损失函数中加入了专家多样性正则项,直接惩罚专家余弦相似度矩阵的非对角线元素,驱使不同专家的输出向量在几何空间上走向正交。消融实验表明,剥离相关性加权后预测相关性下降 8.2%,剥离自适应路由后下降接近 10%,两项辅助损失各自贡献了约 4.5% 的稳定性支撑。
除了局部的多尺度专家分支,RAVEN 还在旁边保留了一条全局压缩表征分支。该分支对完整的最大回看窗口执行全局自注意力计算,提取统一的宏观特征向量,并在最终预测层与局部专家输出拼接。这一分支充当了大局底座,确保即使局部专家在某些行情转折点发生剧烈分歧,最终决策仍有全局视野兜底。
模拟回测与黑翼实盘
模型的预测能力最终要放进真实的交易滑点中去检验。研究团队在跨越十五年的 FinMultiTime 数据集上进行了滚动回测,涵盖沪深300指数的 892 只历史成分股与标普500指数的 4694 只成分股,并在支付宝基金交易数据集上测试了申赎预测。
在2020年至2024年的五年滚动样本外测试中,预测目标为未来十日的累计对数收益率。在沪深300中,RAVEN 取得了 0.0390 的 IC 与 0.3932 的 ICIR,表现超出第二名 MLF 9% 以上。在标普500中,其 IC 高出最强基准 20.2%。IC 与 ICIR 的同步改善,表明模型输出的分数在截面排序上具备更高的时序平稳度——这正是股票多空与指数增强策略赖以生存的根基。

在利用 Qlib 构建的回测中,策略每十个交易日根据模型预测得分对全市场进行降序排列,构建持有三十只股票的组合,并辅以三十档位以内的调仓缓冲机制以压低换手率。回测计入了印花税与双边佣金等交易摩擦。五年运行期内,RAVEN 驱动的策略超额收益表现稳定,相对最强基准 MLF 跑出了 12.79% 的累计超额,相比 PatchTST 的超额优势更是扩大到了 38.45%。

黑翼资产在论文中公开了其内部交易系统的细节。这套模型并没有直接用于策略交易,而是嵌入到了标准的量化工程流水线中:盘后流式数据库完成当日增量入库,模型输出次日个股预期收益,随后交由凸优化器在行业中性、个股集中度和换手率惩罚的刚性约束下解出目标持仓,并通过交易台的合规检查后直连券商柜台。根据黑翼团队披露,这一套结合了真实风控的策略,在内部生产基准上实现了超过 10% 的实际超额。
RAVEN 的实践路径给出了一个相当清醒的答案:自适应时序建模的价值,不在于替代风控,而在于让模型在正确的尺度上观察市场。当窗口由数据自己决定时,多尺度专家才能真正各司其职,而不是在同一段历史里各说各话。