大多数协方差矩阵的构建完全依赖于历史收益率,因此对于上市时间短、历史数据有限的股票,建模往往非常棘手。
Alexandre Alouadi 与 Charles-Albert Lehalle 在 2026 年 7 月的论文《The Fundamental Structure of Risk: From Characteristics to Covariance》中提出了一种全新的思路:仅使用基本面信息来构建风险结构。模型的输入仅包括规模、价值、杠杆率、行业等指标,这些数据几乎逐日保持不变,且与收益率的平均相关性绝对值低至 0.009。
可以把它视为 Barra 特征因子思想的进阶版,而最大的不同在于:特征到协方差的映射是通过非线性方式 端到端学习 获得的,目标直指未来的风险。
这个模型被命名为 CD-DFM(Characteristic-Driven Dynamic Factor Model,特征驱动动态因子模型)。
技术骨架(极简版)
- 特征编码器:对连续特征施加仿射变换得到 token,分类特征则通过 embedding 表示,再经浅层 MLP 输出潜在表示

- 两个线性头:一个输出软隶属度 $Z_t$(落在单纯形上),另一个输出有符号载荷 $\beta_t$
- 因子构造:第一个因子强制为等权市场因子,其余因子均设计为现金中性的多空组合
- 协方差结构:采用低秩 + 对角的形式

- 端到端训练:损失函数由 Stein 前向协方差损失和收益重构损失组成
整个流程中,收益率只在构造因子及损失计算时才被使用,绝不进入编码器,这正是“零历史价格数据”的核心逻辑。
关键发现
- ✅ 在所有基准模型组合中,CD-DFM 的协方差校准效果最优,明显优于基于收益率的收缩估计和主成分分析(PCA)方法。
- ✅ 提取出的因子与真实经济主题高度契合,行业板块能够“自然涌现”,无需人工标注行业分类。
- ✅ 对新上市股票可以实现 ”零样本”(zero-shot)接入:不需要任何历史行情,也无需重新训练,即可直接纳入风险模型。
一个值得深思的启示是:过去我们费尽心力从收益率中“恢复”出的风险结构,其实早已隐藏在资产负债表里 💡。
相关资源已开源:GitHub 代码仓库
论文链接:https://arxiv.org/abs/2607.24410
想了解更多量化金融与机器学习交叉的前沿研究?欢迎来 云栈社区 与众多开发者一同探讨、碰撞灵感。
|