量化交易要解决的核心问题,是如何把金融市场中的价格、收益、风险、状态、信息与决策过程,转化为可以计算、检验、优化并持续更新的数学结构。从人工构造因子到机器学习预测,从 Probit 模型对二元结果的概率建模,到 CTA 策略对趋势与动量的系统化提取;从 Hull-White 等短利率模型对收益率曲线动态的描述,到双层规划对复杂策略参数与内层优化问题的联合求解——如何把一个具有不确定性、状态变化和反馈效应的金融系统,转化为可验证的决策规则,这才是量化研究真正要回答的问题。

进一步看,量化交易研究还有一个非常关键的困难:预测本身并不是最后目标。机器学习通常希望最小化预测误差,而交易系统真正关心的是风险调整后的经济收益。一个模型即使在统计预测指标上表现优秀,也可能因为交易成本、换手率、尾部风险、容量约束或市场状态变化而无法形成可执行策略。因此,理解量化交易,需要同时研究统计学习、金融经济学、时间序列、随机过程、优化理论以及组合构建,而不能把它简单理解为“寻找一个高胜率指标”。
1. 从人工因子到机器学习:为什么量化策略仍然重视特征工程
量化投资行业采用“人工挖掘因子—检验因子—组合因子—形成策略”的研究方式,并不是因为传统方法缺少机器学习能力,而是因为金融预测问题具有非常特殊的结构。价格数据具有明显的时间依赖、非平稳性、噪声干扰和规范变化,同时交易决策受到成本、流动性、仓位和风险预算的直接约束。因此,研究人员通常不会直接让模型从原始价格序列学习最后交易决策,而是先构造收益率、波动率、成交量、估值、动量、反转、期限结构、相关性等具有明确统计含义的变量。
这种方法可以理解为一种结构化降维。假设原始市场信息为 $X$ ,人工因子变换为:
$$Z = \phi(X)$$
随后模型根据 $Z$ 估计未来收益或者其他目标:
$$\hat{y} = f(Z)$$
这里的关键并不是“人工因子一定比神经网络优秀”,而是 $\phi(X)$ 已经加入了研究者对于金融市场机制的先验判断。这样做可以降低模型直接面对高维原始数据时的自由度,也更容易进行经济解释、样本外检验以及风险归因。
这也解释了为什么“端到端学习”在金融领域没有简单替换因子研究。端到端方法试图直接学习:
$$y = f(X)$$
但真正交易的目标更接近:
$$R = g(X, \text{决策})$$
其中每一个环节都可能改变最后结果。因此,量化研究中的特征工程,本质上是在把统计学习问题转化为具有金融约束的决策问题。(量化投资行业为什么普遍采用人工挖因子再组合因子这一特征工程方式,而不直接用端到端学习构建策略?金融交易目标与机器学习预测目标差异)
更值得研究的是,金融交易目标与机器学习预测目标并不完全一致。如果机器学习模型优化均方误差:
$$\mathcal{L}_{MSE} = \frac{1}{n}\sum_{i=1}^{n}(y_i - \hat{y}_i)^2$$
那么交易策略可能真正需要优化的是风险调整后收益:
$$\max \frac{\mathbb{E}[R] - r_f}{\sigma_R}$$
或者进一步考虑交易成本:
$$\max \mathbb{E}[R - c \cdot \text{turnover}]$$
因此,一个预测模型的“准确”,并不自动意味着一个交易策略的“有效”。这正是量化研究区别于一般监督学习的重要地方。
2. Probit 模型:从二元结果理解概率预测
金融研究中经常需要预测的并不是连续收益,而是某种事件是否发生,例如未来收益是否为正、信用事件是否发生、资产是否进入某种状态。此时直接使用普通线性回归并不理想,因为线性模型的预测结果可能落在 $[0,1]$ 之外。
Probit 模型的基本形式是:
$$P(y=1 \mid X) = \Phi(X^T\beta)$$
其中 $\Phi(\cdot)$ 是标准正态分布函数。这里最重要的问题是:Probit 参数究竟作用在哪里?
它并不是直接作用于概率,而是首先作用于可能指数:
$$z = X^T\beta$$
然后通过正态分布函数转换为概率:
$$P(y=1 \mid X) = \Phi(z) = \int_{-\infty}^{z}\frac{1}{\sqrt{2\pi}}e^{-t^2/2}dt$$
因此,$\beta_j$ 的直接含义是解释变量 $x_j$ 对可能指数 $z$ 的影响,而不是简单地说“$x_j$ 增加一个单位,概率增加 $\beta_j$”。概率变化取决于当前状态 $X$。
这也是平均边际效应受到广泛使用的原因。对连续变量而言:
$$\frac{\partial P(y=1 \mid X)}{\partial x_j} = \phi(X^T\beta)\beta_j$$
不同样本的 $X$ 不同,因此边际效应具有状态依赖性。研究者通常进一步计算平均边际效应,以获得更容易解释的总体效应。(怎么理解probit模型?二元结果为什么不能直接按照普通连续变量处理?Probit模型的参数究竟作用于哪里?平均边际效应为什么很常用?)
这一问题与量化交易中的概率预测高度相关。交易系统并不一定需要预测“未来收益是多少”,有时只需要判断未来收益为正的概率是否超过某个阈值。如果模型输出概率 $\hat{p}$ ,则仓位可以设计为:
$$w = k \cdot (\hat{p} - p_0)$$
这样,预测模块与风险模块可以进一步分离。
3. CTA、动量与多策略组合:趋势究竟来自哪里
CTA 是量化交易中最具代表性的系统化策略之一。时间序列动量、横截面动量、趋势跟踪、突破、均线、波动率调整、期限结构、carry 等方法都可以进入 CTA 研究框架。
例如时间序列动量关注单一资产自身历史收益方向:
$$\text{Mom}_t^{TS} = \text{sign}\left(\sum_{i=1}^{h} r_{t-i}\right)$$
横截面动量则比较多个资产之间的相对强弱。两者看似都属于动量,却可能具有不同的信息来源、风险结构和收益周期。(实测有效的量化交易算法有哪些?量化交易中“实测有效”的策略需要满足哪些统计条件?为什么横截面动量和时间序列动量具有不同收益来源?)
因此,CTA 研究的重点并不是寻找一个最优指标,而是研究多个策略之间的收益相关性。如果两个策略的收益相关系数较低,那么即使单个策略的 Sharpe Ratio 并不突出,也可能在组合层面产生明显价值。
设两个策略收益分别为 $r_1$、$r_2$ ,组合权重为 $w$ ,则组合方差为:
$$\sigma_p^2 = w^T\Sigma w$$
其中 $\Sigma$ 是策略收益协方差矩阵。由此可见,组合收益质量不仅取决于单策略预期收益,还取决于策略之间的相关结构。(目前主流的量化CTA策略有哪些?真的就是简单的技术指标衍生出来的策略吗?不同策略收益相关性?组合后是否可形成更加稳定风险收益结构?)
一个策略的有效性到底来自稳定的信息关系,还是来自它恰好适用于某一类市场状态?如果趋势策略在趋势市场表现优秀,那么在震荡市场中降低仓位是否比继续优化趋势指标更加重要?这意味着量化策略研究正在从“寻找规则”逐渐转向“识别状态—选择规则—控制风险”的动态决策框架。(目前量化交易领域有哪些前沿的策略或技术值得关注?一个策略的有效性究竟来自某个稳定的信息关系,还是来自它恰好处于适用的市场状态?)
4. 从价格到收益率:时间序列为什么是量化研究的核心
金融市场数据具有时间序列结构。价格 $P_t$ 往往具有较强的非平稳特征,而收益率通常定义为:
$$r_t = \ln\frac{P_t}{P_{t-1}}$$
或者:
$$r_t = \frac{P_t - P_{t-1}}{P_{t-1}}$$
为什么量化研究经常关注收益率而不是价格?原因在于收益率更接近可比较的变化量,也更适合统计建模。价格序列可能受到趋势、尺度差异和单位变化影响,而收益率可以直接用于波动率估计、相关性分析和组合风险计算。
更加重要的是,收益预测和风险预测具有不同难度。市场收益往往受到大量不可观测因素影响,而波动率具有一定的条件异方差结构。例如 GARCH 模型可以写为:
$$\sigma_t^2 = \omega + \alpha \epsilon_{t-1}^2 + \beta \sigma_{t-1}^2$$
因此,在很多实际交易系统中,风险预测可能比方向预测更加稳定。一个方向预测能力有限的模型,如果能够准确估计未来波动率,也可以用于仓位调整和风险预算。
这就形成了现代量化交易中的一个重要思想:模型不一定需要非常准确地预测未来收益,只要能够改善风险—收益配置,也可能产生实际价值。(Time Series 在 quant trading 中重要吗?为什么量化研究更加关注收益率而不是价格?为什么量化交易中风险预测往往比收益预测更加重要?)
5. 正期望交易系统:到底需要多少个因子
“最少需要几个因子才能获得正期望?”这个问题表面上是在问因子数量,实际上是在问信息增益与交易成本之间的关系。
人工挖掘因子—检验因子—组合因子—形成策略的研究方式中,假设交易系统由 $k$ 个因子构成:
$$F = (f_1, f_2, \ldots, f_k)$$
最后收益可以表示为:
$$R = \sum_{i=1}^{k} w_i f_i + \epsilon$$
只要整体期望值为正,因子数量并没有理论上的固定下限。一个因子可能产生正期望,十个因子也可能因为高度相关、过拟合和交易成本而形成负期望。
真正需要研究的是边际信息作用。假设加入第 $k+1$ 个因子后,样本外 Sharpe Ratio 从 $SR_k$ 提升至 $SR_{k+1}$ ,那么应该考察:
$$\Delta SR = SR_{k+1} - SR_k$$
而不是简单统计因子个数。若新增因子与已有因子高度相关,那么复杂度增加未必带来有效信息。
这些因子是否提供不同的信息来源?是否在不同市场状态下具有互补性?是否能够经过交易成本和风险约束之后继续保留统计优势?(最少可以用几个因子,就能构建出一个正期望的交易系统?若把交易系统拆解成若干可计算因子,那么需要多少个因子,才能使系统具有正期望?)
6. 双层规划:为什么策略优化不是一次普通优化
复杂量化系统中经常出现这样的结构:外层决定策略参数,内层负责根据这些参数求解组合优化、风险预算或者机器学习模型训练。这就是双层规划。
其一般形式可以写成:
$$\min_{x} \; F(x, y^*(x))$$
其中:
$$y^*(x) = \arg\min_{y} \; f(x, y)$$
外层变量 $x$ 的变化会改变内层最优解 $y^*(x)$ ,因此外层梯度不能简单理解为对 $x$ 的直接求导。
如果内层满足适当的最优性条件,则可以通过隐函数关系分析:
$$\frac{\partial y^*}{\partial x} = -\left(\frac{\partial^2 f}{\partial y^2}\right)^{-1}\frac{\partial^2 f}{\partial y \partial x}$$
最后外层梯度还需要考虑 $y^*$ 随 $x$ 的变化。因此,双层规划并不是“普通约束优化加几个变量”,而是一个嵌套决策问题。(双层规划求解的思想是什么?双层规划为何不是普通约束优化加几个变量?上层梯度为何比普通梯度复杂?外层搜索、内层求解优化过程的关系?)
这种结构对于量化策略研究尤其重要。例如外层可以优化因子选择、交易阈值和风险参数,内层负责求解组合权重。这样形成的模型实际上已经从“预测模型”进入“决策优化模型”。
7. Hull-White 与随机利率:市场状态如何进入利率模型
利率建模进一步说明了金融数学与统计学习之间的联系。给定收益率曲线之后,如何构造一个既符合当前市场曲线,又可以随机演化的短利率模型,是固定收益研究中的经典问题。
Hull-White 模型通常写为:
$$dr_t = (\theta(t) - \alpha r_t)dt + \sigma dW_t$$
其中 $\alpha$ 描述均值回复速度,$\sigma$ 描述短利率随机波动强度,而 $\theta(t)$ 用于调整模型,使其能够与当前收益率曲线保持一致。
这里需要特别区分 $\theta(t)$ 与均值的概念。若参数固定,均值回复结构可以比较直观地分析;但在实际 Hull-White 构造中,$\theta(t)$ 通常是时间函数,其作用更多是校准当前期限结构,而不能简单理解为某个固定均值。(建立Hull-White利率树形时α0,α1,...的不同是否体现的是长期均值θ的变动?Hull-White 模型中的θ、α与短利率究竟是什么关系?)
金融市场模型并不是只需要描述随机性,还需要同时满足当前市场状态。因此,“给定收益率曲线建立随机利率模型”实际上是一个校准问题、动态模型问题和风险中性定价问题的综合。
8. 左侧交易、右侧交易与市场信息的条件性
交易者经常使用左侧交易与右侧交易描述不同的决策方式。左侧交易倾向于在价格尚未完成趋势确认之前根据估值、超跌、均值回复等信息提前布局;右侧交易则更关注趋势已经出现之后的确认信号。
当前价格究竟已经反映了多少信息?
如果市场价格近似满足有效信息条件,那么简单根据历史价格寻找稳定预测关系会受到较强约束。但现实市场并非单一状态,市场参与者结构、流动性、宏观环境和风险偏好都可能改变,因此价格上涨并不自动意味着趋势已经形成,也不能仅凭一次上涨判断市场状态。(什么是左侧交易和右侧交易?当前价格是否已经反映了市场信息?如何区分价格调整和趋势方向变化?价格上涨意味着趋势已形成还是短暂反弹?)
因此,左侧与右侧并不是两个绝对类别,而是对不同信息确认程度的描述。量化系统真正需要做的是把“趋势确认程度”转换为可计算变量,并根据不确定性调整仓位。
9. 马尔科夫链与量化状态模型:从概率转移到稳态
量化交易中的市场状态模型经常使用马尔科夫链。设状态转移矩阵为 $P$ ,若满足适当的不可约性和非周期性条件,则有限状态马尔科夫链具有唯一稳态分布 $\pi$ ,满足:
$$\pi = \pi P$$
以及:
$$\sum_{i} \pi_i = 1$$
但这里不能简单地说“所有马尔科夫链都会达到稳态”。周期性、可约性等结构都可能使概率收敛性质发生变化。(如何证明马尔科夫链一定会达到稳态?为何不是所有马尔科夫链都会达到稳态?非负矩阵为何具有特殊最大特征值?非周期性如何保证概率收敛?)
非负矩阵理论与 Perron-Frobenius 理论则进一步提供了特征值和状态分析工具。对于量化交易而言,这意味着市场状态转换不仅可以凭经验划分,也可以通过转移概率矩阵、特征值、稳态分布等数学对象进行研究。