找回密码
立即注册
搜索
发回帖 发新帖

6401

积分

1

好友

798

主题
发表于 17 小时前 | 查看: 5| 回复: 0

Two Sigma 战略数据科学主管 Claudia Perlich 结合量化投资与工业界场景,梳理了机器学习无法摆脱人类直觉的十个场景。

作者:Claudia Perlich(Two Sigma 战略数据科学主管)

大语言模型和智能体系统的爆发,让不少人产生了一种错觉,以为机器已经具备了类似人类的直觉推理能力。但现实往往冷酷得多。工业界与金融市场里的数据几乎从不遵守学术假设,无论是资产定价中极低的信息信噪比,还是基础设施故障背后隐藏的强相关依赖,单纯依赖模型优化指标往往会迅速掉入陷阱。

这篇文章主要讨论在量化投资与通用机器学习实践中,为什么算法能力的上限始终由设计者的专业直觉决定,以及如何识破那些看似完美却漏洞百出的数据幻觉。 从旧时代的手工特征工程到如今的大模型微调,工具在变,但数据生成过程中的系统性偏差从未消失。很多时候,模型跑出了极其出色的验证集表现,并不代表业务逻辑成立,反倒意味着数据采集机制混入了致命噪声。Two Sigma 战略数据科学主管将从界定真实有效样本量,到厘清因果推断与统计相关性的边界,再到为了团队协作信任而主动在算法复杂度上做妥协,详细介绍量化投资中的机器学习实践。

核心观点:

  • 表象数据量容易掩盖极小的真实样本量。
  • 换一个目标往往是破局捷径。
  • 模型天然贪婪且缺乏常识。
  • 表现过于完美的模型几乎都带着数据陷阱。
  • 模型能否上线取决于团队信任而非单纯指标。

看到上百万行数据,真实样本可能只有几十个

学术实验通常依赖数据独立同分布的基本假设。但在工程现场,这种假设极少成立。

拿房地产估值来说,哪怕手里掌握了纽约市区极其完备的成交历史,直接拿去评估几十公里外奥尔巴尼的房价,实际效果基本不可用。两地的经济结构、产业支撑和人口流向完全不同。即便换成奥尔巴尼本地过去十年的全部成交,情况也不会好转。十年周期内,宏观利率换了好几轮,地方税收和信贷环境屡次调整,早期的历史价格与当下的市场状态早就不在同一个生成分布里。

更为隐蔽的陷阱是样本颗粒度带来的统计错觉。

2017 至 2018 年冬季,纽约市房屋管理局记录了辖区内近八成公寓的供暖故障,数据涉及 140 多万套住房。每套住房都关联着住户档案、报修记录与用能数据,表面上看是一个样本极其充沛的时间序列预测场景。

然而深入现场就会发现,供暖故障并非以单套房间为单位发生。当地老旧小区往往由一百多台大型集中锅炉负责整片街区的供暖。某台锅炉故障,连带受影响的是周边几千户居民。算法面对的账面规模虽然达到 140 万条,但决定系统状态的真实样本其实只有那百来台锅炉。如果沿着租户维度构建复杂的深度网络,模型实际上是在强共线性的重复信息中做无效拟合。

这种大量可见个体掩盖极少数深层诱因的现象非常普遍。2024 年那场引发全球关注的 IT 故障也是同样的道理:一家安全厂商推送的错误补丁,瞬间瘫痪了数百万台终端。如果不做层级下钻,把几百万台机器当成独立样本扔进模型,得出的统计置信度完全是假象。

除样本量受限外,另一种常见瓶颈是数据本身缺乏有效变异度,或者目标本身带有极高的不可预测性。

2024 年关于马拉维玉米减产的实证研究就遇到了这个瓶颈。当地小农的地块切得极碎,相邻田亩的降雨和土壤环境几乎完全一样,遥感光谱扫过去缺乏足够的离散度,输入特征没有方差,算法自然算不出局部减产的差异。

这种低信噪比在量化投研中更为普遍。二级市场时间序列里纯粹的随机噪声占比极高,特征数量、样本规模与信号强度三者相互牵制。如果底层可预测成分微弱,盲目堆砌上百个因子只会加速过拟合。实际工程中要让模型收敛,要么拉长周期、引入跨品种数据来扩充有效样本,要么大刀阔斧削减特征维度,把输入限制在有坚实经济学逻辑的变量上。

至于把相关性当因果,则是实盘中亏损更隐蔽的来源。

预测财报盈余时,研究员无论建什么模型,都不会改变上市公司披露的实际利润,这属于纯粹的被动观测。但在交易执行环节,逻辑完全不同。一笔大单砸向盘口,挂单被吃掉的同时就会直接抬升瞬时成交价。评估哪种拆单策略成本最低,必须考虑交易动作对价格的直接冲击,这类因果问题需要依赖订单簿微观仿真或小规模实盘试错,直接拿静态历史行情做优化,上线后往往会被自身的冲击成本反噬。

换一个"错误"的问题,反而是破局的最优解

许多工业任务之所以棘手,是因为核心目标本身无法被直接观测。

评估欠发达地区的经济发展趋势,当地统计年报可能多年不更新,甚至缺乏基础统计机制。此时夜间灯光遥感数据就成为了兼具客观性与连续性的物理代理。互联网营销领域也有类似权衡:汽车厂商投放广告的根本目的是促进线下门店成交,但用户在实体店付款的链路在线上很难直接打通,真实转化率也极低。工程上通行的做法,是把预测标的调整为车型配置留资、试驾预约或深度浏览,借由高频的意向行为来代指最终转化。

在样本稀缺的情形下,迁移学习是另一种常见的工程解法。

Claudia 曾提到一个假想案例:如果需要为美联储主席构建面部情绪模型,公开渠道能获取的特定人物高清图像可能仅有数千张,从零训练大型视觉网络显然不可行。

不过,人类通过面部肌肉呈现情绪的解剖学机制具备普遍性。实践中可以先在 ImageNet 这类亿级人脸公开数据集上进行预训练,让网络掌握底层面部几何表征;随后筛选出年龄阶段、着装风格相近的男性样本开展领域微调;随后再利用那数千张经过精细标注的主席特定照片完成参数对齐。先在分布不完全吻合的大数据上沉淀底层特征,再迁移至目标小样本,是跨越数据冷启动的标准路径。

把目标函数从均值转向分位数

将业务诉求形式化为监督学习,通常比无监督聚类更具工程确定性。哥伦比亚大学数据学者 Chris Wiggins 曾借用物理学家泡利的表述指出,工业实践中不少无监督聚类"连错误都算不上"——缺少可供证伪的客观标签,业务方很难确证聚出来的类别是具备商业价值的客群细分,还是仅仅切分了数据空间的几何密度。

在明确了监督学习方向后,损失函数的选取依然依赖经验判断。

企业往往希望测算战略客户的潜在采购规模,即所谓的钱包份额。但在实际商务合作中,没有客户会向服务商开放自身内部的预算明细。直观来看,这似乎是一个缺乏标签的任务。

如果将预测目标调整为"在同类型行业客户中,该客户理论上能达到的最大采购分位数",问题就迎刃而解了。传统回归模型通常拟合条件期望均值,而业务真正关心的是条件分布的高分位边界。工程改造方式非常直接:在回归树的叶子节点中,将样本均值统计调整为高分位数;或者将常规的平方误差替换为分位数损失。目标定义做微小调整,原本缺乏标签的业务上限就转换为了具备确定解析解的凸优化问题。

算法的懒惰本能与伪信号陷阱

算法模型没有任何常识,它只会贪婪地最小化损失函数。

在移动广告的点击率预测中,早期模型经常挑出手电筒这类工具类软件作为高点击率场景。不管广告推的是理财产品还是快消品,只要放在手电筒应用里,点击率都会飙升。

背后的原因其实也不复杂:用户打开手电筒功能时多处于昏暗场景,在屏幕上摸索操作极易误触横幅广告。这种点击行为背后并不存在真实的交易诉求。如果完全信任模型输出,算法就会把绝大部分投放预算倾斜给工具类应用,账面点击成本看似非常划算,后端转化却近乎归零。模型极度贪恋捷径,它只会捕捉最容易预测的统计相关。

这种懒惰性也是算法偏差的主要来源。如果在机场零售场景下训练一个高净值客群识别模型,不加业务约束的话,得分最高的往往不是赶飞机的商务旅客,而是机长、乘务员和地勤员工。因为这群人出入机场的频次最高、最容易被规律捕获。

将这类系统直接照搬到信贷风控、员工招聘或司法量刑场景中,后果往往非常严重。虽然机器学习可以在形式上去除主观偏见,但算法会自发依赖那些最容易预测的代理变量,从而固化甚至放大既有偏差。在这类风险敞口前,不能把因果审视的责任甩给技术本身。

过于完美的测试集指标,往往是灾难的前兆

在量化与机器学习领域,面对异乎寻常的亮眼指标,第一反应必须是怀疑。

在二级市场预测资产收益极其困难,夏普比率即使有细微提升,经过杠杆放大都能带来可观回报。若回测系统跑出了过于完美的净值曲线,大概率是特征计算中混入了未来数据、样本筛选存在幸存者偏差,或是撮合回测低估了实际冲击成本。

广告技术团队也遇到过类似的警示场景:某阶段内,预测注册留资、白皮书下载以及官网访问的十余个模型,测试集精度在短时间内全线飙升。

深入溯源后发现,这并非模型挖掘出了新信号,实则是黑产刷量工具完成了版本迭代。以往的爬虫脚本只会机械点击链接,新一代黑产为了在程序化竞价中赚取更高提成,开始模拟真实用户的鼠标轨迹,完整执行注册填表和资料下载。机器人留下的行为日志比真人规整得多,数据方差极小,算法自然能轻而易举做出高精度预测。这类虚假的高性能,本质上是模型在给黑灰产做针对性拟合。

另一类容易被忽视的隐患是标签成熟周期的时间差。在消费信贷领域,利用 12 个月期贷款样本训练违约预测模型时,若机械地剔除尚未结清的在贷订单,模型会筛选出一个违约率异乎寻常的特征组合:所有在过去 11 个月内发放的贷款。

背后的逻辑非常直白:12 个月期的正常贷款在刚放款的前几个月处于还款期,状态是履约中,不会被标记为正常结清;若借款人恶意欠款,放款后两三个月就会暴露出违约特征。在临近当前时间点的观察窗口内,坏样本沉淀得极快,好样本却需要等待完整周期才能确认为安全资产。数据采集的时间窗口天然带来了样本选择偏误,正确的处理方式是直接剔除账龄未达标称周期的未成熟资产。

隐式偏差与最终上线的取舍

即使模型在保留测试集上表现优异,也不意味着它具备真实的跨场景泛化能力。

在医疗影像辅助诊断的实际项目中,工程师尝试基于四家医疗机构的乳腺钼靶灰度图像建立病变预测模型。验证集上的评估曲线非常优秀,但在排查特征重要性时,团队意外发现了一个异常现象:作为随机编码的患者编号,竟然对诊断结果具有极高的预测权重。

结合四家机构的业务职能调查,谜底很快揭晓:患者编号的分段完全由医院编码决定,而这四家机构既有主打常规体检的筛查中心,也有专门接收重症转诊的肿瘤专科医院。筛查中心的恶性样本发生率极低,专科医院则往往高达 35% 以上。

硬件层面的干扰进一步加剧了问题:不同医疗机构所采购的拍摄仪器,在传感器校准与灰度渲染机制上存在细微硬件差异。卷积神经网络捕捉到了这种系统性的背景灰度偏移,并将特定底色直接与该医院的高发病率绑定在一起。模型并未真正学到肿瘤病灶的微观形态,它只是凭借图像底色判断胶片出自哪台仪器。若将这套系统迁移至未参与训练的第五家医疗机构,诊断结果势必大面积失真。

在攻克虚假特征之外,模型能否最终推向生产环境,技术评测往往只占一半,更关键的阻力来自组织内部的信任机制。

在某些业务场景中,明知某个模型更粗糙,推动它上线反而是正确的选择。在实际业务推行中,有一个 KNN 算法在多项定量指标上表现全面垫底。但业务线团队对它接受度极高,因为业务人员可以亲自调出作为近邻的几个具体样本,看明白系统到底参考了哪些历史案例。相比之下,数学表现明显更优的线性分位数回归模型,在货架上整整搁置了两年,直到一线团队对算法系统建立起充足的信任之后才被正式采纳。

坚持只看基准分数的人,忽略了落地过程中的摩擦成本。一个没人敢用的完美模型无法产生任何现实收益;先让团队用上透明度高的方案,逐步建立对算法系统的信任,往往是更务实的工程路径。

面对当前大语言模型与多智能体系统的普及,这种工程审慎更具现实意义。生成式模型最显著的特点在于,不论内部推演是否合乎事实,输出文本通常都保持着高度流畅且笃定的语调。传统判别模型在遇到未见过的数据时,往往会给出离群概率或极端数值作为警示,而生成式系统的幻觉往往深藏在逻辑完备的表达之中。

工业级机器学习的成熟,从不体现于对前沿名词与复杂架构的无度追逐。清楚数据在何时会失效、懂得在何时为系统透明度保留克制——这类立足工程一线的经验与判断,也是云栈社区的开发者们经常讨论的核心命题:算法系统的护城河,从来不在模型本身。




上一篇:o1奠基人Noam Brown:万名Agent解出千禧难题,多智能体贡献不足10%
下一篇:YOLO11+ResNet50双模型实战:AI垃圾分类识别系统从零搭建
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-5 23:30 , Processed in 0.067661 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表