夜雨聆风学习资料网

ARTICLE · 1104496

智选精研|《资产管理中的人工智能:工具,应用及前沿》「从业者简报」 - 集成学习

智选精研|《资产管理中的人工智能:工具,应用及前沿》「从业者简报」 - 集成学习

「智选精研」项目本篇精选文章为《资产管理中的AI:工具,应用及前沿》第四章《集成学习》的「从业者简报」。

之后我们将陆续翻译该书其他章节的「从业者简报」,欢迎关注。

Practitioner Briefs - Ensemble Learning in Investment: An Overview

翻译:李祎晗,CFA,西交利物浦大学助理教授

审校:许铭,CFA,CFA上海协会理事

作者:Mark Fortune

Practitioner Briefs 

原文链接:https://rpc.cfainstitute.org/sites/default/files/docs/support/rf_aiinassetmanagement_practitioner-briefs_04_ensemblelearning_online.pdf (点击文末“阅读原文”可查看)

AI in Asset Management Chapter 4: Ensemble Learning in Investment: An Overview 

原文链接:https://rpc.cfainstitute.org/research/foundation/2025/chapter-4-ensemble-learning-investment

集成学习

如今金融数据的规模正在以前所未有的速度激增,而且更加无序与杂乱。与此同时,随着人工智能技术的发展,我们对可解释性和计算成本也提出了更高的要求。在此背景下,集成学习技术无疑成为了非常实用的选择。因为,相较于深度学习这类复杂方法,集成学习在透明度和可审计性上仍有明显优势。更关键的是,集成学习不用训练一个规模庞大、成本高昂又结构复杂的单一模型;它只需组合多个相对简单、成本更低的模型,就能取得接近甚至赶超复杂模型的性能。

本章来自《AI in Asset Management: Tools, Applications, and Frontiers》一书,展示了在高维且充满噪声的市场环境中,装袋(bagging)、提升(boosting)和堆叠(stacking)这三种集成学习方法为何能持续跑赢单一模型。本章不仅梳理了它们的核心原理、对比了各个方法的优缺点,还给出了它们在金融市场中的实际应用,包括但不限于收益预测、因子分析、波动预测和期权定价等等。

本章面向的读者

无论你是首席投资官(CIO)、投资组合经理还是数据与科技、风控负责人,相信都能从本章介绍的集成学习方法中获得一些启发。本章中,你将了解集成学习在提升预测准确度、控制因子复杂性方面的重要作用,并学习如何借助它交付有足够可解释性、经得起监管审视的结果。

本章的现实意义

随着市场中的信息噪声越来越多、数据量变得越来越庞大,各机构也倾向于使用更加复杂的模型去捕捉信息并预测市场(如深度学习)。但是随着模型复杂度的提升,金融监管对于模型透明度、可解释性和可审计性也提出了更高的要求。而集成学习方法可以说处在模型性能与可解释性的“甜点位”:它既具备较强的非线性建模与特征交互能力,又拥有相对成熟的解释工具和较低的部署成本,因此在诸多需要兼顾预测能力与模型治理的金融场景中,仍具有很强的实用价值。

本章将要介绍的内容

本章将系统梳理集成学习在金融中的实际应用价值,重点介绍Bagging、Boosting与Stacking三类核心方法,包括其算法原理到落地应用。本章还将探讨不同集成方法在预测能力、模型稳定性、计算效率与可解释性之间的差异,并结合实证研究与案例,展示集成学习在收益预测、因子分析、波动率预测、期权定价以及风险管理等场景中的具体应用。

最后,希望本章能为投资与资产管理从业者提供一套清晰且具有实践意义的分析框架,帮助其在保证模型性能的前提下,实现成本可控、可解释与可审计。

为什么集成学习在金融监督学习模型中如此重要

在监督学习中,模型的任务是学习从输入变量到输出变量的映射——输入变量通常称为“特征”或“预测变量”,输出变量则称为“标签”或“响应变量”。集成学习则是在这一基础上更进一步:它把多个模型组合起来,让不同模型取长补短、误差相互抵消,从而全面提升预测的准确性、稳定性。更难得的是,集成模型虽由多个子模型组成,却能借助特征重要性、SHAP 值等成熟的解释工具实现很好的可解释性,这点对于金融行业而言格外重要。

下表总结了集成学习的四大优势:

核心概念

集成学习(Ensemble Learning)

将多个监督学习模型进行组合,以获得更准确、更稳定的预测结果。

回归与分类(Regression and Classification)

集成方法既可以用于回归任务,即预测连续变量,也可以用于分类任务,即预测类别变量;其优势在于能够降低模型的偏差与方差。

提升预测准确率

(Improved Accuracy)

通过对多个具有差异性的模型进行平均、投票或加权,集成模型通常能够优于单一模型,尤其适用于噪声较高的金融数据。

偏差—方差平衡

(Bias–Variance Balance)

Bagging和Boosting等集成方法有助于降低欠拟合(高偏差)与过拟合(高方差)的风险,取得更好的平衡。

可解释性(Interpretability)

现代集成学习模型可以结合特征重要性(Feature Importance)、SHAP等解释工具,分析哪些变量驱动了模型的预测结果。

表格改编自Yazdani(2025), Ensemble Learning in Investment: An Overview.

“通过汇总多个模型的预测结果,集成模型可以相互抵消单个模型中的部分误差和噪声,从而让最终预测更加准确、稳定,也更值得信赖。”

Alireza Yazdani, PhD

集成学习在金融领域的关键应用

预测

通过综合多个模型的判断,从而减少单一模型误判带来的影响,让收益预测结果更加稳定、可信。

  • 提高预测精度

  • 通过模型多样性减少过拟合

  • 驾驭复杂因子

例:将随机森林、梯度提升树与神经网络相结合来预测股票收益,所得信号比任何单一模型都更稳定。

组合构建

捕捉资产间的非线性关系,以此调整投资组合。

  • 使组合适应不同的市场状态

  • 提升风险调整后收益

  • 降低对模型误差的敞口

例:利用集成模型,从数百个候选因子中识别出动量、流动性与估值比率等主导信号。

例:在高波动时期利用集成模型对组合进行动态再平衡,在保留上行潜力的同时降低回撤。

风险管理

识别隐藏的风险敞口,以及各风险因素之间的非线性关联。

  • 识别隐藏的风险驱动因素

  • 捕捉非线性风险交互

  • 支持不同市场状态下的压力测试

例:借助适用于集成模型的解释工具,发现多资产组合对流动性冲击格外敏感。

运营效率

在不引入复杂的深度学习方法的条件下,也能让预测和风险管理系统应对更大的数据量和更广的资产范围。

  • 兼容结构化与非结构化数据

  • 运营负担比深度学习更轻

例:将集成学习方法同时应用于结构化财务指标与财报电话会等非结构化文本数据,无需搭建重型的 AI 计算基础设施。

可解释性与模型治理

让复杂的分析结果更加清晰、经得起质询,以应对监管审查。

  • 提供 SHAP 值与特征重要性分析

  • 提供可直接呈报监管机构的解释

  • 赢得董事会与客户的信任

例:利用 SHAP(SHapley Additive exPlanations)值,向监管机构展示信用违约模型如何权衡借款人的各项特征,使模型输出可审计、可解释。

角色

主要方法

主要应用场景

主要价值

首席投资官

(CIO)

集成收益预测、预测结果交叉验证、模型解释方法(如SHAP、特征重要性)

战略资产配置、投资观点压力测试、向董事会及监管机构解释投资决策

提高预测可信度,减少对单一模型的依赖,并为管理层和监管沟通提供更稳健的决策依据

投资组合经理

横截面收益预测集成、波动率预测、市场状态识别

个股筛选、组合再平衡、回撤管理

提升预测信号质量,加强下行风险控制,并改善风险调整后收益

数据科学负责人

随机森林、梯度提升树

Stacking(元学习)、模型解释工具

特征筛选、因子库管理、大规模模型部署

提高建模和运维效率,在准确率与透明度之间取得平衡,并支持可复现、可治理的模型流程

风险负责人 / 首席风险官 / 风险经理

集成压力测试、模型解释框架、情景分析模型

风险因子分析、尾部风险识别、信用风险与宏观风险预测

发现潜在风险敞口,提高风险报告透明度,并增强组合在不同市场环境下的抗冲击能力

落地应用

要将集成学习纳入现有工作流程,最好先把它作为原有模型的补充,而不是一开始就完全替代现有方法。首先,可以利用历史数据测试随机森林、梯度提升树或 Stacking 等集成学习方法的效果,并将其与现有模型进行比较。其次,还要结合 SHAP 等解释工具,提高模型结果的透明度,以便投资委员会和监管机构理解与审查。最后,还应建立自动化的再训练和监控机制,使模型能够随着新数据和市场环境变化持续更新,从而保持长期的预测准确性和稳定性。

关键评价指标

信息比率IR

信息比率IR代表了每一单位超额风险所能创造的平均超额回报,它不仅关注组合能否跑赢基准,还关注这种超额收益是否足够稳定。在本章中,作者先利用集成学习模型预测下一期股票收益,再买入预测收益最高的一组股票、卖空预测收益最低的一组股票,据此构建投资组合;信息比率IR则主要用于检验这些预测能否真正转化为更好的投资结果,并判断集成学习相较传统模型是否能够更稳定地创造超额收益。

样本外R2

样本外R2用于衡量模型在未参与训练的测试数据上的拟合效果,结果取值一般在0到1之间,越靠近1证明拟合效果越好。因为它是样本外指标,也就是在测试集上得到的结果,所以更能反映模型面对新数据时是否具备真正的预测能力。在本章中,它主要用于比较集成学习模型与普通最小二乘回归等传统方法在收益预测和波动率预测中的实际表现:如果集成模型能够取得更高的样本外R2,说明它的优势并不只是来自对历史数据的过度拟合,在新的市场数据上也能保持更强的解释和预测能力。

术语词汇表

名词

释义

集成学习

(Ensemble Learning)

不把判断完全交给一个模型,而是把多个模型的预测组合起来,让不同模型互相弥补错误。核心思想是“多个不完全一样的判断组合起来,往往比单一判断更稳定”。

Bagging

(Bootstrap Aggregating)

集成学习的一个类别:把原始数据反复随机抽样,训练出很多个彼此略有差异的模型,最后再把它们的结果平均或投票。它主要解决的是单个模型太容易受样本变化影响、预测不稳定的问题,随机森林就是最典型的Bagging。

Boosting

集成学习的一个类别:与Bagging的“大家各自训练”不同,Boosting是一个接一个地训练模型,后面的模型专门弥补前面模型没学好的部分。它不断修正前面的错误,因此可以把很多能力一般的弱模型逐步组合成一个很强的预测模型,XGBoost、LightGBM 都属于这条路线。

偏差—方差权衡(Bias–Variance Trade-off)

模型太简单,容易学不到真正的规律,称为高偏差、欠拟合;模型太复杂,又容易把历史数据里的偶然噪声也当成规律,称为高方差、过拟合。集成学习的重要价值,就是它能在二者间尽量找到平衡。

因子动物园(Factor Zoo)

量化中可以拿来预测股票收益的变量越来越多,从估值、盈利、动量到宏观、资金流、情绪等,往往有几百甚至上千个候选因子,这种现象就叫做“因子动物园”。现在的问题不再是“有没有因子”,而是哪些因子真的有用、哪些只是噪声、它们之间又如何组合,而集成学习比较擅长处理这种大量变量并存的情况。

Stacking(堆叠 / 元学习)

先让多个不同模型分别给出预测,再训练一个“上层模型”学习什么时候应该更相信哪个模型、应该怎样组合它们。它不是简单平均,而是让模型自己学习最合适的组合方式,因此它常用于进一步提高预测的稳定性和准确度。

相关内容

Cao, Larry, ed. 2023. Handbook of Artificial Intelligence and Big Data Applications in Investments.CFA Institute Research Foundation. 

https://rpc.cfainstitute.org/research/foundation/2023/ai-andbig-data-in-investments-handbook. 

CFA Institute Research and Policy Center. 2025. “The Automation Ahead: Exploring the Next Frontierof Investment Automation.” 

https://rpc.cfainstitute.org/research/the-automation-ahead-contentseries. 

Fabozzi, Frank J., Andrew Chin, Igor Yelnik, and Jim Kyung-Soo Liew. 2025. “The DisappearingEdge: AI, Machine Learning, and the Future of the Discretionary Portfolio Manager.” FinancialAnalysts Journal 81 (4). 

https://rpc.cfainstitute.org/research/financial-analysts-journal/2025/disappearing-edge-ai-machine-learning. 

Wilson, Cheryll-Ann. 2025. “Explainable AI in Finance: Addressing the Needs of DiverseStakeholders.” CFA Institute Research and Policy Center. 

https://rpc.cfainstitute.org/research/reports/2025/explainable-ai-in-finance.

声 明

本文章仅供读者阅读参考,并非官方译文,若与英文原文存在不一致之处,以英文原版为准。

英文原文版权归CFA Institute所有。CFA上海协会经CFA  Institute授权,对《从业者简报-人工智能在资产管理中的应用:工具、实践与前沿》进行翻译和转载。CFA Institute保留所有相关权利。

「智选精研」项目介绍

CFA上海协会学术研究组计划系统精选CFA Institute所发表的与资本市场及资产管理高度相关的权威文章,通过精准翻译与核心提炼,结合中国市场的实际情况进行拓展分析,形成兼具国际视野与本土实践价值的深度内容。工作成果将通过CFA上海协会微信公众号推送,为协会会员及金融行业从业者提供持续的知识更新。

未来,学术研究组更计划进一步聚焦会员们最为关注的热点主题,组织线下研讨及专题讲座,搭建学术研究与实务领域的交流平台,促进全球智慧与国内从业者需求的深度融合。

我们期待这一项目能成为连接国际前沿理论与上海本土金融实践的知识桥梁,助力会员及从业者在全球化背景下提升专业洞察力。

往期回顾

Issue 1:投资相关的恶习、美德与些许幽默:金融历史中的30条著名格言

Issue 2:《资产管理中的人工智能:工具,应用及前沿》「从业者简报」- 概览

Issue 3:《资产管理中的人工智能:工具,应用及前沿》「从业者简报」- 无监督学习I:技术总览

Issue 4:《资产管理中的人工智能:工具,应用及前沿》「从业者简报」- 无监督学习II:网络理论

Issue 5:《DCF估值的困境:是纸上谈兵,还是实战利器?》

Issue 6:《资产管理中的人工智能:工具,应用及前沿》「从业者简报」- 支持向量机

Issue 7:《小盘股与大盘股:即将转向的周期》

-    END    -

CFA Society Shanghai

如果你对此类内容感兴趣

请点击赞或在看让我们知道

也欢迎分享至朋友圈

相关学习资料