夜雨聆风学习资料网

ARTICLE · 1102830

股票涨跌预测模型 · 项目业务需求文档

股票涨跌预测模型 · 项目业务需求文档

辅助研判工具 · 概率化预测 · 不构成投资建议


一、项目定位与目标

1.1 一句话定位

对用户指定的单只 A 股,汇集技术面、基本面、资金面、政策面、舆情/事件面、市场环境六大维度指标,经过有效性检验筛选后,通过可解释的多因子加权评分模型,输出日 / 周 / 月三个周期的涨跌概率预判,并持续追踪预测命中率、滚动修正权重。

1.2 五条核心原则(v0.2 新增第 5 条)

原则
说明
数据真实
金融数据优先取自通达信;政策/舆情类联网数据必须标注来源,缺失维度如实标注,禁止编造
模型可解释
每一个分数、每一个权重都可追溯、可展示,用户能看到"为什么看多/看空"
预测可验证
每期预测落库存档,到期自动核销比对,形成"预测成绩单",用胜率说话
输出概率化
只输出"上涨概率 + 置信度 + 预期区间",绝不输出"一定涨/跌"的确定结论
先检验后入模
所有因子必须通过统计有效性检验(IC/分层/相关性)才能进入权重表,杜绝"感觉有用就加权";未通过的因子仅作参考展示

1.3 明确不做什么(边界)

  • 不做日内高频预测(数据颗粒度不支持)
  • 不自动下单、不做实盘对接
  • 不承诺收益、不规避黑天鹅风险(停牌、突发利空等属于模型盲区)

1.4 现实预期基准(v0.2 新增,重要)

量化研究实证规律,作为评估本模型"好不好用"的锚点:

  • 方向准确率 55%~60% 即属可用水平,稳定超过 60% 已属优秀;不要以 70%+ 作为心理预期
  • 单因子对收益的解释力(R²)普遍只有 1%~2%,模型价值来自"多个弱信号的叠加",而非某个神奇指标
  • 样本外表现必然低于回测成绩(夏普类指标衰减 33%~44% 属常态),预测成绩单上的数字才是模型的真话

二、总体架构(六层 → 七层)

① 数据采集层 → ② 数据处理层 → ③ 指标计算层 → ④ 因子工程层 → ⑤ 有效性检验层 → ⑥ 权重融合预测层 → ⑦ 呈现与追踪层                     ↑____________________回测追踪 · 权重修正 · 滚动重训闭环(反馈至④⑤⑥)______________________↓
  • ① 数据采集层:通达信 MCP(行情/K线/F10/资金/板块)+ 联网搜索(政策/舆情/研报)
  • ② 数据处理层:清洗、去重、对齐交易日历、财报按披露日对齐、缺失值标注
  • ③ 指标计算层:约 50+ 项指标计算引擎(Python + pandas)
  • ④ 因子工程层(v0.2 新增):去极值 → 标准化 →(可选)中性化 → 统一得分
  • ⑤ 有效性检验层(v0.2 新增):IC 检验 / 分层单调性 / 相关性去重 / 衰减测期,只放行有效因子
  • ⑥ 权重融合预测层:分类得分 × 差异化权重(ICIR 校准)→ 日/周/月三周期预判
  • ⑦ 呈现与追踪层:HTML 评分卡看板 + 因子体检报告 + 命中率追踪 + 滚动重训

三、数据需求与来源规划

#
数据维度
具体内容
来源
可得性
更新频率
1
行情数据
日K线(开高低收/量/额)、实时快照、量比、换手率、振幅、涨跌停
通达信 MCP(tdx_kline / tdx_quotes)
✅ 现成
每日
2
基本面
利润表/资产负债表/现金流量表(6年)、PE/PB/ROE、主营构成、股东人数
通达信 MCP(tdx_api_data / tdx_indicator_select)
✅ 现成
季报/实时
3
资金面
主力资金净流入、大单统计、北向资金、融资融券、龙虎榜、限售解禁
通达信 MCP(F10 资金流向/股东研究/分红融资)
✅ 现成
每日/盘后
4
市场环境
三大指数趋势与量能、两市成交、板块行情、行业相对强弱
通达信 MCP
✅ 现成
每日
5
政策面
宏观政策(货币/财政)、行业产业政策、监管动态
联网搜索
⚠️ 需标注来源、时效由人工确认
事件驱动
6
舆情面
新闻热度、正负面情感、社交媒体讨论度、券商研报评级变化(构造规范见第十章)
联网搜索
⚠️ 覆盖有限,后续可扩展专业源
每日
7
事件日历
财报披露日、限售解禁日、除权除息、股东大会、重大会议窗口
通达信 F10(解禁/分红)+ 手工维护日历
✅ 部分
提前维护

数据对齐两条红线(v0.2 新增,防前视偏差)

  1. 财报披露日对齐:财报数据进入时间轴必须用披露日(公告日)而非报告期末(如年报报告期 12-31,实际披露在次年 3~4 月,若按报告期对齐=使用了未来信息)
  2. 信息时点纪律:任何因子在 T 日计算时,只能使用 T 日及之前已公开可得的信息

四、指标体系与归纳分类(六大类,约 50+ 项)

采用分层框架:L1 市场环境(影响所有股票)→ L2 行业/板块(行业贝塔)→ L3 个股本体(技术/基本/资金/舆情)。

4.0 因子登记制度(v0.2 新增)

每个因子登记唯一 ID、名称、计算公式、数据来源、快/慢因子标签(由衰减检验确定)、检验状态(✅在模 / ⚠️观察 / ❌下架),全部存入因子登记表(SQLite)。

A. 技术面(个股 L3)

子类
指标
趋势类
MA5/10/20/60 排列状态、价格相对均线位置、MACD(DIF/DEA/柱)、BOLL 位置
动量类
RSI(6/12/24)、KDJ、ROC、动量(N日涨幅)
量能类
量比、换手率 vs 5日均换手、成交量 vs 5日均量(放量/缩量)、OBV 趋势
波动形态
ATR 波动率、布林带宽收口/张口、近期高低点位置、K线形态

B. 基本面(个股 L3)

子类
指标
盈利能力
归母净利润及增速、营收增速、ROE 稳定性(v0.2 强化:近8季度 ROE 波动率,A股实证中质量类因子当前稳定有效)、毛利率、净利率
估值水平
PE(TTM) 历史分位、PB 历史分位、PS、PEG、与行业中位数对比
财务健康
资产负债率、经营现金流/净利润比、应收账款占比
股东回报
分红率、股息率、回购增持动态

C. 资金面(个股 L3)

子类
指标
主力行为
主力资金净流入(当日/5日累计)、大单成交占比、尾盘资金异动
机构资金
北向资金持股变动、机构持仓变化(季报)、龙虎榜上榜性质
杠杆资金
融资余额变化、融资买入占比
筹码结构
股东人数变化、十大流通股东变动、限售解禁压力(未来30/90日)

D. 政策面(L1/L2)

子类
指标
宏观政策
货币政策取向、财政政策、监管基调
行业政策
所属行业产业政策、价格管制、进出口政策
政策强度分级
国家级(高)/ 部委级(中)/ 行业自律(低)

E. 舆情与事件面(L3,构造规范见第十章)

子类
指标
新闻舆情
新闻情绪因子 = Σ(热度 × 情感值)(热度时间衰减加权)
情绪指数
多子指标等权合成的个股情绪指数(v0.2 新增)+ 情绪过热反向预警
研报观点
券商评级调整、目标价与现价空间
事件日历
财报披露临近效应、解禁临近、除权除息、股东大会、重大会议窗口
异常事件
突发利好/利空

F. 市场环境(L1)

子类
指标
大盘趋势
上证/深证/创业板均线排列、涨跌状态
大盘量能
两市成交额 vs 5日均值
市场情绪
两市涨跌家数比、涨停/跌停家数、指数量比
风格与轮动
成长 vs 价值相对强弱、所属板块涨幅排名

A 股因子有效性现状提示(v0.2 新增,用于设定初始预期)

2025-2026 年 A 股实证经验(最终以本股票历史数据检验为准):

  • ⚠️ 小市值效应减弱(注册制改革后承压)、短期动量不稳(20~60 日以外易反转)、价值风格偏弱
  • ✅ 质量类(ROE 稳定性)、低波动因子稳定有效;情绪类因子对日/周周期有效

五、因子工程流程(v0.2 新增章节,对标 Barra CNE6)

每个原始指标在打分前必须走完五步流水线:

步骤
方法
目的
5.1 缺失值处理
前值填充 / 剔除样本并记录缺失率;缺失率 >30% 的因子降级为观察状态
数据质量门槛
5.2 去极值
MAD 法(超出中位数 ±3 倍绝对中位差的值截断)
防止微利股 PE=2000 之类的极端值扭曲打分
5.3 标准化
z-score(对该股自身 2~3 年历史分布标准化);可选行业内 z-score
消除量纲,可比可加
5.4 中性化(Phase 2 起可选)
市值中性化、行业中性化
防止"看似选股、实为赌风格/赌行业"
5.5 得分映射
v0.1 的三种打分法(分位数法/阈值法/相对法)在此步执行,统一转 0~100
进入加权融合

v0.1 第五章的三种打分法整体保留,后移为本流水线的第 5 步。


六、因子有效性检验与准入(v0.2 新增章节,对标 Qlib/Alpha158 + 业界因子漏斗)

6.1 三层检验

第一层:IC 检验(RankIC,即因子值与未来 N 日收益的 Spearman 秩相关)

指标
合格标准
优秀标准
RankIC 均值(绝对值)
> 0.03
> 0.05
IC 胜率(IC>0 期数占比)
> 60%
> 70%
ICIR(IC均值 / IC标准差)
> 0.5
> 0.8

第二层:分层单调性检验(单股场景改造版)将该股历史上每日的因子得分按分位分为高/中/低三档,统计每档之后 N 日的上涨概率与平均收益。检验标准:高分档的上涨概率/平均收益应显著高于低分档(方向符合因子设计逻辑)。若三档无差异甚至反向 → 因子对本股无效。

第三层:信息增量性(相关性去重)新因子与已在模因子计算相关系数,>0.7 视为同一信号的变体(重复投票),只保留 ICIR 更高者或合成单一复合因子。

典型冗余组预警:MA 位置 / MACD / ROC / 动量 N 日涨幅四者高度相关;换手率与量比高度相关——每组只留一个。

6.2 因子衰减检验(决定周期归属)

对每个因子分别计算5 / 10 / 20 / 60 日四个持有期的 IC 衰减曲线:

  • 5~10 日 IC 高、60 日接近 0 → 快因子(归入日/周预判)
  • 60 日仍有 IC → 慢因子(可归入月预判)
  • 衰减曲线自动写入因子登记表,作为第七章周期差异化权重的校准依据(替代纯业务假设)

6.3 准入规则

检验结果
处理
三层全部通过
✅ 正式入模,参与加权
通过 IC 但单调性/增量性存疑
⚠️ 观察名单,权重减半
未通过
❌ 仅在评分卡展示原值,不参与加权

6.4 稳定性红线

某因子在上涨市 / 下跌市 / 震荡市三个市况段中贡献方向相反 → 标记"不稳定因子"并自动降权(v0.1 第八章红线前移至此,检验关口提前)。


七、权重赋值机制(v0.2 升级)

7.1 三级权重结构(同 v0.1)

总得分 = Σ( 六大类得分 × 六大类权重 )每个大类得分 = Σ( 类内因子得分 × 类内因子权重 )

7.2 权重的三阶段来源(v0.2 升级)

阶段
方法
说明
冷启动
业务逻辑初值
7.3 的周期差异化权重表,解决"没有历史统计时模型先跑起来"
正式校准
ICIR 加权法
权重 ∝ 各因子 ICIR(同时奖励"准"与"稳"),业界实证优于等权
运行期
滚动修正 + 滚动重训
见 7.4 / 7.5

7.3 周期差异化权重(初始示意值,校准后以因子衰减检验结果修正)

维度
日预判(T+1)
周预判(T+5)
月预判(T+20)
A 技术面
35%
25%
10%
C 资金面
25%
25%
10%
E 舆情/事件
15%
15%
10%
F 市场环境
20%
15%
20%
B 基本面
0%(日频无效)
10%
30%
D 政策面
5%
10%
20%

7.4 权重修正路径(v0.1 三条保留)

  1. 滚动回测自动修正:每周/每月回测各因子贡献,自动微调;单次调整幅度限制 ±20%(相对值)内防过拟合
  2. 事件驱动临时加权:财报披露周、重大政策窗口期对应因子临时上浮,事件过后自动回落
  3. 用户手动修正接口:权重配置文件可查看、可覆盖,手动值优先级最高

7.5 滚动重训机制(v0.2 新增,对标 Qlib rolling retrain)

  • 每季度完整重跑一遍第六章检验流程(因子工程 → IC 检验 → 分层 → 去重 → 衰减),失效因子自动下架/降权,新晋有效因子入模
  • 重训后的权重平滑过渡(如分 5 个交易日线性过渡到新权重),避免预测结果跳变
  • 触发式重训:当连续 10 个交易日命中率显著低于滚动基线时,触发一次计划外重训(应对市况切换)

八、预测模型与输出设计

8.1 预测输出格式(同 v0.1)

【日预判】明日(T+1):上涨概率 62%(偏多)| 预期波动区间 ±2.1%核心驱动 TOP5:① 主力净流入 1.2亿 ② 放量突破 MA20 ③ ...主要风险 / 反方观点:① 技术超买 RSI 72 ② 大盘缩量 ...置信度:中高(70%)

8.2 模型路线(v0.2 明确 ML 选型)

  • MVP 阶段:可解释加权评分模型(上述框架),输出概率 = 得分逻辑斯蒂映射,完全可追溯
  • 增强阶段(可选对照):LightGBM 优先(小样本 + 表格数据场景下比 LSTM/深度学习更稳、更不易过拟合,与 Qlib 基线选择一致);逻辑回归作为最简对照。不替代主模型,两者分歧大时降低置信度提示用户

8.3 预测追踪闭环(同 v0.1)

每期预测写入 SQLite → 到期自动核销 → 滚动 30/90 日命中率报告 → 反哺权重修正

8.4 基线对比制度(v0.2 新增,防"自我感觉良好")

模型每次成绩评估必须同时报告三个基线:

基线
定义
意义
随机猜测
50% 命中
模型底线
买入持有
始终预测上涨
A 股长期上涨市中的懒人基准
简单动量
过去 20 日涨 → 预测涨
最朴素的量化策略

若模型命中率无法稳定跑赢基线,报告如实呈现并将模型降级为"参考指标",不粉饰。


九、回测与验证体系(v0.2 大幅升级)

9.1 Walk-forward 滚动验证(黄金标准)

  • 训练窗(滚动 12 个月)→ 验证窗(紧随其后 3 个月),窗口逐月前移,拼接所有验证窗结果作为模型真实成绩
  • 严禁整段数据随机切分(随机切分会把未来信息混进训练集,产生虚高回测)

9.2 防数据泄漏三规则

  1. 先切分后滑窗:先划定训练/验证时间边界,再做特征滑窗构造,禁止反向
  2. 信息时点纪律:因子只含 T 日及之前信息(见第三章红线)
  3. 披露日对齐:财报数据按公告日对齐(见第三章红线)

9.3 交易成本计入(v0.2 新增)

A 股单边成本约 0.1%~0.15%(佣金 + 印花税)+ 冲击滑点,按往返 1.5% 保守值计入:任何"预测对但扣完成本不赚钱"的信号价值要在报告中如实打折呈现。

9.4 评估指标(v0.1 保留 + v0.2 新增)

  • 保留:方向准确率、T+1/T+5/T+20 胜率、平均预测偏差、分市况表现(涨/跌/震荡分组)
  • 新增:相对基线超额(跑赢买入持有/动量多少)、最大连错次数(心理承受力指标)、成本后净优势

9.5 样本外衰减预期(v0.2 新增)

回测报告必须并列呈现"样本内 / 样本外"两套数字;样本外命中率较样本内衰减 10~20 个百分点属正常现象,不做美化。


十、舆情与情绪因子构造规范(v0.2 新增章节,对标学术实证研究)

10.1 新闻情绪因子构造

新闻情绪因子 = Σ ( 单条新闻热度权重 × 情感值 )热度衰减:当日 1.0 → 3 日内 0.5 → 7 日内 0.2 → 之后归零情感值 ∈ [-1, +1](负面 -1 ~ 正面 +1)

10.2 基本面相关性标签筛选(关键增值步骤)

新闻入库时先打"是否与经营基本面相关"标签(订单/业绩/产能/重组/政策 → 相关;明星八卦/蹭热点口水稿 → 不相关),情绪因子只计基本面相关条目。

业界实证:加入该筛选步骤后,新闻情绪因子年化收益由 3.65% 提升至 8.10%——新闻质量比数量重要。

10.3 个股情绪指数合成

20+ 子指标(新闻热度/情感占比/研报评级调整/社交媒体讨论度/涨停连板热度/股吧发帖量等)采用等权合成。

研究显示等权法的稳健性优于 PLS 等复杂提取方法(中信建投 A 股情绪指数经验),且完全可解释。

10.4 情绪反向预警(独立风控维度)

当情绪指数升至自身历史95% 分位以上的极端高位→ 触发"情绪过热回调风险"预警;跌至 5% 分位以下极端低位 → "情绪冰点反转关注"。该信号作为风险提示独立呈现,不计入看多/看空评分(情绪极端时往往是反向指标)。

10.5 MVP 降级方案

Phase 1 先用联网搜索摘要 + 关键词正负规则粗分(热度 × 粗分情感);10.1~10.4 的精细化在 Phase 3 随 NLP 能力落地。


十一、呈现设计

呈现物
内容
形式
个股全景评分卡
六大类得分雷达图 + 关键指标明细 + 当前权重表 + 三周期预判结论
HTML 看板(红涨绿跌)
因子体检报告(v0.2 新增)
每个因子的 IC / ICIR / 分层单调性 / 相关性状态与检验结论(✅在模 / ⚠️观察 / ❌下架)
HTML 表格看板
日/周/月预判报告
概率、区间、核心驱动、反方观点、置信度、基线对比
看板 + 文字摘要
预测成绩单
滚动命中率、按周期/按市况分组统计、相对基线超额
表格看板
权重透明表
当前所有因子权重 + 最近一次自动修正/重训记录
配置文件 + 看板

十二、技术选型(免费 · 本地化 · 零 token 成本)

组件
选型
说明
运行环境
Windows + Python 3.13(本地托管)
贴合现有环境
数据源
通达信 MCP(主)+ 联网搜索(政策/舆情,标注来源)
金融数据以通达信为准
存储
本地 SQLite(指标时序 / 因子登记表 / 权重表 / 预测记录)
单文件、免部署
计算
pandas / numpy / scipy(IC、Spearman 相关性)
纯免费库
统计检验(后期)
statsmodels(回归检验 T 值)、LightGBM(ML 对照)
可选
呈现
HTML 看板(内联样式,红涨绿跌)
可直接分享
调度
定时自动化任务(每日盘后 16:00 跑批 + 报告;季度滚动重训)
可配开关

十三、开发阶段规划(v0.2 更新:有效性检验前移)

阶段
内容
交付物
Phase 1(MVP)
数据管道(含披露日对齐)+ 因子工程五步流水线 + 核心 20 个因子的有效性检验(先验后入模)+ 冷启动权重 + 日/周/月预判 + 评分卡看板
单只股票全流程跑通,因子体检报告首版
Phase 2
walk-forward 回测系统 + ICIR 权重校准 + 因子衰减检验(快/慢因子标签)+ 基线对比 + 预测记录库与成绩单
模型进入"自我进化",成绩有基线参照
Phase 3
舆情 NLP 深化(热度×情感因子、基本面标签筛选、情绪指数合成、反向预警)+ 事件日历 + LightGBM 对照
舆情与事件维度成熟可用
Phase 4
自选股票池批量监控 + 横向对比 + 季度滚动重训自动化 + 异动预警
从"单股"到"池子",模型长期保鲜

与 v0.1 的关键差异:有效性检验从 Phase 2 前移到 Phase 1——先保证进入模型的因子是对的,再谈权重优化。


十四、风险声明与现实预期管理(v0.2 升级,必读)

  1. 概率 ≠ 确定性:模型输出为统计意义上的倾向判断,短期市场受随机性主导
  2. 黑天鹅盲区:突发利空、停牌、监管突变、海外黑天鹅无法被历史数据捕捉
  3. 数据局限:舆情数据存在噪声与滞后;政策解读存在主观性
  4. 过拟合风险:已设 walk-forward 验证、权重调整限幅、滚动重训三重防线,但无法根除
  5. 失真场景:涨跌停制度、流动性极低个股的技术信号失真
  6. 免责:本系统仅供研究参考,不构成投资建议,不承诺任何收益,不荐具体买卖时点
  7. 预期锚点(v0.2 新增):方向准确率 55%60% 即可用,60%+ 属优秀;样本内成绩必然好于样本外(衰减 1020 个百分点正常)
  8. 因子拥挤与衰减(v0.2 新增):公开有效的因子会因市场套利而衰减(学术经验:发表后超额收益平均衰减约 58%),模型需靠滚动重训"保鲜",没有任何因子永久有效
  9. 市况非平稳(v0.2 新增):注册制改革、风格切换等结构性变化会使历史规律失效(近年小市值因子衰减即为例证),回测好 ≠ 未来好

十五、待您确认 / 补充的问题清单(请逐条反馈)

v0.1 遗留 10 条:

  1. 股票范围:MVP 先做单只指定股票跑通,还是一开始就要自选股票池批量?(建议先单股)
  2. 运行方式:每日盘后自动跑批 + 手动随时触发,默认开自动吗?
  3. 预测周期定义:日 = 次一交易日、周 = 未来 5 个交易日、月 = 未来 20 个交易日,是否认可?
  4. 回测深度:用近 2~3 年历史数据做检验与回测,是否认可?
  5. 舆情数据源:MVP 用联网搜索做舆情摘要 + 粗分情感,是否接受?
  6. 输出形式:HTML 看板 + 文字预判报告,是否需要额外输出(如 Word 日报)?
  7. 反方观点:每期预判固定附"反方观点"栏目,是否保留?(建议保留)
  8. 权重修正节奏:每周 or 每月自动修正?(建议先每月)
  9. 观察期:是否需要 2~4 周的"纸面跟踪期"——只出预测不实际使用,先看命中率?
  10. 风格偏好:精简版(一屏看板)还是详尽版(看板 + 千字分析)?

v0.2 新增 4 条:11.检验严格度:是否接受"未通过有效性检验的因子不参与加权"?这可能导致初期入模因子少于 50 项(建议接受——少而准胜过多而杂)12.成本假设:交易成本按往返 1.5% 保守计入评估,是否认可?13.滚动重训频率:每季度重跑一次因子检验与权重校准,是否认可?14.预期锚点:是否接受"命中率 55%~60% 即属正常可用"作为评价模型的标准?(这决定了您对模型价值的判断尺度)


附录 A:v0.1 → v0.2 修订对照表(缺陷评估结论)

#
发现的缺陷
对标来源
v0.2 修订动作
1
50+ 指标未做有效性检验直接加权,无效因子稀释有效信号
Qlib/Alpha158(先 IC 筛选因子再训练)
新增第六章:三层检验准入制(IC / 分层单调 / 相关性去重),"先检验后入模"写入核心原则
2
无去极值/标准化流程,极端值(PE=2000)扭曲打分
Barra CNE6 标准化五步
新增第五章因子工程流水线:MAD 去极值 → z-score → 可选中性化 → 得分映射
3
MA/MACD/ROC/动量等高相关因子重复计分(同一信号投多票)
业界相关性去重(阈值 0.7)
第六章 6.1 第三层:相关性 >0.7 的因子组只留 ICIR 最高者
4
权重赋值缺方法论,仅"业务直觉 + 回测微调"
ICIR 加权法(业界标准)
第七章 7.2:正式校准阶段采用 ICIR 加权法
5
直接假设三套周期权重,未检验因子适合哪个持有期
因子衰减检验(快/慢因子)
第六章 6.2:5/10/20/60 日 IC 衰减曲线,按因子寿命自动匹配周期
6
舆情因子构造粗糙(仅"情感粗分"),未过滤口水新闻
新闻情绪因子实证(基本面标签筛选年化 3.65%→8.10%)
新增第十章:热度×情感求和 + 基本面相关性标签筛选
7
情绪只当正向因子,缺极端情绪反转预警
情绪指数研究(BW 范式、等权合成)
第十章 10.3/10.4:情绪指数等权合成 + 极端分位反向预警(独立风控维度)
8
回测仅"前70%/后30%"单次切分,有数据泄漏风险;未计交易成本;无基线对比
walk-forward 验证、ML 陷阱研究(样本外 Sharpe 衰减 33~44%、A股往返成本约1.5%)
第九章全面升级:walk-forward 滚动验证 + 防泄漏三规则 + 成本计入 + 三重基线对比
9
未规定财报按披露日对齐,存在前视偏差
因子研究五大坑(A股财报披露延迟)
第三章新增数据对齐两条红线
10
无滚动重训机制,市况切换后因子失效无应对
Qlib rolling retrain
第七章 7.5:季度滚动重训 + 命中率异常触发计划外重训 + 权重平滑过渡
11
未纳入 A 股当前因子环境(小市值衰减、质量/低波动有效等)
2025-2026 A股因子实证
第四章新增"A股因子有效性现状提示",月预判强化 ROE 稳定性因子
12
无现实预期管理,用户易对模型期望过高
ML 陷阱研究(样本内 R² 12%、准确率 5560% 属可用)
新增 1.4 现实预期基准 + 风险声明第 7~9 条 + 基线对比制度
13
无因子生命周期管理(因子从哪来、何时失效)
Qlib 因子登记与管理实践
第四章 4.0 因子登记制度(唯一 ID / 快慢标签 / 检验状态)+ 第十一章因子体检报告

相关学习资料