ARTICLE · 1102830
股票涨跌预测模型 · 项目业务需求文档
辅助研判工具 · 概率化预测 · 不构成投资建议
一、项目定位与目标
1.1 一句话定位
对用户指定的单只 A 股,汇集技术面、基本面、资金面、政策面、舆情/事件面、市场环境六大维度指标,经过有效性检验筛选后,通过可解释的多因子加权评分模型,输出日 / 周 / 月三个周期的涨跌概率预判,并持续追踪预测命中率、滚动修正权重。
1.2 五条核心原则(v0.2 新增第 5 条)
1.3 明确不做什么(边界)
不做日内高频预测(数据颗粒度不支持) 不自动下单、不做实盘对接 不承诺收益、不规避黑天鹅风险(停牌、突发利空等属于模型盲区)
1.4 现实预期基准(v0.2 新增,重要)
量化研究实证规律,作为评估本模型"好不好用"的锚点:
方向准确率 55%~60% 即属可用水平,稳定超过 60% 已属优秀;不要以 70%+ 作为心理预期 单因子对收益的解释力(R²)普遍只有 1%~2%,模型价值来自"多个弱信号的叠加",而非某个神奇指标 样本外表现必然低于回测成绩(夏普类指标衰减 33%~44% 属常态),预测成绩单上的数字才是模型的真话
二、总体架构(六层 → 七层)
① 数据采集层 → ② 数据处理层 → ③ 指标计算层 → ④ 因子工程层 → ⑤ 有效性检验层 → ⑥ 权重融合预测层 → ⑦ 呈现与追踪层↑____________________回测追踪 · 权重修正 · 滚动重训闭环(反馈至④⑤⑥)______________________↓
① 数据采集层:通达信 MCP(行情/K线/F10/资金/板块)+ 联网搜索(政策/舆情/研报) ② 数据处理层:清洗、去重、对齐交易日历、财报按披露日对齐、缺失值标注 ③ 指标计算层:约 50+ 项指标计算引擎(Python + pandas) ④ 因子工程层(v0.2 新增):去极值 → 标准化 →(可选)中性化 → 统一得分 ⑤ 有效性检验层(v0.2 新增):IC 检验 / 分层单调性 / 相关性去重 / 衰减测期,只放行有效因子 ⑥ 权重融合预测层:分类得分 × 差异化权重(ICIR 校准)→ 日/周/月三周期预判 ⑦ 呈现与追踪层:HTML 评分卡看板 + 因子体检报告 + 命中率追踪 + 滚动重训
三、数据需求与来源规划
数据对齐两条红线(v0.2 新增,防前视偏差)
财报披露日对齐:财报数据进入时间轴必须用披露日(公告日)而非报告期末(如年报报告期 12-31,实际披露在次年 3~4 月,若按报告期对齐=使用了未来信息) 信息时点纪律:任何因子在 T 日计算时,只能使用 T 日及之前已公开可得的信息
四、指标体系与归纳分类(六大类,约 50+ 项)
采用分层框架:L1 市场环境(影响所有股票)→ L2 行业/板块(行业贝塔)→ L3 个股本体(技术/基本/资金/舆情)。
4.0 因子登记制度(v0.2 新增)
每个因子登记唯一 ID、名称、计算公式、数据来源、快/慢因子标签(由衰减检验确定)、检验状态(✅在模 / ⚠️观察 / ❌下架),全部存入因子登记表(SQLite)。
A. 技术面(个股 L3)
B. 基本面(个股 L3)
C. 资金面(个股 L3)
D. 政策面(L1/L2)
E. 舆情与事件面(L3,构造规范见第十章)
F. 市场环境(L1)
A 股因子有效性现状提示(v0.2 新增,用于设定初始预期)
2025-2026 年 A 股实证经验(最终以本股票历史数据检验为准):
⚠️ 小市值效应减弱(注册制改革后承压)、短期动量不稳(20~60 日以外易反转)、价值风格偏弱 ✅ 质量类(ROE 稳定性)、低波动因子稳定有效;情绪类因子对日/周周期有效
五、因子工程流程(v0.2 新增章节,对标 Barra CNE6)
每个原始指标在打分前必须走完五步流水线:
v0.1 第五章的三种打分法整体保留,后移为本流水线的第 5 步。
六、因子有效性检验与准入(v0.2 新增章节,对标 Qlib/Alpha158 + 业界因子漏斗)
6.1 三层检验
第一层:IC 检验(RankIC,即因子值与未来 N 日收益的 Spearman 秩相关)
第二层:分层单调性检验(单股场景改造版)将该股历史上每日的因子得分按分位分为高/中/低三档,统计每档之后 N 日的上涨概率与平均收益。检验标准:高分档的上涨概率/平均收益应显著高于低分档(方向符合因子设计逻辑)。若三档无差异甚至反向 → 因子对本股无效。
第三层:信息增量性(相关性去重)新因子与已在模因子计算相关系数,>0.7 视为同一信号的变体(重复投票),只保留 ICIR 更高者或合成单一复合因子。
典型冗余组预警:MA 位置 / MACD / ROC / 动量 N 日涨幅四者高度相关;换手率与量比高度相关——每组只留一个。
6.2 因子衰减检验(决定周期归属)
对每个因子分别计算5 / 10 / 20 / 60 日四个持有期的 IC 衰减曲线:
5~10 日 IC 高、60 日接近 0 → 快因子(归入日/周预判) 60 日仍有 IC → 慢因子(可归入月预判) 衰减曲线自动写入因子登记表,作为第七章周期差异化权重的校准依据(替代纯业务假设)
6.3 准入规则
6.4 稳定性红线
某因子在上涨市 / 下跌市 / 震荡市三个市况段中贡献方向相反 → 标记"不稳定因子"并自动降权(v0.1 第八章红线前移至此,检验关口提前)。
七、权重赋值机制(v0.2 升级)
7.1 三级权重结构(同 v0.1)
总得分 = Σ( 六大类得分 × 六大类权重 )每个大类得分 = Σ( 类内因子得分 × 类内因子权重 )
7.2 权重的三阶段来源(v0.2 升级)
7.3 周期差异化权重(初始示意值,校准后以因子衰减检验结果修正)
7.4 权重修正路径(v0.1 三条保留)
滚动回测自动修正:每周/每月回测各因子贡献,自动微调;单次调整幅度限制 ±20%(相对值)内防过拟合 事件驱动临时加权:财报披露周、重大政策窗口期对应因子临时上浮,事件过后自动回落 用户手动修正接口:权重配置文件可查看、可覆盖,手动值优先级最高
7.5 滚动重训机制(v0.2 新增,对标 Qlib rolling retrain)
每季度完整重跑一遍第六章检验流程(因子工程 → IC 检验 → 分层 → 去重 → 衰减),失效因子自动下架/降权,新晋有效因子入模 重训后的权重平滑过渡(如分 5 个交易日线性过渡到新权重),避免预测结果跳变 触发式重训:当连续 10 个交易日命中率显著低于滚动基线时,触发一次计划外重训(应对市况切换)
八、预测模型与输出设计
8.1 预测输出格式(同 v0.1)
【日预判】明日(T+1):上涨概率 62%(偏多)| 预期波动区间 ±2.1%核心驱动 TOP5:① 主力净流入 1.2亿 ② 放量突破 MA20 ③ ...主要风险 / 反方观点:① 技术超买 RSI 72 ② 大盘缩量 ...置信度:中高(70%)
8.2 模型路线(v0.2 明确 ML 选型)
MVP 阶段:可解释加权评分模型(上述框架),输出概率 = 得分逻辑斯蒂映射,完全可追溯 增强阶段(可选对照):LightGBM 优先(小样本 + 表格数据场景下比 LSTM/深度学习更稳、更不易过拟合,与 Qlib 基线选择一致);逻辑回归作为最简对照。不替代主模型,两者分歧大时降低置信度提示用户
8.3 预测追踪闭环(同 v0.1)
每期预测写入 SQLite → 到期自动核销 → 滚动 30/90 日命中率报告 → 反哺权重修正
8.4 基线对比制度(v0.2 新增,防"自我感觉良好")
模型每次成绩评估必须同时报告三个基线:
若模型命中率无法稳定跑赢基线,报告如实呈现并将模型降级为"参考指标",不粉饰。
九、回测与验证体系(v0.2 大幅升级)
9.1 Walk-forward 滚动验证(黄金标准)
训练窗(滚动 12 个月)→ 验证窗(紧随其后 3 个月),窗口逐月前移,拼接所有验证窗结果作为模型真实成绩 严禁整段数据随机切分(随机切分会把未来信息混进训练集,产生虚高回测)
9.2 防数据泄漏三规则
先切分后滑窗:先划定训练/验证时间边界,再做特征滑窗构造,禁止反向 信息时点纪律:因子只含 T 日及之前信息(见第三章红线) 披露日对齐:财报数据按公告日对齐(见第三章红线)
9.3 交易成本计入(v0.2 新增)
A 股单边成本约 0.1%~0.15%(佣金 + 印花税)+ 冲击滑点,按往返 1.5% 保守值计入:任何"预测对但扣完成本不赚钱"的信号价值要在报告中如实打折呈现。
9.4 评估指标(v0.1 保留 + v0.2 新增)
保留:方向准确率、T+1/T+5/T+20 胜率、平均预测偏差、分市况表现(涨/跌/震荡分组) 新增:相对基线超额(跑赢买入持有/动量多少)、最大连错次数(心理承受力指标)、成本后净优势
9.5 样本外衰减预期(v0.2 新增)
回测报告必须并列呈现"样本内 / 样本外"两套数字;样本外命中率较样本内衰减 10~20 个百分点属正常现象,不做美化。
十、舆情与情绪因子构造规范(v0.2 新增章节,对标学术实证研究)
10.1 新闻情绪因子构造
新闻情绪因子 = Σ ( 单条新闻热度权重 × 情感值 )热度衰减:当日 1.0 → 3 日内 0.5 → 7 日内 0.2 → 之后归零情感值 ∈ [-1, +1](负面 -1 ~ 正面 +1)
10.2 基本面相关性标签筛选(关键增值步骤)
新闻入库时先打"是否与经营基本面相关"标签(订单/业绩/产能/重组/政策 → 相关;明星八卦/蹭热点口水稿 → 不相关),情绪因子只计基本面相关条目。
业界实证:加入该筛选步骤后,新闻情绪因子年化收益由 3.65% 提升至 8.10%——新闻质量比数量重要。
10.3 个股情绪指数合成
20+ 子指标(新闻热度/情感占比/研报评级调整/社交媒体讨论度/涨停连板热度/股吧发帖量等)采用等权合成。
研究显示等权法的稳健性优于 PLS 等复杂提取方法(中信建投 A 股情绪指数经验),且完全可解释。
10.4 情绪反向预警(独立风控维度)
当情绪指数升至自身历史95% 分位以上的极端高位→ 触发"情绪过热回调风险"预警;跌至 5% 分位以下极端低位 → "情绪冰点反转关注"。该信号作为风险提示独立呈现,不计入看多/看空评分(情绪极端时往往是反向指标)。
10.5 MVP 降级方案
Phase 1 先用联网搜索摘要 + 关键词正负规则粗分(热度 × 粗分情感);10.1~10.4 的精细化在 Phase 3 随 NLP 能力落地。
十一、呈现设计
十二、技术选型(免费 · 本地化 · 零 token 成本)
十三、开发阶段规划(v0.2 更新:有效性检验前移)
与 v0.1 的关键差异:有效性检验从 Phase 2 前移到 Phase 1——先保证进入模型的因子是对的,再谈权重优化。
十四、风险声明与现实预期管理(v0.2 升级,必读)
概率 ≠ 确定性:模型输出为统计意义上的倾向判断,短期市场受随机性主导 黑天鹅盲区:突发利空、停牌、监管突变、海外黑天鹅无法被历史数据捕捉 数据局限:舆情数据存在噪声与滞后;政策解读存在主观性 过拟合风险:已设 walk-forward 验证、权重调整限幅、滚动重训三重防线,但无法根除 失真场景:涨跌停制度、流动性极低个股的技术信号失真 免责:本系统仅供研究参考,不构成投资建议,不承诺任何收益,不荐具体买卖时点 预期锚点(v0.2 新增):方向准确率 55%60% 即可用,60%+ 属优秀;样本内成绩必然好于样本外(衰减 1020 个百分点正常) 因子拥挤与衰减(v0.2 新增):公开有效的因子会因市场套利而衰减(学术经验:发表后超额收益平均衰减约 58%),模型需靠滚动重训"保鲜",没有任何因子永久有效 市况非平稳(v0.2 新增):注册制改革、风格切换等结构性变化会使历史规律失效(近年小市值因子衰减即为例证),回测好 ≠ 未来好
十五、待您确认 / 补充的问题清单(请逐条反馈)
v0.1 遗留 10 条:
股票范围:MVP 先做单只指定股票跑通,还是一开始就要自选股票池批量?(建议先单股) 运行方式:每日盘后自动跑批 + 手动随时触发,默认开自动吗? 预测周期定义:日 = 次一交易日、周 = 未来 5 个交易日、月 = 未来 20 个交易日,是否认可? 回测深度:用近 2~3 年历史数据做检验与回测,是否认可? 舆情数据源:MVP 用联网搜索做舆情摘要 + 粗分情感,是否接受? 输出形式:HTML 看板 + 文字预判报告,是否需要额外输出(如 Word 日报)? 反方观点:每期预判固定附"反方观点"栏目,是否保留?(建议保留) 权重修正节奏:每周 or 每月自动修正?(建议先每月) 观察期:是否需要 2~4 周的"纸面跟踪期"——只出预测不实际使用,先看命中率? 风格偏好:精简版(一屏看板)还是详尽版(看板 + 千字分析)?
v0.2 新增 4 条:11.检验严格度:是否接受"未通过有效性检验的因子不参与加权"?这可能导致初期入模因子少于 50 项(建议接受——少而准胜过多而杂)12.成本假设:交易成本按往返 1.5% 保守计入评估,是否认可?13.滚动重训频率:每季度重跑一次因子检验与权重校准,是否认可?14.预期锚点:是否接受"命中率 55%~60% 即属正常可用"作为评价模型的标准?(这决定了您对模型价值的判断尺度)