夜雨聆风学习资料网

ARTICLE · 1153804

AI 工具实践备忘 · 2026年9月下旬–10月上旬

AI 工具实践备忘 · 2026年9月下旬–10月上旬


一、数据与风控基础设施补齐(W38-W39)

项目:FM_trade 生态 — Quant Signal Factory 信号工厂 + my-bot 趋势交易引擎核心引擎:RD-Agent 0.8.0 + Qlib 0.9.7(LLM 因子挖掘 → 回测评估 → 信号导出)

回测现实性最后两块拼图

W38 收尾补上了回测管线的最后两项现实性门禁:

门禁
内容
影响
存续偏差修复
ST/停牌日历(697 条)+ 退市股检测(296 只)
回测可排除异常标的,数据集自然免疫退市股
撮合现实性
费率修正(万 2.5 → 万 1.2)+ 涨跌停门禁 + ST 过滤 + 成交量约束
回测不再高估,年化收益下调约 0.3–0.5%

年化收益被"下调"其实是好事——说明回测终于开始说真话。

东财封锁下的数据源冗余

东方财富 API 自 9/17 起封锁,反而推进了全面的数据源冗余建设:

数据类
主源
降级
状态
A 股行情
akshare
—
🔴 东财端点封锁,修复后可用
港股行情
akshare HK 端点
—
✅ 不受封锁影响
行业指数
akshare → Wind MCP 双通道
baostock 合成
✅ 降级链就绪
宏观数据
NBS/央行系
新浪财经(美债)
✅ 不依赖东财

三项降级修复(9/22):宏观新闻搜索引擎无 2026 年索引 → 改走 Wind MCP;港股行情因东财封锁中断 → 新建 hk_stock_data.py 覆盖 4 只港股;北向资金确认不可修 → 标记永久停披,改用 IF/IC/IH 升贴水替代。

Layer 0 升级:7 资产 → 11 资产

新增科创 50、日经 225、印度 SENSEX、可转债 ETF 四类资产后,回测年化从 5.51% → 8.05%,Sharpe 从 0.84 → 0.93。同期还完成了黄金估值因子的三区制重构——美债 10Y 突破 5% 但黄金 ETF 持仓逆势新高,原有的线性脱钩模型失效,改为 FISCAL_RISK / TIGHTENING / NORMAL 三区制判断。CSI 300/500 模型也做了 --force-retrain 全量回训。


二、长假前后:外部资源评估与全球因子引入

国庆假期:管线自动休眠

10/1–10/7 休市,管线自动休眠、无报错;10/8 节后首日晨报 + 午报 + watchlist scan 全链路正常启动。这两周的自由交易日里,日报产出 13/13 全部完整,5 条自动化管线可用率 100%。

外部资源三选一评估

对三个候选外部资源做了必要性/可行性/成本三维评估:

资源
优先级
决策
Paper With Backtest
🟢 1/3
推荐试用(MCP 原生、$50/月、有免费层)
Global Factor Data
🟢 2/3
已下载引入
QuantsPlaybook
🟡 3/3
不推荐付费

全球学术因子引入与覆盖度体检

完成了 JKP(154 因子 × 中国 1993–2025 + 美/发达/新兴)与 Ken French(全球 5 因子 + 动量)的下载与比对(AQR 数据集因企业网络封锁未取到)。

真正的价值在于这次做了一次因子覆盖度体检——把自有 360 个特征与 JKP 153 个学术因子逐一对齐:

  • 整体覆盖率 52.3%(80/153)
  • 全覆盖主题:动量、低风险、投资、规模(均 100%)
  • 盲区主题
    :盈利质量(9.1%)、quality(16.7%)、应计项目(14.3%)、无形资产(0%)、股票发行(0%)
  • 关键遗漏的高 Sharpe 因子:niq_su(盈利超预期,Sharpe 0.84)、rd_me(研发/市值,0.85)、saleq_su(营收超预期,0.79)

一句话总结:动量、规模类因子已经做透了,缺失的全在"财务质量"这一侧。


三、运行状态与下期计划

系统状态:5 条自动化管线(morning-brief / midday-review / daily-scan / signal-factory / factor-lab)全部正常;三个交易日窗口日报完整度均 100%;投资组合当前 A 股空仓待机,最近一次平仓为中芯国际。

W42 计划:① 整理并提交 8/28 以来的累积变更;② 针对覆盖度盲区新增 10–15 个盈利质量/无形资产类特征;③ 验证 Papers With Backtest 对 A 股策略的覆盖能力;④ Q3 季度复盘(信号命中率 + P&L 归因)。


四、沉淀

📊 用外部基准给自己的特征集做"体检"

引入 JKP 数据的最大收获不是多了 153 个因子,而是拿到了一把外部尺子——52.3% 的覆盖率、五个盲区主题、三个高 Sharpe 遗漏因子,这些结论靠自己闭门造车永远得不出。学术因子库的真正用途是做基准对照,而非直接拿来用。

通用规则:任何自建体系(特征集、测试用例、风控规则)都应定期与外部成熟基准做一次覆盖度比对,缺口清单比新增功能更有价值。


🕸️ 冗余不是浪费,是保险费

东财封锁这件事本来是个纯粹的坏消息,但因为提前铺了降级链,最终变成了"顺手把数据源冗余做完了"。反观北向资金——确认永久停披后,立刻用 IF/IC/IH 升贴水做替代,而不是留一个永远取不到数的空接口。

通用规则:对待外部依赖,要么有降级路径,要么有替代方案,不能只有"祈祷它别挂"。


🗄️ 六周不提交,风险不是"丢代码"而是"不敢动手"

105 个文件、-25,921 行的累积变更,本质是决策延迟的物理化——每次想提交都会想"要不要先整理一下",然后就又拖了一周。等到真要处理时,梳理成本已经远高于当初分次提交的成本。

通用规则:版本控制的敌人不是 bug,是"等做完再一起提交"。


📉 回测数字变难看,通常意味着变准了

费率从万 2.5 修正到万 1.2 听起来是"成本降低",但涨跌停门禁、ST 过滤、成交量约束加进来之后,整体年化收益反而下调了 0.3–0.5%。这是好事:收益下调的幅度,就是之前自欺的幅度。

通用规则:任何让回测曲线"变难看"的修正,优先怀疑它是对的。


*— 记录于 2026.10.10*

相关学习资料