乐于分享
好东西不私藏

篇外:AI金融序列预测尝试--以PVC期货价格为例

篇外:AI金融序列预测尝试--以PVC期货价格为例
       PVC行业日常工作中最绕不开的话题,莫过于PVC期货价格的波动。从原料端的电石、原油涨跌,到下游房地产、管材型材的需求变动,再到地缘政治、政策调整的冲击,哪怕一个微小的变量,都可能引发期货价格的剧烈震荡——而这每一次波动,都直接关系到企业的采购成本、库存保值、订单定价,甚至是全年的经营利润。

      过去,我们判断PVC期货价格走势,大多依赖于行业经验、基本面分析、政策解读,或是简单的历史数据对比。但这种方式往往存在滞后性,面对“成本剪刀差”“库存高企”“政策突变”等复杂场景,很难精准捕捉价格拐点,甚至会因为主观判断偏差,导致企业错失套保时机、增加经营风险。

     而作为一名略懂AI技术的市场人,一直好奇:当AI遇上PVC期货,能否打破传统预测的局限,为行业提供更精准、更高效的价格预判思路?带着这个疑问,我开展了一次AI金融预测实操尝试,以PVC期货价格为核心标的,结合行业数据与AI算法,探索技术与产业结合的可能性。今天,就把这次尝试的全过程、核心发现和实操心得,分享给各位同行。

   一、 几点前提:

(1)承认金融序列的不可预测性与不可复现性:我们尊重市场的多变,承认AI在预测金融序列领域内的局限,故本实验基于有效市场假说理论,在承认金融序列部分复杂性特征【1】与记忆性的特征【2】的基础上展开预测。

(2)承认趋势跟随现象,尽量让模型学习到相关特征:预测本就是基于自回归原理进行,模型大部分时间难免学习到【T+1=T+变化】的映射,我们尽可能驱动模型学习到“有用变化”以判断拐点,但在拐点处难免滞后。

(3)预测结果仅供参考,模型参数以及具体实验细节可以联系作者。

二、实操尝试:AI预测PVC期货价格的全流程

步骤1:明确预测目标:

以PVC期货主力连续合约周度价格为标的,滚动预测未来价格走势(收盘价),重点捕捉价格拐点和波动区间。另外,选取基本面数据作为特征以辅助预测,结合PVC行业特性,我筛选了3类核心数据,覆盖产业端、金融端、舆情端,确保数据的全面性和相关性:

  • 产业基本面数据(核心驱动因子):电石价格、原油(布伦特)价格、PVC现货价格、国内PVC产能利用率、下游管材/型材开工率、国内PVC商业库存、房地产新开工面积,这些数据可以直接用。

  • 期货市场数据(价格关联因子):PVC期货主力合约的历史收盘价、成交量、持仓量、基差(期货与现货价差)、远近月价差,这些数据反映市场情绪和资金流向,能辅助判断短期价格波动趋势;

  • 非结构化数据(辅助预警因子):行业新闻、政策公告(如环保政策、出口退税政策)、地缘政治新闻,目前还没有通过NLP技术具体做特征工程,简单0-1化。(即人工判断:有重大事件-1,没有重大事件-0)

【图1 预测标的为2023年5月开始的PVC周度价格,共154个点,按照8:2划分训练集和测试集】
          【图2 选择同频的基本面产存数据作为辅助特征一起入池,数据来自钢联、隆众资讯】

步骤2:数据预处理、数据特征识别与特征工程

数据清洗,删除缺失值、异常值,并对所有特征以及价格进行归一化处理,以删除量纲对数据变动的影响,同时人工对突发事件进行0-1编码处理。

   在数据预处理阶段,我们对原始数据进行有监督的变换。具体来说,我们将时间序列数据转换为监督学习问题,通过滞后观测值、预测步长、多变量特征和t+n预测方式构建输入特征矩阵X和目标向量y。以下是这一过程的详细描述:
    a. 滞后观测值:根据所需的滞后观测值数量n_in,我们将原始数据向后平移,以构建包含历史信息的输入特征。设原始数据矩阵为D,滞后观测值构建的特征矩阵为X_lag,满足:
                                     X_lag(i,j)=D(i-n_in+j)
    b. 预测步长:我们设定预测步长为t_plus,例如t+1、t+2等。在构建目标向量y时,我们将目标值向前平移t_plus-1个时间步,以实现t+n的预测方式:
                                    y(i)=D(i+t_plus-1)
    c. 对于多变量特征:在多变量时间序列预测问题中,我们需要处理包含多个观测变量的数据。设原始数据矩阵的列数为n_var,表示有n_var个观测变量。在构建输入特征矩阵X时,我们将各观测变量的滞后观测值拼接成一个完整的特征矩阵:
                    X=[X_lag^((1) ),X_lag^((2) ),⋯,X_lag^((n_var ) ) ]
    通过以上步骤,我们将原始的时间序列数据转换为监督学习问题所需的输入特征矩阵X和目标向量y,为后续的模型训练和预测提供了基础。例如如果将预测滞后设为3,预测方式为T+1,根据上述数据预处理的方法,可构建如下初始的有监督数据集:
使用递归特征消除、相关系数、格兰杰因果检验等方案尽量筛选和PVC价格相关的特征,最终我们筛选的特征如下:
PVC社会库存、PVC产能利用率、乙烯CFR东北亚、电石内蒙出厂价格、西北SG-5出厂价格、北美PVC市场FAS、PVC产销率、PVC贸易商销量、PVC出口量(周度分拆)一共9个特征,与预测标的对应时间相同。

步骤3:选择AI模型,进行训练与调试

     为了对比不同模型对PVC价格的使用性,我们分别使用计量经济、机器学习以及分解-集成族模型分别对PVC价格进行预测,最后进行综合对比,对比指标使用常用的RMSE、MAPE、Dstat(方向准确率)三个。相关公式如下:

另外,本研究使用一种具有动态更新训练集的滚动向前预测策略,以逐步扩大训练集并缩小测试集的方式对时间序列数据进行预测。这种预测策略具有以下显著特点:
    a. 动态更新训练集:在每次滚动向前预测时,我们会将最新的观测数据添加到训练集中。这种做法可以使模型始终保持在最新的数据上进行训练,提高预测的准确性。
    b. 自适应训练:由于训练集不断地融合最新的数据,模型在每次预测时都能够充分利用当前可用的数据,使其在预测未来数据时具有更高的自适应性。
    c. 预测稳定性:滚动向前预测策略通过逐步扩大训练集并缩小测试集,使得模型能够在不断变化的数据环境中保持较高的预测稳定性。
    滚动向前预测策略具有动态更新训练集、自适应训练、预测稳定性和可解释性等显著特点,有助于提高时间序列预测的准确性和稳定性。
                                       【图3 实验流程图】
模型方面,我们对比不同类别模型的预测效果:
类别
模型
深度学习
DNN、CNN卷积网络、LSTM、GRU、RBFNN、AttentionalLSTM
机器学习
MLR(线性回归)、SVR、MLP、GRNN
统计模型
ARIMA、AR、ARMA、MA、SARIMA、指数平滑
步骤4:预测结果验证,分析优势与不足
最终结果如图所示,有些LSTM族模型因输入问题运行时间过长,且精度不符合常识:

可以看出,预测表现最好的模型是Arima/指数平滑等计量模型,其MAPE可以达到2%左右,预计精调超参数后可以达到1%以内,即5000块钱的PVC,整体的预测误差可以在【-50,50以内】,最好的DNN神经网络模型方向精度可以达到80%,即在测试集31个点中,方向猜对了25个,这个结果比我们预想的要好,因为方向准确率重要性大于水平准确率,方向准确率高,才说明模型真的学习到了东西。

【ARIMA预测结果,可以看出趋势跟随明显,模型学习到的基本是上一个值,对金融模型无能为力】

【DNN预测结果明显脱离了趋势跟随现象,虽然预测误差较大(主要是因为网络随机性原因,综合十次结果DNN的MAPE可以在3%以内),在关键拐点、转折点的判断上发挥出色,这一结果复合我们预测:神经网络族的模型对于特征的挖掘能力显著表现在预测上:DNN通过其他特征的综合变动精准预测到了第20个点PVC价格的反转-2026年3月06日,当时因美伊战争导致化工品价格上涨,但PVC作为主力煤基化工物虽有上涨,但是涨幅不大】

三、行业视角:AI预测的核心价值与落地建议

方向准确率>绝对值,让模型学到东西,然后教给人类,远比准确更重要。

      另外,本次尝试并非追求“100%精准预测”——金融市场的不确定性,决定了任何预测都无法做到绝对准确。对于PVC企业来说,AI预测的核心价值,不是“预测未来的具体价格”,而是“提供更科学的决策参考,降低经营风险”,这也是我作为市场人,推崇AI+产业结合的核心原因。

结合本次尝试,给各位PVC行业同行(尤其是市场、采购、风控岗位)3条落地建议,供大家参考:

1.  不迷信AI,把AI当作“辅助工具”,而非“决策唯一依据”。AI擅长处理数据、捕捉规律,但缺乏行业经验和对政策的深度解读——比如2026年出口退税政策取消的影响,AI能量化价格波动幅度,但无法判断政策对行业长期出口格局的影响,这就需要我们结合自身经验,对AI预测结果进行修正,形成“AI+人工”的双重决策模式。

2.  从“小场景”切入,逐步落地。不需要一开始就搭建复杂的AI系统,像我这次一样,从“短期PVC期货价格预测”“采购点价优化”等小场景入手,用轻量化AI工具,结合自身能获取的行业数据,先验证效果,再逐步扩展到库存保值、套保策略优化等更复杂的场景,降低落地难度。

3.  重视数据积累,这是AI预测的核心根基。对于企业来说,日常积累原料价格、开工率、库存、订单等核心数据,不仅能用于AI预测,还能帮助我们更清晰地掌握行业趋势——数据越全面、越精准,AI预测的效果就越好,这也是未来企业核心竞争力的重要体现

四、总结与研究展望

(1)基于transformer族大模型对于时间序列预测能尚未展示,所以精度并不是模型的最终能力。

(2)我们还没有用分解集成模型:即将原PVC价格序列分解成趋势项、周期项、波动项,然后让擅长趋势跟踪的计量模型预测趋势项、让神经网络模型预测波动项,最后组合。有关研究表明分解-集成族模型已经成为原油价格预测项目中的一大利器【3】。

(3)特征之间的相关性和对预测的贡献程度是分析师比较关注的指标,虽然模型解释性较差,但特征之间的钩稽关系对预测结果的影响具有重要作用,这个我们下一篇做分析。

(4)预测-优化【PO】是学术界常用的研究范式,预测之后的结果如何驱动优化算法对定价、运营、定销量进行调度,这也是我们下一篇探讨的问题。

【思路:我们拟参照M&SOM中的一篇文章进行照做:

Analytics for an Online Retailer: Demand Forecasting and Price Optimization,该文章发现如Rue lala、UR、Zara等快消品牌(特点:走货量大、SKU众多)某些特定SKU价格的变化对销量影响微小,通过整体多元定价优化实现利润提升,并通过A/B实验证实了结论,这对于PVC牌号众多,拟根据不同领域、不同客户打造PVC牌号超市的商家定价有一定参考意义】

参考文献:

[1]王方,张颂扬,余乐安,等.数据特征驱动的单变量预测建模研究[J].计量经济学报,2024,4(04):1124-1148.

[2]余乐安,雷凯宇.基于模式匹配与深度学习的国际油价预测研究[J].中国石油大学学报(社会科学版),2023,39(05):51-59.DOI:10.13216/j.cnki.upcjess.2023.05.0006.

[3]何志超,吴志彬,余乐安.基于VMD-SWD二次分解和最优预测器选择的碳价集成预测模型[J/OL].中国管理科学,1-18[2026-05-12].https://doi.org/10.16381/j.cnki.issn1003-207x.2025.1097.

[4]曾能民,张明,余乐安.分解-重组-融合-预测:北极航线航次量中长期预测方法[J/OL].系统工程理论与实践,1-17[2026-05-12].https://link.cnki.net/urlid/11.2267.N.20250515.1549.072.