基于趋势结构提取的股票时间序列样本重构与预测

《The Journal of Finance and Data Science》:Sample reconstruction and prediction of stock time series based on trend structure extraction

【字体: 时间:2026年09月09日 来源:The Journal of Finance and Data Science 3.7

编辑推荐:

  金融时间序列具有强噪声、频繁波动以及密集的局部趋势切换等特征,使得对原始序列的直接预测较为困难。本文从预训练样本构建的角度研究股票时间序列预测问题,提出了多步趋势结构提取(Multi-step Trend Structure Extraction,MTSE)方

  
金融时间序列具有强噪声、频繁波动以及密集的局部趋势切换等特征,使得对原始序列的直接预测较为困难。本文从预训练样本构建的角度研究股票时间序列预测问题,提出了多步趋势结构提取(Multi-step Trend Structure Extraction,MTSE)方法。MTSE在不同步长及其组合下识别价格及相关指标序列中的局部高点和低点,将连续观测值转换为趋势事件表征。研究区分了事件的发生位置与确认位置,以已确认的价格转折事件作为样本锚点,并将决策点之前可获得的成交量、RSI和BIAS中的最新已确认事件在统一决策表内对齐。利用创业板指数在1分钟、15分钟、60分钟、日线和周线频率上的数据,研究人员在CatBoost、Transformer和CNN模型下对原始滑动窗口流程与MTSE重构流程进行了比较。评估采用配对统计检验、分层消融实验以及扣除成本后的回测。结果表明,MTSE改变了样本数量、标签切换频率和趋势分段组织方式。相对于原始输入,MTSE在大多数模型和时间粒度下提升了F1、AUC和MCC指标。消融结果表明,性能提升与事件过滤、结构信息以及多指标对齐的联合组织相关。在扣除成本的回测中,MTSE流程通常能提供更优的风险—收益特征。这些发现表明,预训练趋势结构重构能够改善模型学习效果以及创业板指数情境下的金融可用性。
**基于趋势结构提取的股票时间序列样本重构与预测研究解读**

**一、研究背景与问题**

股票时间序列记录了价格、成交量及相关技术指标随时间的动态变化,是描述市场状态演变的重要数据形式。与一般时间序列相比,金融时间序列通常具有强噪声、非线性波动、非平稳性和厚尾分布等特征,这使得价格方向的预测具有高度不确定性。近年来,机器学习和深度学习方法被广泛应用于股票收益预测、价格方向识别和资产定价等领域。然而,当模型直接处理原始连续序列时,需要在识别有效模式的同时应对大量短期扰动。因此,如何提升模型从金融时间序列中学习有效信号的能力,仍然是股票预测研究中的重要问题。

现有研究围绕这一问题大致可分为两条路径:模型结构改进和输入信息组织。前者侧重于提升模型捕捉时间依赖、局部模式和长距离关系的能力,例如将LSTM、卷积神经网络、Transformer模型及混合结构应用于股票收益预测和价格方向识别。后者关注如何将市场观测转化为更适合模型学习的输入形式,包括技术指标扩展、特征选择、去噪、多源信息融合和时间序列成像等。然而,现有研究大多以预先指定的历史窗口、图表或连续序列片段为基础,侧重于模型如何识别或转换给定输入,而对样本在进入模型之前如何被筛选、确认、对齐和标注的关注相对有限。对于股票方向预测而言,这一问题尤为重要,因为模型学习的监督信号并非自然观测变量,而是由样本边界、预测窗口和标注规则共同定义的。

在此背景下,本文从预训练样本构建的角度切入,提出多步趋势结构提取(MTSE)方法,并构建了基于MTSE的样本重构流程。研究的核心问题是:这种预训练样本重构流程是否会改变模型面临的学习对象,进而影响预测判别能力和交易表现。

**二、研究内容与主要结论**

本文以创业板指数为研究对象,使用2010年至2025年期间1分钟、15分钟、60分钟、日线和周线五个频率层级的数据,通过对比原始连续滑动窗口流程和MTSE趋势结构重构流程,在CatBoost、Transformer和CNN三类模型下进行系统实验评估。实验在三个层面展开:表征层面考察MTSE对样本量、压缩比、标签分布、标签切换频率和平均标签运行长度的影响;预测层面使用F1、AUC、MCC和平衡准确率比较分类性能,并采用配对统计检验和分层消融分析;交易层面则通过净累计收益、夏普比率和最大回撤评估预测结果能否转化为具有财务意义的交易表现。

研究得出以下主要结论:第一,MTSE不仅缩小了样本规模,更重要的是改变了样本的组织方式。不同步长及组合方案产生不同程度的压缩率、标签切换频率和趋势分段结构。第二,相对于原始输入流程,MTSE流程在大多数模型设置和时间粒度下表现出更优的预测性能,在F1、AUC和MCC指标上提升尤为明显。CatBoost和Transformer的提升相对稳定,而CNN的预测差异随评估指标和时间粒度而变化。第三,在扣除交易成本后,MTSE流程总体上能获得更好的净收益和风险调整后表现。与基准策略的比较以及交易成本、预测阈值、持有期和滑点的敏感性分析显示,其风险—收益优势在不同设定下保持相对稳健。该研究发表在《The Journal of Finance and Data Science》。

**三、关键技术方法**

研究人员采用了多种关键技术方法开展研究。数据来源于RiceQuant/RQData,创业板指数代码为399,006.XSHE,共包含五个独立频率数据集。核心方法MTSE通过在不同步长及其组合下识别价格和指标序列中的局部极值,将连续序列转换为趋势事件集。研究者设置了三个单步长方案(1、2、4)和八个组合步长方案(1-1-1、1-2、1-4、1-1、2-1、1-2-1、4-1、1-4-1)。在此基础上构建决策表明细表,以已确认的收盘价转折事件为锚点,将决策点前可获得的成交量、RSI和BIAS最新已确认事件对齐至统一决策表。采用“最新已确认事件对齐”规则而非“最新发生事件对齐”规则以避免未来信息泄漏。标签基于未来8根K线的净收益(扣除双边交易成本后)定义。下游模型包括CatBoost(表格模型)、Transformer(序列模型)以及结合GAF/GADF成像与二维CNN(图像模型)。训练采用70%、15%、15%的时间顺序切分,使用三个随机种子(42、52、62)以降低模型随机性影响。

**四、研究结果**

**4.1 MTSE样本重构对样本表征的影响**

在样本量方面,MTSE处理显著改变了进入模型的样本数量。以1分钟数据为例,原始分支可构建905,701个连续滑动窗口样本,经单步长MTSE处理后平均样本数降至224,776个(保留率24.82%),组合步长MTSE处理后为353,231个(保留率39.00%)。在标签组织方面,MTSE分支的标签切换频率显著上升,例如15分钟数据中原始分支为15.20%,单步长MTSE升至29.76%,组合步长MTSE为27.04%。平均标签运行长度也相应缩短,表明MTSE改变了监督样本间的邻接关系和冗余结构。

**4.2 原始与MTSE输入下的预测结果**

总体结果显示,三类模型在MTSE输入下的F1、AUC、MCC和平衡准确率均高于原始输入。CatBoost的提升最为显著,F1从0.490增至0.662,AUC从0.581增至0.807,MCC从0.113增至0.473。Transformer在MTSE事件序列输入下也获得明显提升,MCC从0.068增至0.224。CNN的AUC从0.576增至0.692,但各指标提升幅度在不同时间粒度间存在异质性。配对统计检验表明,CatBoost全部四个指标的提升均通过显著性检验;Transformer四个指标的BH-FDR校正后q值均小于0.05;CNN仅有AUC达到显著水平。

**4.3 输入成分消融与MTSE方案异质性**

消融实验显示,仅保留事件值(ValueOnly)会导致三类模型性能明显下降,MCC分别降至0.055(CatBoost)、0.156(Transformer)、0.089(CNN),表明事件值与结构信息的结合对形成完整的MTSE输入表征至关重要。样本量控制(Raw-SampleControlled)和特征可比(Raw-FeatureComparable)两种对照组均未能达到MTSE-Full的性能水平,说明原始与MTSE的差异不能仅由样本量变化或输入特征数量解释。不同步长方案的结果表明,1-2方案对CatBoost和Transformer表现较好,CNN则在1-4方案下取得更强整体结果。

**4.4 回测结果与交易可用性分析**

在统一回测框架下,MTSE在15个模型-频率组合中的11个实现了更高净累计收益。在13个双方均产生有效交易指标的组合中,MTSE在10个组合中获得更高夏普比率和更小最大回撤。基准策略比较显示,MTSE模型信号的平均年化收益和夏普比率均高于买入持有、移动平均、动量、RSI及交易次数匹配的随机信号。敏感性分析表明,在交易成本从0增至20个基点、预测阈值从0.50变化至0.60、持有期从4根扩展至16根、滑点从0增至5个基点的条件下,MTSE相对原始流程的夏普差异均保持为正。

**五、讨论与结论**

**讨论部分总结**:研究对预测性能与交易表现之间的对应关系进行了分析。在45个MTSE运行中,37个有效运行的测试集MCC与夏普比率之间的Pearson相关系数为0.606,Spearman等级相关系数为0.580,均在1%水平上显著。这表明趋势结构样本重构不仅改善了模型的方向判别能力,而且这种改善能够转化为更优的风险调整后收益。但研究同时指出,预测指标的改善并不总是等比例地转化为交易表现,收益和风险指标仍然是对预测指标的重要补充。

**翻译研究结论部分**:总体而言,来自创业板指数多个时间粒度的证据得出以下主要结论:对于以强噪声和频繁局部切换为特征的股票时间序列,预测性能不仅受模型架构影响,还取决于原始序列如何被组织为具有趋势结构意义的信息单元。通过多步局部转折点提取,MTSE将连续价格路径转化为可学习、可对齐、可评估的趋势事件样本。决策表进一步将这些趋势事件组织为可用于多模型预测和回测分析的监督学习样本。通过这种方式,本文提供了一条从“原始序列建模”到“趋势结构样本建模”的实现路径。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号