DCD: Decomposition-based Causal Discovery from Autocorrelated and Non-Stationary Temporal Data

TL;DR

提出基于分解的因果发现框架,利用趋势、季节和残差分量提升非平稳时间序列因果推断准确性。

cs.LG 🔴 高级 2026-02-02 52 次浏览
Muhammad Hasan Ferdous Md Osman Gani
因果发现 时间序列 非平稳 分解方法 多尺度分析

核心发现

方法论

本文提出一种结合时间序列分解与因果推断的框架,首先利用STL分解时间序列为趋势、季节和残差三部分。趋势部分通过ADF/KPSS检验识别长远依赖,季节部分采用HSIC检测周期性依赖,残差部分利用Constraint-based方法识别短期因果关系。三者的因果图通过算法融合,形成多尺度因果结构。该方法在理论上保证了在频谱可分离和有限泄漏条件下的可识别性,避免了传统方法中因趋势和季节性引入的虚假关联。

关键结果

  • 在合成数据集上,DCD在TPR达到0.79、FDR为0.38,明显优于PCMCI+和DYNOTEARS,尤其在强非平稳和高自相关情况下表现优越。实测中,DCD在复杂气候和电力数据中成功恢复真实因果结构,SHD指标低于竞争对手20%以上。
  • 在不同样本规模(500-1500)和不同变量数(4-10)条件下,DCD表现稳定,TPR维持在0.76-0.80,FDR仅升高至0.40左右。长滞后依赖的检测也优于基线方法,验证了多尺度融合的有效性。
  • 消融实验显示,单纯依赖趋势或季节分解均难以达到全局最优,结合多尺度信息显著提升了因果推断的准确率,验证了理论分析的有效性。

研究意义

该研究突破了非平稳时间序列因果推断的瓶颈,提供了理论保证和实证验证,极大改善了在气候、金融、医疗等领域的因果结构识别能力。通过多尺度分解,有效隔离了长短期因果关系,减少了虚假关联,增强了模型的解释性,为复杂系统的因果分析提供了新工具。

技术贡献

技术上,本文创新性地将频谱可分离性作为因果可识别的基础,结合STL分解和频域依赖检验,提出频谱分离的因果推断新框架。理论上,建立了在有限泄漏和高斯线性模型下的可识别性保证,推导了结构误差界。工程上,实现了多尺度因果图的高效融合,显著优于现有的单尺度方法。

新颖性

本研究首次系统性结合时间序列分解与因果发现,提出频谱可分离性条件下的多尺度因果推断框架。与传统Granger或Constraint-based方法不同,能有效应对趋势和季节性干扰,提供更准确的因果结构识别。创新点在于理论上的频谱可分离性保证和多尺度图融合机制。

局限性

  • 方法依赖频谱可分离性,若趋势或季节成分频带重叠,可能影响因果识别效果。
  • 在非线性或非高斯系统中,理论保证减弱,需扩展到非线性模型。
  • 计算成本较高,尤其在大规模多变量数据中,分解和多尺度推断耗时较长。

未来方向

未来将探索非线性和非高斯扩展,提升模型的普适性。同时,结合深度学习增强分解和依赖检测能力,优化算法效率。此外,考虑引入动态频谱调整机制,以应对复杂系统中的频谱变化,推动理论与应用的深度融合。

AI 总览摘要

在多领域如气候、金融和医疗中,时间序列数据普遍存在长短期趋势、季节性变化和短期波动,给因果推断带来巨大挑战。传统方法多在原始观测数据上操作,容易受到虚假关联和时间依赖误判的影响。为解决这一问题,本文提出一种基于分解的因果发现(DCD)框架,利用STL将时间序列分解为趋势、季节和残差三部分,分别进行因果推断。趋势部分通过ADF/KPSS检验识别长远依赖,季节部分采用HSIC检测周期性关系,残差部分利用Constraint-based方法识别短期因果关系。三者的因果图融合形成多尺度结构,有效隔离不同时间尺度的因果关系,减少虚假关联。实验证明,该方法在合成数据和真实气候、电力数据中均优于现有主流方法,尤其在强非平稳和高自相关条件下表现出色。该研究不仅在理论上提供频谱可分离性保证,还在实践中实现了高效、多尺度的因果结构识别,为复杂系统的因果分析提供了新工具。未来,将扩展到非线性系统,结合深度学习提升鲁棒性和效率,推动因果推断技术的广泛应用。

深度解读

原文摘要

Multivariate time series in domains such as finance, climate science, and healthcare often exhibit long-term trends, seasonal patterns, and short-term fluctuations, complicating causal inference under non-stationarity and autocorrelation. Existing causal discovery methods typically operate on raw observations, making them vulnerable to spurious edges and misattributed temporal dependencies. We introduce a decomposition-based causal discovery framework that separates each time series into trend, seasonal, and residual components and performs component-specific causal analysis. Trend components are assessed using stationarity tests, seasonal components using kernel-based dependence measures, and residual components using constraint-based causal discovery. The resulting component-level graphs are integrated into a unified multi-scale causal structure. This approach isolates long- and short-range causal effects, reduces spurious associations, and improves interpretability. Across extensive synthetic benchmarks and real-world climate data, our framework more accurately recovers ground-truth causal structure than state-of-the-art baselines, particularly under strong non-stationarity and temporal autocorrelation.

cs.LG cs.AI stat.ML