Discretizing Continuous Time Series for Imputation with Masked Diffusion Training

TL;DR

MDTIM模型通过离散化时间序列实现更高效的插补,提升了30%的准确性。

cs.LG 🔴 高级 2026-08-20 2 次浏览
Dongbin Kim Seungyun Lee Geonwoo Shin Jaewook Lee
时间序列 插补 离散化 扩散模型 机器学习

核心发现

方法论

MDTIM模型采用掩码扩散和随机离散化技术,将连续时间序列映射为离散符号,并通过期望解码实现精确插补。模型结构包括因子化时间-变量变换器,结合频谱一致性损失。

关键结果

  • MDTIM在Energy数据集上以0.044的MAE值超越CSDI的0.094,展示了其在复杂缺失模式下的鲁棒性。
  • 在ETTh数据集上,MDTIM在30%缺失率下的MAE为0.127,显著优于FGTI的0.218。
  • MDTIM在PhysioNet 2012数据集上表现出色,MAE为0.236,领先于SAITS的0.283。

研究意义

该研究通过创新的离散化方法,解决了时间序列插补中的结构分离问题,显著提升了插补精度和鲁棒性,对学术界和工业界具有重要意义。

技术贡献

MDTIM通过引入随机离散化和频谱一致性损失,突破了现有扩散模型的限制,实现了更精确的时间序列插补,提供了新的理论保证和工程可能性。

新颖性

MDTIM首次将掩码扩散应用于时间序列插补,采用随机离散化以保持序列的连续性,与现有方法相比具有显著创新。

局限性

  • 在极端缺失情况下,模型可能无法准确恢复原始信号。
  • 对于高维数据,计算成本较高。

未来方向

未来工作可探索MDTIM在更复杂的时间序列数据上的应用,并优化计算效率。

AI 总览摘要

时间序列插补是数据分析中的关键任务,但现有方法在处理复杂动态和噪声时表现不佳。MDTIM模型通过掩码扩散和随机离散化技术,解决了结构分离和噪声预测问题。模型采用因子化时间-变量变换器,并结合频谱一致性损失,实现了精确的插补。实验结果显示,MDTIM在多个数据集上均优于现有基线,展现了其在复杂缺失模式下的鲁棒性。该研究不仅提升了插补精度,还为时间序列分析提供了新的视角和方法。未来工作将进一步优化模型的计算效率,并探索其在更复杂数据上的应用。

深度分析

研究背景

时间序列插补是数据分析中的重要任务,旨在恢复部分观测数据中的原始信号。现有方法如RNN和Transformer在处理长距离依赖和复杂动态时表现有限,而扩散模型如CSDI则侧重于噪声预测。

核心问题

现有插补方法在处理缺失和观测值的结构分离时存在困难,且连续扩散模型通常预测噪声而非原始信号,导致插补精度下降。

核心创新

MDTIM通过掩码扩散和随机离散化技术实现了结构分离和精确插补。掩码扩散模型用特殊符号替换缺失值,随机离散化保持序列的连续性。

方法详解

  • �� 掩码扩散: 使用[MASK]符号替换缺失值,直接预测原始值。 • 随机离散化: 将连续值映射为离散符号,注入噪声以保持信息。 • 因子化变换器: 交替处理时间和变量轴,捕捉长距离依赖。 • 频谱一致性损失: 确保全局时间一致性。

实验设计

实验在Energy、ETTh、Weather等数据集上进行,采用不同缺失率和掩码机制。对比基线包括RNN、Transformer和扩散模型,评估插补精度和鲁棒性。

结果分析

MDTIM在Energy数据集上以0.044的MAE值超越CSDI的0.094,在ETTh数据集上表现优异,MAE为0.127。模型在PhysioNet 2012数据集上也取得了领先成绩。

应用场景

MDTIM可用于传感器故障数据恢复、金融市场分析等场景,提升数据分析的准确性和可靠性。

局限与展望

模型在极端缺失情况下可能表现不佳,计算成本较高,需进一步优化。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,食材代表时间序列数据,而一些食材丢失了。MDTIM就像一个聪明的厨师,通过观察现有食材和烹饪步骤,推测出丢失的食材是什么,并将它们补回去。它使用一种特殊的方法来确保即使在食材不完整的情况下,最终的菜肴仍然美味可口。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个拼图游戏,但有些拼图块丢失了。MDTIM就像一个超级聪明的拼图大师,它能根据剩下的拼图块猜出丢失的块是什么样子,然后把它们补上去。这样,你的拼图就完整啦!是不是很酷?

术语表

掩码扩散模型

一种通过替换缺失值为特殊符号并预测原始值的模型。

用于时间序列插补任务中,提供结构分离。

随机离散化

将连续值映射为离散符号并注入噪声以保持信息的方法。

用于保持时间序列的连续性。

因子化变换器

一种交替处理时间和变量轴的变换器结构。

用于捕捉长距离依赖。

频谱一致性损失

一种确保全局时间一致性的损失函数。

用于保持时间序列的频率结构。

期望解码

通过预测的概率分布计算连续值的方法。

用于精确插补。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化MDTIM的计算效率以处理更大规模的数据集?
  • 2 在极端缺失情况下,如何提高模型的插补精度?

应用场景

近期应用

传感器故障数据恢复

MDTIM可用于恢复传感器故障导致的数据缺失,提升数据分析的准确性。

金融市场分析

通过精确插补,MDTIM可用于分析金融市场数据,预测趋势。

远期愿景

复杂动态系统监测

MDTIM可应用于复杂动态系统的实时监测,提供更可靠的数据支持。

原文摘要

Time series imputation is a crucial area for reliable time series analysis, yet it remains challenging due to the complex temporal dynamics and noise of real-world data. Existing approaches, however, exhibit two limitations: missing and observed values are embedded within the same representation space without explicit structural separation, and continuous diffusion-based methods are trained to predict added noise rather than the original signal. To address these, we propose the Masked Diffusion Time-series Imputation Model (MDTIM), which leverages the training paradigm of masked diffusion model for imputation tasks. The MASK token is structurally orthogonal to valid observations, and the model directly predicts the original values, naturally aligning both the representation and the learning objective with the imputation task. To bridge the gap between discrete masked diffusion and the continuous, ordinal nature of time series, we further introduce Stochastic Discretization, which maps continuous values to ordinal-aware tokens while preserving continuous dynamics. Our experiments on diverse benchmarks confirm that MDTIM achieves superior robustness and scalability, consistently outperforming state-of-the-art deterministic and generative baselines across various missing scenarios.

cs.LG cs.AI