Type: concept
Confidence: 0.85
Created: 2026-04-16
Updated: 2026-04-16
Tags: 概率论深度学习时间序列

PatchTST

概述

PatchTST 由 IBM Research 于 2023 年提出(ICLR 2023),通过将时间序列分块(Patching)输入 Transformer,解决了此前 Transformer 处理时间序列时"语义贫乏"和"计算爆炸"两大痛点,是 Transformer时间序列领域的绝地反击。

关键内容

  1. 历史背景:2022 年 DLinear 论文证明简单线性模型可击败所有 Transformer 变体,Transformer 阵营士气低迷。IBM Research 团队回到根本问题:是否一开始就把数据喂错了?

  2. 核心洞察:此前 Transformer 将每个时间步视为一个 token(类似 NLP 中的词),但单个时间点信息量极其有限。PatchTST 将连续时间步打包为"块"(Patch),每个块包含多个时间步,信息量大幅提升。

  3. 三大创新

  4. Patching:将长度为 L 的序列分为 L/P 个块,每个块包含 P 个连续时间步,将 token 数量从 L 降至 L/P
  5. 通道独立:每个变量通道独立处理,不跨通道共享注意力,减少噪声干扰
  6. 语义丰富:每个 Patch 包含局部时序模式,类似 NLP 中一个词的语义

  7. 效果:在多个基准数据集上重新确立 Transformer 的 SOTA 地位,证明"不是 Transformer 不行,而是我们一直在用错误的方式喂数据"。

来源

相关