Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
Ключевые тезисы
- Patch-подход режет ряд на окна-токены, снижая вычислительную стоимость.
- TFT добавляет интерпретируемость через веса внимания и отбор признаков.
- На коротких рядах простые бейзлайны всё ещё конкурентоспособны.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Трансформерные модели прогноза
Что изменили Informer, Autoformer, PatchTST и TFT.
| Модель | Ключевая идея |
|---|---|
| Informer | разреженное внимание — снижает |
| Autoformer | декомпозиция на тренд и сезонность внутри модели |
| PatchTST | ряд режется на патчи-окна, как изображение в ViT |
| TFT | интерпретируемость: веса внимания и отбор признаков |
Важная отрезвляющая работа: на многих стандартных бенчмарках простая линейная модель (DLinear) обыгрывает сложные трансформеры. Всегда сравнивайте с сильным простым бейзлайном.
2Обязательные бейзлайны
С чем сравнивать, прежде чем радоваться.
| Бейзлайн | Формула |
|---|---|
| Наивный | |
| Сезонный наивный | |
| Скользящее среднее | |
| Линейная модель на лагах | обычная регрессия |
Работа «Are Transformers Effective for Time Series Forecasting?» показала, что на ряде популярных бенчмарков простая линейная модель обходит сложные трансформеры. Это не приговор архитектуре, но обязательная проверка.
Связанные темы
Внимание и трансформеры · Прогнозирование рядов
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformers85%
Трансформеры · Глубокое обучениеАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Attention85%
Внимание в NLP · Обработка естественного языкаИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Transformers85%
Трансформеры в NLP · Обработка естественного языкаОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPT85%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Vision Transformers85%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
LLM85%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Stationarity85%
Стационарность · Временные рядыПостоянство статистических свойств ряда во времени — предпосылка большинства классических моделей.
Autocorrelation85%
Автокорреляция · Временные рядыСвязь ряда с собственными прошлыми значениями — главный источник признаков и диагностики.
AR / MA / ARIMA85%
AR / MA / ARIMA · Временные рядыКлассическое семейство: авторегрессия, скользящее среднее ошибок и их комбинация с дифференцированием.
SARIMA85%
SARIMA · Временные рядыARIMA с явными сезонными компонентами — для рядов с недельной, месячной или годовой периодикой.
Exponential Smoothing85%
Экспоненциальное сглаживание · Временные рядыВзвешивание прошлых наблюдений с экспоненциально убывающими весами; модель Хольта — Винтерса добавляет тренд и сезонность.
Prophet85%
Prophet · Временные рядыАддитивная модель тренда, сезонностей и праздников с упором на удобство для аналитика.
Feature-based forecasting85%
Прогноз через признаки · Временные рядыРяд превращается в табличную задачу: лаги, скользящие статистики, календарь — и дальше градиентный бустинг.
RNN/LSTM85%
RNN/LSTM для рядов · Временные рядыНейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.