Глубокое обучение

LSTM

LSTM

классикаИспользуются в лёгких моделях и на устройствах; в новых проектах чаще трансформер.

Рекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.

Ключевые тезисы

  • Вентили входа, забывания и выхода управляют потоком информации в cell state.
  • Аддитивный путь состояния позволяет градиенту течь через сотни шагов.
  • До трансформеров — стандарт для перевода, речи и временных рядов.
Тема также относится к главам:Временные рядыML-подходы

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Три вентиля и состояние ячейки

Что именно решает каждый вентиль.

Обозначения
  • сигмоида: сжимает число в интервал от 0 до 1
  • объект: вектор признаков
Состояние ячейки обновляется аддитивно — отсюда и долгая память
  • Forget gate решает, что стереть из памяти.
  • Input gate — что записать.
  • Output gate — что показать наружу на этом шаге.

Ключевой момент: обновляется сложением, а не умножением на матрицу. Градиент течёт по этому пути почти без затухания — это тот же принцип, что и скип-связи в ResNet.

2

Практика обучения LSTM

Что настраивают и какие грабли встречаются.

  • Обрезка градиента по норме (1.0–5.0) обязательна: без неё обучение периодически взрывается.
  • Инициализация forget gate смещением +1 помогает сети сразу «помнить» и ускоряет старт.
  • Dropout применяют между слоями и как recurrent dropout, но не к самому состоянию ячейки напрямую.
  • Длина развёртки (truncated BPTT) — компромисс между памятью и объёмом контекста.

Связанные темы

Последовательные модели

RNN80%

Рекуррентные сети · Глубокое обучение

Обрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.

GRU80%

GRU · Глубокое обучение

Упрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.

RNN/LSTM for NLP80%

RNN/LSTM в NLP · Обработка естественного языка

Первое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.

Sequence-to-Sequence80%

Seq2Seq · Обработка естественного языка

Схема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.

RNN/LSTM80%

RNN/LSTM для рядов · Временные ряды

Нейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.