Глубокое обучение

GRU

GRU

классикаТо же, что и LSTM: ниша лёгких последовательных моделей.

Упрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.

Ключевые тезисы

  • Меньше параметров, быстрее обучение при сопоставимом качестве.
  • Часто выигрывает на небольших выборках.
  • Выбор между GRU и LSTM почти всегда решается экспериментом.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

GRU против LSTM

Два вентиля вместо трёх — что теряется и что выигрывается.

Обозначения
  • сигмоида: сжимает число в интервал от 0 до 1
  • награда, полученная агентом на шаге
  • объект: вектор признаков
Update gate одновременно играет роль forget и input
LSTMGRU
Вентилей32
Отдельное состояние ячейкиестьнет
Параметровбольше на ~33%меньше
Когда лучшедлинные зависимости, много данныхмалые выборки, ограничения по скорости
2

Как выбрать между GRU и LSTM

Ответ почти всегда даёт эксперимент, но есть ориентиры.

  • Мало данных или жёсткие ограничения по скорости — начните с GRU.
  • Очень длинные зависимости и большой корпус — LSTM чаще выигрывает.
  • Разница в качестве обычно в пределах 1–2%, разница в скорости — до 25%.
  • Если задача допускает параллелизм и данных много, сравните обе с трансформерным бейзлайном.

Связанные темы

Последовательные модели

RNN80%

Рекуррентные сети · Глубокое обучение

Обрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.

LSTM80%

LSTM · Глубокое обучение

Рекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.

RNN/LSTM for NLP80%

RNN/LSTM в NLP · Обработка естественного языка

Первое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.

Sequence-to-Sequence80%

Seq2Seq · Обработка естественного языка

Схема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.

RNN/LSTM80%

RNN/LSTM для рядов · Временные ряды

Нейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.