Основы

Calculus

Математический анализ

актуальноТекущий рабочий стандарт

Производные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.

Что означает каждый компонент
  • искомая чувствительность ошибки к весу
  • суммирование по всем путям, через которые вес влияет на ошибку
  • как ошибка зависит от выхода
  • как выход зависит от веса

Ключевые тезисы

  • Градиент — вектор частных производных, указывающий направление наибыстрейшего роста функции.
  • Правило цепочки — основа обратного распространения ошибки в нейронных сетях.
  • Матрица Гессе описывает кривизну и объясняет, почему одни функции потерь оптимизируются легко, а другие нет.
Тема также относится к главам:Математический анализОсновы

Подробный разбор

4 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Производная: скорость изменения ошибки

Что именно измеряет производная и почему без неё нельзя обучать модель.

Обозначения
  • объект или аргумент функции
  • функция, о которой идёт речь
  • предел: к чему стремится выражение
  • сходимость: выражение слева стремится к тому, что справа
Производная — предел отношения приращений: наклон касательной в точке

В машинном обучении — это функция потерь, а — параметр модели. Производная отвечает на вопрос: «если чуть увеличить вес, ошибка вырастет или упадёт, и насколько быстро?» Знак подсказывает направление, модуль — величину шага.

Пример

Пусть . Тогда . В точке производная равна 6: ошибка растёт, надо двигаться влево. В точке производная равна нулю — мы в минимуме.

-6-226100204060wL(w)минимум
шаг обучения η0.20
текущий x1.767
f(x)1.054
градиент-0.467
статусидёт
Двигайте скорость обучения: при малой η спуск медленный, при большой — перелёт через минимум и расходимость
2

Частные производные и градиент

Переход от одной переменной к миллиардам параметров.

Когда параметров много, производная берётся по каждому отдельно, остальные считаются константами. Собранные в вектор, эти частные производные образуют градиент.

Обозначения
  • объект или аргумент функции
  • функция, о которой идёт речь
  • градиент: вектор частных производных
  • частная производная — чувствительность к одному аргументу
Считаем руками

. Тогда , . В точке градиент равен : по функция локально не меняется, по растёт со скоростью 1.

Главное свойство: градиент указывает направление наискорейшего роста функции. Значит, чтобы уменьшать ошибку, надо идти в противоположную сторону — отсюда минус в формуле градиентного спуска .

3

Правило цепочки — двигатель обратного распространения

Как посчитать градиент по весу, который спрятан за десятком слоёв.

Обозначения
  • истинное значение целевой переменной
  • веса модели — то, что подбирается при обучении
  • функция потерь либо рассматриваемая функция
  • частная производная — чувствительность к одному аргументу
Производная композиции — произведение производных звеньев

Нейросеть — это композиция функций: вход → слой → активация → слой → потери. Чтобы узнать вклад веса из первого слоя, производные перемножаются вдоль всего пути. Прямой проход запоминает промежуточные значения, обратный — перемножает локальные производные, идя справа налево.

  • Если множители в среднем меньше единицы — градиент затухает, ранние слои почти не учатся.
  • Если больше единицы — градиент взрывается, веса улетают в NaN; лечится обрезкой нормы градиента (clipping).
  • Скип-связи ResNet добавляют путь с производной, равной единице: градиент доходит до начала сети без затухания.
4

Вторая производная и кривизна

Почему одни функции оптимизируются за десять шагов, а другие за десять тысяч.

Градиент говорит о наклоне, гессиан — матрица вторых производных — о кривизне. Если поверхность потерь вытянута как узкий овраг, шаг, подходящий для одной оси, будет слишком большим для другой: спуск начинает зигзагом биться о стенки.

Обозначения
  • истинное значение целевой переменной
  • объект или аргумент функции
  • частная производная — чувствительность к одному аргументу
На практике

Адаптивные оптимизаторы (Adam, RMSProp) — дешёвая замена методам второго порядка: они не считают гессиан, но подбирают свой масштаб шага для каждого параметра, что и лечит эффект оврага.

методSGD
шагов сделано30
f(x, y)0.2153
‖(x, y)‖0.656
Оптимизатор
Один и тот же овраг: SGD зигзагует, momentum разгоняется вдоль дна, Adam выравнивает масштаб по осям

Связанные темы

Аппарат анализа · Градиенты и производные

Gradient97%

Градиент · Математический справочник

Вектор частных производных, указывающий направление наибыстрейшего роста функции.

Hessian97%

Гессиан · Математический справочник

Матрица вторых производных, описывающая локальную кривизну функции.

Backpropagation97%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Limits and Continuity85%

Пределы и непрерывность · Математический анализ

Предел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.

Derivative85%

Производная · Математический анализ

Скорость изменения функции: предел отношения приращения функции к приращению аргумента. Геометрически — наклон касательной.

Differentiation Rules85%

Правила дифференцирования · Математический анализ

Сумма, произведение, частное и композиция — четыре правила, которых достаточно, чтобы продифференцировать почти любую функцию потерь вручную.

Taylor Series85%

Ряд Тейлора · Математический анализ

Приближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.

Multivariable Calculus85%

Многомерный анализ · Математический анализ

Функции многих переменных: частные производные, градиент, производная по направлению и линии уровня.

Jacobian85%

Якобиан · Математический анализ

Матрица частных производных векторной функции. Описывает, как преобразование растягивает пространство локально.

Lagrange Multipliers85%

Множители Лагранжа · Математический анализ

Метод условной оптимизации: минимизировать функцию при ограничениях, не решая их подстановкой.

Convexity85%

Выпуклость · Математический анализ

Свойство функции, гарантирующее единственность минимума и сходимость градиентных методов.

Numerical Differentiation85%

Численное дифференцирование · Математический анализ

Приближение производной конечными разностями: медленно и неточно, но незаменимо для проверки аналитических градиентов.

Series and Convergence85%

Ряды и сходимость · Математический анализ

Когда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.

Integral85%

Интеграл · Математический анализ

Определённый интеграл — площадь под кривой, неопределённый — обратная операция к дифференцированию. В ML интеграл почти всегда означает математическое ожидание.

Differential Equations85%

Дифференциальные уравнения · Математический анализ

Уравнения, связывающие функцию с её производными. Описывают динамику — от роста популяций до обратного процесса в диффузионных моделях.

Gradient Descent80%

Градиентный спуск · Оптимизация обучения

Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.

Numerical Methods80%

Численные методы · Основы

Компьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.