Производные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.
- искомая чувствительность ошибки к весу
- суммирование по всем путям, через которые вес влияет на ошибку
- как ошибка зависит от выхода
- как выход зависит от веса
Ключевые тезисы
- Градиент — вектор частных производных, указывающий направление наибыстрейшего роста функции.
- Правило цепочки — основа обратного распространения ошибки в нейронных сетях.
- Матрица Гессе описывает кривизну и объясняет, почему одни функции потерь оптимизируются легко, а другие нет.
Подробный разбор
4 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Производная: скорость изменения ошибки
Что именно измеряет производная и почему без неё нельзя обучать модель.
- объект или аргумент функции
- функция, о которой идёт речь
- предел: к чему стремится выражение
- сходимость: выражение слева стремится к тому, что справа
В машинном обучении — это функция потерь, а — параметр модели. Производная отвечает на вопрос: «если чуть увеличить вес, ошибка вырастет или упадёт, и насколько быстро?» Знак подсказывает направление, модуль — величину шага.
Пусть . Тогда . В точке производная равна 6: ошибка растёт, надо двигаться влево. В точке производная равна нулю — мы в минимуме.
2Частные производные и градиент
Переход от одной переменной к миллиардам параметров.
Когда параметров много, производная берётся по каждому отдельно, остальные считаются константами. Собранные в вектор, эти частные производные образуют градиент.
- объект или аргумент функции
- функция, о которой идёт речь
- градиент: вектор частных производных
- частная производная — чувствительность к одному аргументу
. Тогда , . В точке градиент равен : по функция локально не меняется, по растёт со скоростью 1.
Главное свойство: градиент указывает направление наискорейшего роста функции. Значит, чтобы уменьшать ошибку, надо идти в противоположную сторону — отсюда минус в формуле градиентного спуска .
3Правило цепочки — двигатель обратного распространения
Как посчитать градиент по весу, который спрятан за десятком слоёв.
- истинное значение целевой переменной
- веса модели — то, что подбирается при обучении
- функция потерь либо рассматриваемая функция
- частная производная — чувствительность к одному аргументу
Нейросеть — это композиция функций: вход → слой → активация → слой → потери. Чтобы узнать вклад веса из первого слоя, производные перемножаются вдоль всего пути. Прямой проход запоминает промежуточные значения, обратный — перемножает локальные производные, идя справа налево.
- Если множители в среднем меньше единицы — градиент затухает, ранние слои почти не учатся.
- Если больше единицы — градиент взрывается, веса улетают в NaN; лечится обрезкой нормы градиента (clipping).
- Скип-связи ResNet добавляют путь с производной, равной единице: градиент доходит до начала сети без затухания.
4Вторая производная и кривизна
Почему одни функции оптимизируются за десять шагов, а другие за десять тысяч.
Градиент говорит о наклоне, гессиан — матрица вторых производных — о кривизне. Если поверхность потерь вытянута как узкий овраг, шаг, подходящий для одной оси, будет слишком большим для другой: спуск начинает зигзагом биться о стенки.
- истинное значение целевой переменной
- объект или аргумент функции
- частная производная — чувствительность к одному аргументу
Адаптивные оптимизаторы (Adam, RMSProp) — дешёвая замена методам второго порядка: они не считают гессиан, но подбирают свой масштаб шага для каждого параметра, что и лечит эффект оврага.
Связанные темы
Аппарат анализа · Градиенты и производные
Gradient97%
Градиент · Математический справочникВектор частных производных, указывающий направление наибыстрейшего роста функции.
Hessian97%
Гессиан · Математический справочникМатрица вторых производных, описывающая локальную кривизну функции.
Backpropagation97%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Limits and Continuity85%
Пределы и непрерывность · Математический анализПредел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.
Derivative85%
Производная · Математический анализСкорость изменения функции: предел отношения приращения функции к приращению аргумента. Геометрически — наклон касательной.
Differentiation Rules85%
Правила дифференцирования · Математический анализСумма, произведение, частное и композиция — четыре правила, которых достаточно, чтобы продифференцировать почти любую функцию потерь вручную.
Taylor Series85%
Ряд Тейлора · Математический анализПриближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.
Multivariable Calculus85%
Многомерный анализ · Математический анализФункции многих переменных: частные производные, градиент, производная по направлению и линии уровня.
Jacobian85%
Якобиан · Математический анализМатрица частных производных векторной функции. Описывает, как преобразование растягивает пространство локально.
Lagrange Multipliers85%
Множители Лагранжа · Математический анализМетод условной оптимизации: минимизировать функцию при ограничениях, не решая их подстановкой.
Convexity85%
Выпуклость · Математический анализСвойство функции, гарантирующее единственность минимума и сходимость градиентных методов.
Numerical Differentiation85%
Численное дифференцирование · Математический анализПриближение производной конечными разностями: медленно и неточно, но незаменимо для проверки аналитических градиентов.
Series and Convergence85%
Ряды и сходимость · Математический анализКогда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.
Integral85%
Интеграл · Математический анализОпределённый интеграл — площадь под кривой, неопределённый — обратная операция к дифференцированию. В ML интеграл почти всегда означает математическое ожидание.
Differential Equations85%
Дифференциальные уравнения · Математический анализУравнения, связывающие функцию с её производными. Описывают динамику — от роста популяций до обратного процесса в диффузионных моделях.
Gradient Descent80%
Градиентный спуск · Оптимизация обученияИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
Numerical Methods80%
Численные методы · ОсновыКомпьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.