Вектор частных производных, указывающий направление наибыстрейшего роста функции.
- частная производная по первому параметру: как изменится функция, если чуть увеличить только его
- то же по последнему. Вектор из всех таких производных указывает направление наискорейшего роста
Ключевые тезисы
- Обучение = движение против градиента функции потерь.
- В минимуме градиент равен нулю.
- Нулевой или взрывной градиент — типичная причина, почему сеть не учится.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Свойства градиента
Три факта, которые нужно помнить.
- Указывает направление наискорейшего роста; шаг делается против него.
- Перпендикулярен линиям уровня функции.
- В точке минимума равен нулю — но нулевой градиент бывает и в седле, и в максимуме.
2Автоматическое дифференцирование
Как фреймворки считают градиенты.
Autograd строит граф операций во время прямого прохода, а затем обходит его в обратном порядке, применяя правило цепочки. Это не численное дифференцирование (нет ошибки аппроксимации) и не символьное (нет разрастания выражений).
x = torch.tensor([2.0], requires_grad=True)
y = x ** 3 + 2 * x
y.backward()
print(x.grad) # 3x² + 2 = 14Связанные темы
Аппарат анализа · Градиенты и производные
Calculus97%
Математический анализ · ОсновыПроизводные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.
Hessian97%
Гессиан · Математический справочникМатрица вторых производных, описывающая локальную кривизну функции.
Backpropagation97%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Limits and Continuity85%
Пределы и непрерывность · Математический анализПредел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.
Derivative85%
Производная · Математический анализСкорость изменения функции: предел отношения приращения функции к приращению аргумента. Геометрически — наклон касательной.
Differentiation Rules85%
Правила дифференцирования · Математический анализСумма, произведение, частное и композиция — четыре правила, которых достаточно, чтобы продифференцировать почти любую функцию потерь вручную.
Taylor Series85%
Ряд Тейлора · Математический анализПриближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.
Multivariable Calculus85%
Многомерный анализ · Математический анализФункции многих переменных: частные производные, градиент, производная по направлению и линии уровня.
Jacobian85%
Якобиан · Математический анализМатрица частных производных векторной функции. Описывает, как преобразование растягивает пространство локально.
Lagrange Multipliers85%
Множители Лагранжа · Математический анализМетод условной оптимизации: минимизировать функцию при ограничениях, не решая их подстановкой.
Convexity85%
Выпуклость · Математический анализСвойство функции, гарантирующее единственность минимума и сходимость градиентных методов.
Numerical Differentiation85%
Численное дифференцирование · Математический анализПриближение производной конечными разностями: медленно и неточно, но незаменимо для проверки аналитических градиентов.
Series and Convergence85%
Ряды и сходимость · Математический анализКогда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.
Integral85%
Интеграл · Математический анализОпределённый интеграл — площадь под кривой, неопределённый — обратная операция к дифференцированию. В ML интеграл почти всегда означает математическое ожидание.
Differential Equations85%
Дифференциальные уравнения · Математический анализУравнения, связывающие функцию с её производными. Описывают динамику — от роста популяций до обратного процесса в диффузионных моделях.
Gradient Descent80%
Градиентный спуск · Оптимизация обученияИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
Numerical Methods80%
Численные методы · ОсновыКомпьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.