Матрица вторых производных, описывающая локальную кривизну функции.
Ключевые тезисы
- Положительно определённый гессиан — локальный минимум.
- Число обусловленности объясняет медленную сходимость в оврагах.
- Методы второго порядка точны, но дороги: O(n²) памяти.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Кривизна и обусловленность
Почему оптимизация буксует в оврагах.
При оптимальный шаг вдоль «узкой» оси в сто раз меньше, чем вдоль «широкой». Единый learning rate вынужден ориентироваться на меньший — отсюда медленная сходимость и зигзаг.
2Методы второго порядка
Почему они точнее и почему их почти не используют.
- веса модели — то, что подбирается при обучении
- номер или количество: индекс шага, число соседей, кластеров или позиций
- функция, о которой идёт речь
- градиент: вектор частных производных
- Гессиан для модели с параметрами занимает памяти — для миллиона параметров это нереально.
- L-BFGS хранит лишь несколько последних векторов и приближает обратный гессиан; применим для небольших моделей и full-batch задач.
- K-FAC и Shampoo — приближения, которые иногда используют для больших сетей.
Связанные темы
Аппарат анализа · Градиенты и производные
Calculus97%
Математический анализ · ОсновыПроизводные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.
Gradient97%
Градиент · Математический справочникВектор частных производных, указывающий направление наибыстрейшего роста функции.
Backpropagation97%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Limits and Continuity85%
Пределы и непрерывность · Математический анализПредел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.
Derivative85%
Производная · Математический анализСкорость изменения функции: предел отношения приращения функции к приращению аргумента. Геометрически — наклон касательной.
Differentiation Rules85%
Правила дифференцирования · Математический анализСумма, произведение, частное и композиция — четыре правила, которых достаточно, чтобы продифференцировать почти любую функцию потерь вручную.
Taylor Series85%
Ряд Тейлора · Математический анализПриближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.
Multivariable Calculus85%
Многомерный анализ · Математический анализФункции многих переменных: частные производные, градиент, производная по направлению и линии уровня.
Jacobian85%
Якобиан · Математический анализМатрица частных производных векторной функции. Описывает, как преобразование растягивает пространство локально.
Lagrange Multipliers85%
Множители Лагранжа · Математический анализМетод условной оптимизации: минимизировать функцию при ограничениях, не решая их подстановкой.
Convexity85%
Выпуклость · Математический анализСвойство функции, гарантирующее единственность минимума и сходимость градиентных методов.
Numerical Differentiation85%
Численное дифференцирование · Математический анализПриближение производной конечными разностями: медленно и неточно, но незаменимо для проверки аналитических градиентов.
Series and Convergence85%
Ряды и сходимость · Математический анализКогда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.
Integral85%
Интеграл · Математический анализОпределённый интеграл — площадь под кривой, неопределённый — обратная операция к дифференцированию. В ML интеграл почти всегда означает математическое ожидание.
Differential Equations85%
Дифференциальные уравнения · Математический анализУравнения, связывающие функцию с её производными. Описывают динамику — от роста популяций до обратного процесса в диффузионных моделях.
Gradient Descent80%
Градиентный спуск · Оптимизация обученияИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
Numerical Methods80%
Численные методы · ОсновыКомпьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.