Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.
Ключевые тезисы
- Без нелинейной активации любая глубина сворачивается в одно линейное преобразование.
- Глубина обычно эффективнее ширины при том же числе параметров.
- Используется как «голова» поверх свёрточных и трансформерных признаков.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Архитектура и размерности
Как считать число параметров и не запутаться в матрицах.
- предсказание модели
- истинное значение целевой переменной
- объект: вектор признаков
Вход 100 признаков, скрытые слои 64 и 32, выход 1. Параметров: , затем , затем — итого 8 545.
Теорема об универсальной аппроксимации говорит, что достаточно широкой сети с одним скрытым слоем хватит для приближения любой непрерывной функции. Но «достаточно широкой» может означать экспоненциально много нейронов — на практике глубина эффективнее ширины.
2Почему без активации всё разваливается
Композиция линейных слоёв — снова линейный слой.
Сколько бы слоёв вы ни поставили, без нелинейности между ними получится одна матрица. Именно активация делает глубину осмысленной.
Связанные темы
Нейросеть по кирпичикам
Perceptron80%
Перцептрон · Глубокое обучениеПростейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.
Activation functions80%
Функции активации · Глубокое обучениеНелинейности между слоями, без которых сеть не сложнее линейной модели.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Optimizers80%
Оптимизаторы · Глубокое обучениеПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Logistic Regression80%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.