Глубокое обучение

Perceptron

Перцептрон

классикаИсторическая основа; практического применения сегодня нет.

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

Ключевые тезисы

  • Обучается правилом коррекции ошибки и сходится только на линейно разделимых данных.
  • Неспособность решить XOR стала причиной первой «зимы ИИ».
  • Ограничение снимается добавлением скрытого слоя.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Модель нейрона

Взвешенная сумма входов и порог — минимальная обучаемая единица.

Обозначения
  • истинное значение целевой переменной
  • объект: вектор признаков
  • веса модели — то, что подбирается при обучении
  • транспонирование: строка вместо столбца

Перцептрон Розенблатта (1958) обучался простым правилом: если объект классифицирован неверно, веса сдвигаются в его сторону: . Для линейно разделимой выборки алгоритм гарантированно сходится за конечное число шагов.

2

Проблема XOR

Почему одного слоя принципиально недостаточно.

XOR
000
011
101
110

Ни одна прямая не отделит пары от . Минский и Пейперт показали это в 1969-м, и интерес к нейросетям упал на десятилетие.

На практике

Решение — скрытый слой: два нейрона строят новые признаки (например, «хотя бы один» и «оба»), в которых задача становится линейно разделимой. Это ровно та же идея, что и ядровой трюк в SVM.

Связанные темы

Нейросеть по кирпичикам

MLP80%

Многослойный перцептрон · Глубокое обучение

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

Activation functions80%

Функции активации · Глубокое обучение

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Optimizers80%

Оптимизаторы · Глубокое обучение

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Logistic Regression80%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.