Классическое машинное обучение

Logistic Regression

Логистическая регрессия

актуальноТекущий рабочий стандарт

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

Что означает каждый компонент
  • вероятность положительного класса для объекта x
  • сигмоида: сжимает любое число в отрезок от 0 до 1
  • логит — линейная комбинация признаков; при z = 0 вероятность ровно 0.5

Ключевые тезисы

  • Обучается минимизацией логистических потерь (кросс-энтропии).
  • Даёт хорошо откалиброванные вероятности — редкое и ценное свойство.
  • Остаётся стандартным бейзлайном в скоринге и медицине из-за интерпретируемости.

Подробный разбор

3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

От регрессии к вероятности

Почему нельзя просто предсказывать 0 и 1 линейной моделью.

Линейная функция принимает любые значения, а вероятность обязана лежать в . Сигмоида — монотонное отображение всей прямой в этот отрезок, поэтому её и надевают поверх линейной комбинации.

Обозначения
  • сигмоида: сжимает число в интервал от 0 до 1
  • истинное значение целевой переменной
  • объект: вектор признаков
  • веса модели — то, что подбирается при обучении
  • вероятность (или плотность распределения)
  • транспонирование: строка вместо столбца
  • экспонента

Граница решения задаётся условием , то есть — это гиперплоскость. Значит, логистическая регрессия остаётся линейным классификатором, несмотря на нелинейную сигмоиду.

-8-40480.00.51.0xp
p(y=1|x)0.818
логит wx+b1.50
граница (p=0.5)0.00
предсказаниекласс 1
Меняйте $w$: чем он больше, тем резче переход — модель становится увереннее вблизи границы
2

Почему не MSE, а log loss

Вывод функции потерь из принципа максимального правдоподобия.

Считаем, что ответы порождены распределением Бернулли с параметром . Правдоподобие выборки — произведение вероятностей; логарифм превращает его в сумму, а минус — в задачу минимизации.

Обозначения
  • истинное значение целевой переменной
  • веса модели — то, что подбирается при обучении
  • число объектов в выборке
  • вероятность (или плотность распределения)
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • логарифм: превращает произведения в суммы и сжимает масштаб
Логистические потери = отрицательное логарифмическое правдоподобие
  • MSE с сигмоидой даёт невыпуклую задачу и почти нулевые градиенты при насыщении — обучение застревает.
  • Log loss выпукла по : есть единственный минимум.
  • Градиент получается предельно простым: .
-3-1130246ошибка y − ŷпотериMSEMAEHuber
MSE4.00
MAE2.00
Huber1.50
Задача
Переключитесь на «Классификацию»: log loss штрафует уверенную ошибку неограниченно, в отличие от 0-1
3

Порог и работа с дисбалансом

Модель выдаёт вероятность — решение принимаете вы.

Порог 0.5 не священен. Он оптимален только если ошибки FP и FN стоят одинаково и классы сбалансированы. В скоринге, медицине и фроде это почти никогда не так.

Обозначения
  • ложные срабатывания: модель сказала «да», а это неправда
  • пропуски: модель сказала «нет», а объект был положительным
  • параметр C: цена нарушения зазора. Большое C — почти не прощаем ошибок
Оптимальный порог при известных стоимостях ошибок
  • class_weight="balanced" перевзвешивает классы обратно их частоте.
  • Порог подбирается по валидации под нужный recall или под максимум F1 — но никогда по тесту.
  • После перевзвешивания вероятности перестают быть калиброванными: если нужны честные вероятности, калибруйте отдельно.
0.000.250.500.751.00оценка моделипорогкласс 0класс 1
Precision0.941
Recall0.841
F10.888
Accuracy0.936
TP / FP / FN252 / 16 / 48
Двигайте порог: precision и recall всегда идут в противоположные стороны

Связанные темы

Качество вероятностей · Нейросеть по кирпичикам · Объяснение предсказаний · Качество классификации

Log Loss98%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

Calibration98%

Калибровка · Оценка моделей

Соответствие предсказанных вероятностей реальным частотам событий.

Brier Score85%

Brier Score · Метрики

Среднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.

Perplexity85%

Перплексия · Метрики

Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.

SHAP85%

SHAP · Интерпретируемость моделей

Распределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.

LIME85%

LIME · Интерпретируемость моделей

Локальная аппроксимация сложной модели простой линейной в окрестности конкретного объекта.

Partial Dependence85%

Partial Dependence Plot · Интерпретируемость моделей

Показывает средний эффект признака на предсказание при усреднении по остальным признакам.

ICE85%

ICE-кривые · Интерпретируемость моделей

Individual Conditional Expectation: та же зависимость, но отдельной линией для каждого объекта.

Counterfactual explanations85%

Контрфактические объяснения · Интерпретируемость моделей

Минимальное изменение входа, которое меняет решение модели: «что нужно поменять, чтобы кредит одобрили».

Permutation Importance85%

Перестановочная важность · Интерпретируемость моделей

Признак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.

Accuracy85%

Доля правильных ответов · Метрики

Доля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.

Precision85%

Точность · Метрики

Какая доля объектов, предсказанных положительными, действительно положительна.

Recall85%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.

F185%

F1-мера · Метрики

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

ROC-AUC85%

ROC-AUC · Метрики

Вероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.

PR-AUC85%

PR-AUC · Метрики

Площадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.

MCC85%

Коэффициент Мэтьюса · Метрики

Корреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.

Perceptron80%

Перцептрон · Глубокое обучение

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

MLP80%

Многослойный перцептрон · Глубокое обучение

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

Activation functions80%

Функции активации · Глубокое обучение

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Optimizers80%

Оптимизаторы · Глубокое обучение

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.