Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Ключевые тезисы
- MSE и MAE для регрессии, кросс-энтропия для классификации, Huber как компромисс.
- Focal loss и веса классов борются с сильным дисбалансом.
- Контрастные потери (InfoNCE, triplet) учат пространство представлений, а не метку.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как выбрать функцию потерь
Соответствие задаче важнее любых архитектурных ухищрений.
| Задача | Потери | Комментарий |
|---|---|---|
| Регрессия | MSE / MAE / Huber | MAE устойчивее к выбросам |
| Бинарная классификация | BCE (log loss) | используйте версию с логитами |
| Многоклассовая | Cross-Entropy | включает softmax внутри |
| Сильный дисбаланс | Focal loss | снижает вклад лёгких примеров |
| Метрическое обучение | Triplet, InfoNCE | учит пространство, а не метку |
2Дисбаланс и focal loss
Когда 99% объектов — лёгкий отрицательный класс.
- коэффициент, задающий вес слагаемого или скорость обновления
- коэффициент, управляющий вкладом дальних членов
- вероятность (или плотность распределения)
- логарифм: превращает произведения в суммы и сжимает масштаб
При формула вырождается в обычную кросс-энтропию. Типичное значение : лёгкий пример с получает вес в 100 раз меньше, чем трудный с .
Связанные темы
Редкие классы и события · Нейросеть по кирпичикам · Качество регрессии
Imbalanced Data80%
Дисбаланс классов · ДанныеКогда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.
Isolation Forest80%
Isolation Forest · Классическое машинное обучениеОбнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.
Anomaly Detection80%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
PR-AUC80%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCC80%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Extreme Value Theory80%
Теория экстремальных значений · Теория вероятностей и распределенияАппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.
Perceptron80%
Перцептрон · Глубокое обучениеПростейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.
MLP80%
Многослойный перцептрон · Глубокое обучениеНесколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.
Activation functions80%
Функции активации · Глубокое обучениеНелинейности между слоями, без которых сеть не сложнее линейной модели.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Optimizers80%
Оптимизаторы · Глубокое обучениеПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Logistic Regression80%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
MAE80%
Средняя абсолютная ошибка · МетрикиСреднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.
MSE80%
Среднеквадратичная ошибка · МетрикиСреднее квадратов ошибок: сильно штрафует большие отклонения.
RMSE80%
Корень из среднеквадратичной ошибки · МетрикиКорень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.
MAPE80%
Средняя абсолютная процентная ошибка · МетрикиОтносительная ошибка в процентах — удобна для сравнения рядов разного масштаба.
SMAPE80%
Симметричная MAPE · МетрикиВариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.
R²80%
Коэффициент детерминации · МетрикиДоля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.
Adjusted R²80%
Скорректированный R² · МетрикиR² со штрафом за число признаков — падает, если новый признак не приносит пользы.
Linear Regression80%
Линейная регрессия · Классическое машинное обучениеПредсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.