Раздел 03

Classical Machine Learning

Классическое машинное обучение

От линейной регрессии до градиентного бустинга и кластеризации. Это рабочий инструментарий большинства продуктовых задач вне текста и изображений.

новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Linear Regressionактуально

Линейная регрессия

Предсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.

Logistic Regressionактуально

Логистическая регрессия

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

Regularizationактуально

Регуляризацияиз «Оптимизация обучения»

Любое ограничение сложности модели, снижающее переобучение.

k-NNклассика

Метод k ближайших соседей

Ленивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.

SVMклассика

Метод опорных векторов

Ищет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.

GMMактуально

Смесь гауссиан

Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.

Naive Bayesклассика

Наивный байесовский классификатор

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Decision Treesактуально

Решающие деревья

Последовательность вопросов «признак > порог», разбивающая пространство на прямоугольные области.

Random Forestактуально

Случайный лес

Бэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.

Gradient Boostingактуально

Градиентный бустинг

Последовательное построение деревьев, каждое из которых исправляет ошибки предыдущего ансамбля.

XGBoostактуально

XGBoost

Реализация бустинга с регуляризацией в функции потерь, вторым порядком оптимизации и продуманной работой с разреженностью.

LightGBMактуально

LightGBM

Быстрый бустинг от Microsoft: гистограммное разбиение и рост дерева по листьям вместо по уровням.

CatBoostактуально

CatBoost

Бустинг от Яндекса с упорядоченным кодированием категорий и упорядоченным бустингом против смещения.

Stacking and Blendingактуально

Стекинг и блендинг

Ансамбль из разнородных моделей, поверх которых обучается мета-модель. Стандартный приём соревнований и способ выжать последние проценты.

SHAPактуально

SHAPиз «Интерпретируемость моделей»

Распределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.

k-Meansактуально

k-средних

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

DBSCANактуально

DBSCAN

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

HDBSCANактуально

HDBSCANиз «Обучение без учителя»

Иерархическая версия DBSCAN: перебирает плотности автоматически и находит кластеры разной плотности.

Spectral Clusteringактуально

Спектральная кластеризацияиз «Обучение без учителя»

Кластеризация через собственные векторы матрицы Лапласа графа сходства: находит невыпуклые и вложенные структуры.

PCAактуально

Метод главных компонент

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Dimensionality Reductionактуально

Снижение размерностииз «Обучение без учителя»

Компактное представление данных, сохраняющее важную часть структуры.

Isolation Forestактуально

Isolation Forest

Обнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.

Anomaly Detectionактуально

Поиск аномалийиз «Обучение без учителя»

Выделение объектов, не похожих на основную массу данных, при отсутствии меток.

Loss functionsактуально

Функции потерьиз «Глубокое обучение»

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Log Lossактуально

Логарифмические потерииз «Метрики»

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

MSEактуально

Среднеквадратичная ошибкаиз «Метрики»

Среднее квадратов ошибок: сильно штрафует большие отклонения.

MAEактуально

Средняя абсолютная ошибкаиз «Метрики»

Среднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.

10 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.