Classical Machine Learning
Классическое машинное обучение
От линейной регрессии до градиентного бустинга и кластеризации. Это рабочий инструментарий большинства продуктовых задач вне текста и изображений.
Linear Regressionактуально
Линейная регрессияПредсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.
Logistic Regressionактуально
Логистическая регрессияЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
Regularizationактуально
Регуляризацияиз «Оптимизация обучения»Любое ограничение сложности модели, снижающее переобучение.
k-NNклассика
Метод k ближайших соседейЛенивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.
SVMклассика
Метод опорных векторовИщет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.
GMMактуально
Смесь гауссианВероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.
Naive Bayesклассика
Наивный байесовский классификаторПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Decision Treesактуально
Решающие деревьяПоследовательность вопросов «признак > порог», разбивающая пространство на прямоугольные области.
Random Forestактуально
Случайный лесБэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.
Gradient Boostingактуально
Градиентный бустингПоследовательное построение деревьев, каждое из которых исправляет ошибки предыдущего ансамбля.
XGBoostактуально
XGBoostРеализация бустинга с регуляризацией в функции потерь, вторым порядком оптимизации и продуманной работой с разреженностью.
LightGBMактуально
LightGBMБыстрый бустинг от Microsoft: гистограммное разбиение и рост дерева по листьям вместо по уровням.
CatBoostактуально
CatBoostБустинг от Яндекса с упорядоченным кодированием категорий и упорядоченным бустингом против смещения.
Stacking and Blendingактуально
Стекинг и блендингАнсамбль из разнородных моделей, поверх которых обучается мета-модель. Стандартный приём соревнований и способ выжать последние проценты.
SHAPактуально
SHAPиз «Интерпретируемость моделей»Распределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.
k-Meansактуально
k-среднихРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
DBSCANактуально
DBSCANПлотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
HDBSCANактуально
HDBSCANиз «Обучение без учителя»Иерархическая версия DBSCAN: перебирает плотности автоматически и находит кластеры разной плотности.
Spectral Clusteringактуально
Спектральная кластеризацияиз «Обучение без учителя»Кластеризация через собственные векторы матрицы Лапласа графа сходства: находит невыпуклые и вложенные структуры.
PCAактуально
Метод главных компонентОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Dimensionality Reductionактуально
Снижение размерностииз «Обучение без учителя»Компактное представление данных, сохраняющее важную часть структуры.
Isolation Forestактуально
Isolation ForestОбнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.
Anomaly Detectionактуально
Поиск аномалийиз «Обучение без учителя»Выделение объектов, не похожих на основную массу данных, при отсутствии меток.
Loss functionsактуально
Функции потерьиз «Глубокое обучение»Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Log Lossактуально
Логарифмические потерииз «Метрики»Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
MSEактуально
Среднеквадратичная ошибкаиз «Метрики»Среднее квадратов ошибок: сильно штрафует большие отклонения.
MAEактуально
Средняя абсолютная ошибкаиз «Метрики»Среднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.
10 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.