Ищет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.
- минимизация нормы весов равносильна максимизации ширины зазора (она равна 2/‖w‖)
- штраф за нарушения зазора. Большое C — почти не прощаем ошибок, малое — широкий зазор ценой ошибок
Ключевые тезисы
- Решение определяется только опорными векторами на границе зазора.
- Ядра: линейное, полиномиальное, RBF; C и γ управляют компромиссом зазора и ошибок.
- Отлично работает на малых выборках высокой размерности, плохо масштабируется по числу объектов.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Отступ и максимальный зазор
Что значит «лучшая» разделяющая гиперплоскость.
Разделяющих прямых бесконечно много. SVM выбирает ту, что проходит максимально далеко от обоих классов: чем шире полоса, тем устойчивее классификатор к новым данным.
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- транспонирование: строка вместо столбца
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- норма — длина вектора
- транспонирование: строка вместо столбца
2Мягкий зазор и параметр C
Что делать, когда классы пересекаются.
- параметр C: цена нарушения зазора. Большое C — почти не прощаем ошибок
- переменная нарушения зазора: на сколько объект заходит внутрь полосы или за неё
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- число объектов в выборке
- суммирование по всем перечисленным элементам
- Большое — почти не прощаем ошибок, узкий зазор, риск переобучения.
- Малое — широкий зазор ценой ошибок, сильная регуляризация.
- Эквивалентная запись через hinge loss: .
3Ядровой трюк
Нелинейная граница без явного перехода в новое пространство.
Если классы разделены окружностью, в исходных признаках линейной границы нет. Но в признаках та же выборка становится линейно разделимой — граница превращается в прямую.
- параметр ядра RBF: радиус влияния объекта
- норма — длина вектора
- скалярное произведение: мера согласованности векторов
- экспонента
- задаёт «радиус влияния» объекта: большое — узкие островки вокруг точек, переобучение.
- и подбираются вместе, по логарифмической сетке.
- Сложность обучения — от до : на сотнях тысяч объектов SVM уже неудобен.
Связанные темы
Метрические и ядровые методы
k-NN65%
Метод k ближайших соседей · Классическое машинное обучениеЛенивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.
k-Means65%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
Distance65%
Расстояние · Математический справочникМера непохожести объектов — основа кластеризации, k-NN и поиска.
Norm65%
Норма · Математический справочникМера длины вектора; выбор нормы определяет геометрию задачи.
Normalization & Standardization65%
Нормализация и стандартизация · ДанныеПриведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.
Metric spaces65%
Метрические пространства · Топологический анализ данныхМножество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.