Мера непохожести объектов — основа кластеризации, k-NN и поиска.
Ключевые тезисы
- Евклидово, манхэттенское, косинусное, Махаланобиса, Хэмминга.
- Косинусное расстояние игнорирует длину вектора — удобно для текста.
- Расстояние Махаланобиса учитывает корреляции признаков.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Какое расстояние выбрать
Выбор метрики важнее выбора алгоритма.
| Метрика | Формула | Когда |
|---|---|---|
| Евклидова | числовые признаки после стандартизации | |
| Манхэттенская | разреженные данные, устойчивость к выбросам | |
| Косинусная | тексты, эмбеддинги | |
| Хэмминга | число различий | бинарные и категориальные |
| Махаланобиса | коррелированные признаки |
, : манхэттенское , евклидово .
2Обучаемые метрики
Когда расстояние тоже можно выучить.
Metric learning обучает отображение, в котором объекты одного класса близки, а разных — далеки. Triplet loss и contrastive loss — стандартные функции потерь; результат используется для поиска, верификации лиц и рекомендаций.
- размерность пространства или число объектов
- вероятность (или показатель нормы)
- функция, по которой берут производную
Связанные темы
Метрические и ядровые методы · Линейная алгебра в ML
Norm90%
Норма · Математический справочникМера длины вектора; выбор нормы определяет геометрию задачи.
Metric spaces90%
Метрические пространства · Топологический анализ данныхМножество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.
Linear Algebra70%
Линейная алгебра · ОсновыВекторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.
Vector70%
Вектор · Математический справочникУпорядоченный набор чисел; в ML — представление объекта в пространстве признаков.
Matrix70%
Матрица · Математический справочникПрямоугольная таблица чисел, задающая линейное преобразование или набор объектов.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector70%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
k-NN65%
Метод k ближайших соседей · Классическое машинное обучениеЛенивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.
SVM65%
Метод опорных векторов · Классическое машинное обучениеИщет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.
k-Means65%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
Normalization & Standardization65%
Нормализация и стандартизация · ДанныеПриведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.