Математический справочник

Distance

Расстояние

актуальноТекущий рабочий стандарт

Мера непохожести объектов — основа кластеризации, k-NN и поиска.

Ключевые тезисы

  • Евклидово, манхэттенское, косинусное, Махаланобиса, Хэмминга.
  • Косинусное расстояние игнорирует длину вектора — удобно для текста.
  • Расстояние Махаланобиса учитывает корреляции признаков.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Какое расстояние выбрать

Выбор метрики важнее выбора алгоритма.

МетрикаФормулаКогда
Евклидовачисловые признаки после стандартизации
Манхэттенскаяразреженные данные, устойчивость к выбросам
Косинуснаятексты, эмбеддинги
Хэммингачисло различийбинарные и категориальные
Махаланобисакоррелированные признаки
Считаем

, : манхэттенское , евклидово .

2

Обучаемые метрики

Когда расстояние тоже можно выучить.

Metric learning обучает отображение, в котором объекты одного класса близки, а разных — далеки. Triplet loss и contrastive loss — стандартные функции потерь; результат используется для поиска, верификации лиц и рекомендаций.

Обозначения
  • размерность пространства или число объектов
  • вероятность (или показатель нормы)
  • функция, по которой берут производную
Якорь, позитив и негатив: позитив должен быть ближе негатива минимум на зазор

Связанные темы

Метрические и ядровые методы · Линейная алгебра в ML

Norm90%

Норма · Математический справочник

Мера длины вектора; выбор нормы определяет геометрию задачи.

Metric spaces90%

Метрические пространства · Топологический анализ данных

Множество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.

Linear Algebra70%

Линейная алгебра · Основы

Векторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.

Vector70%

Вектор · Математический справочник

Упорядоченный набор чисел; в ML — представление объекта в пространстве признаков.

Matrix70%

Матрица · Математический справочник

Прямоугольная таблица чисел, задающая линейное преобразование или набор объектов.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector70%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

k-NN65%

Метод k ближайших соседей · Классическое машинное обучение

Ленивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.

SVM65%

Метод опорных векторов · Классическое машинное обучение

Ищет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.

k-Means65%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

Normalization & Standardization65%

Нормализация и стандартизация · Данные

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.