Глубокое обучение

Autoencoders

Автоэнкодеры

актуальноТекущий рабочий стандарт

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Ключевые тезисы

  • Латентный код — нелинейный аналог главных компонент.
  • Denoising-версия восстанавливает чистый вход из зашумлённого.
  • Ошибка реконструкции — рабочий детектор аномалий.
Тема также относится к главам:Обучение без учителяСнижение размерности

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Узкое место и реконструкция

Сжать, чтобы понять, что в данных главное.

Обозначения
  • объект: вектор признаков
  • функция потерь — то, что минимизируется при обучении
  • норма — длина вектора

Если энкодер и декодер линейны, а потери квадратичные, автоэнкодер выучивает то же подпространство, что и PCA. Нелинейности позволяют находить кривые многообразия, недоступные PCA.

2

Применения

Шумоподавление, поиск аномалий, сжатие для других моделей.

  • Denoising: на вход подаём зашумлённый объект, на выходе требуем чистый — сеть учится «понимать» структуру, а не копировать вход.
  • Аномалии: обучаем только на нормальных данных; большая ошибка реконструкции = аномалия.
  • Сжатие: латентный код используется как признаки для классификатора или как пространство для диффузии (Stable Diffusion работает именно в латентном пространстве VAE).

Связанные темы

Представления и снижение размерности · Аномалии и выбросы

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Dimensionality reduction70%

Снижение размерности · Данные

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Dimensionality Reduction70%

Снижение размерности · Обучение без учителя

Компактное представление данных, сохраняющее важную часть структуры.

Representation Learning70%

Обучение представлений · Обучение без учителя

Модель сама учится полезным признакам, чаще всего через self-supervised задачи.

Embeddings70%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector70%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.

Outliers70%

Выбросы · Данные

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

Anomaly Detection70%

Поиск аномалий · Обучение без учителя

Выделение объектов, не похожих на основную массу данных, при отсутствии меток.

Anomaly detection70%

Поиск аномалий во времени · Временные ряды

Обнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.

Density Estimation70%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

TDA + Time Series70%

TDA и временные ряды · Топологический анализ данных

Ряд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.