Основы

Linear Algebra

Линейная алгебра

актуальноТекущий рабочий стандарт

Векторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.

Что означает каждый компонент
  • выход слоя — новый вектор признаков
  • матрица весов: поворачивает, растягивает и проецирует пространство
  • вход — объект в пространстве признаков
  • вектор сдвига: позволяет отображению не проходить через ноль
Полносвязный слой нейросети — ровно эта формула

Ключевые тезисы

  • Матрица — это линейное отображение: она поворачивает, растягивает и проецирует пространство признаков.
  • Разложения (SVD, собственные) объясняют, какие направления данных несут больше всего дисперсии.
  • Скалярное произведение задаёт меру похожести — от косинусной близости эмбеддингов до ядер SVM.
Тема также относится к главам:Математический справочникЛинейная алгебра

Подробный разбор

4 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Объект как вектор, выборка как матрица

Почему любая таблица данных — это матрица, а строка — точка в пространстве признаков.

Один объект описывается набором чисел: возраст, доход, количество покупок. Этот набор и есть вектор , а — размерность пространства признаков. Вся выборка из объектов складывается в матрицу размера : строки — объекты, столбцы — признаки.

Обозначения
  • объект или аргумент функции
  • число объектов в выборке
Матрица «объекты × признаки» — стандартная форма табличных данных
Пример

Клиент банка: возраст 35, доход 120 000, число продуктов 3 → вектор . Тысяча клиентов — матрица . Заметьте, что координаты имеют разный масштаб: это и есть причина, по которой нужна нормализация.

Такое представление даёт неожиданно много: расстояние между строками становится мерой похожести клиентов, а обучение линейной модели — поиском одного вектора весов , который «читает» все строки одинаковым способом.

PC1PC2
λ₁0.711
λ₂0.041
объяснённая дисперсия PC194.5%
Облако объектов в пространстве двух признаков: чем сильнее корреляция, тем ближе данные к одной прямой
2

Матрица как преобразование пространства

Умножение на матрицу поворачивает, растягивает и проецирует данные.

Умножение — это не «перемножение чисел», а отображение: каждой точке сопоставляется новая точка . Матрица полностью задаётся тем, куда она переводит базисные векторы: первый столбец — образ вектора , второй — образ .

Диагональная матрица растягивает первую ось вдвое и сжимает вторую вдвое
  • Композиция: означает «сначала применить , потом ». Отсюда некоммутативность: .
  • Ранг — размерность образа. Ранг меньше означает, что преобразование схлопывает пространство и информация теряется безвозвратно.
  • Определитель — во сколько раз меняется объём. Нулевой определитель ⇔ матрица вырождена ⇔ обратной не существует.
На практике

Полносвязный слой нейросети — это ровно : матрица преобразует пространство, вектор сдвигает его. Вся «глубина» сети — это композиция таких преобразований, между которыми стоят нелинейности.

3

Скалярное произведение и мера похожести

Одна операция, из которой выросли косинусная близость, ядра SVM и внимание в трансформерах.

Обозначения
  • параметры модели
  • суммирование по всем перечисленным элементам
  • норма — длина вектора
  • скалярное произведение: мера согласованности векторов
Скалярное произведение связывает алгебру (сумма) и геометрию (угол)

Если векторы сонаправлены, произведение максимально; если перпендикулярны — равно нулю. Поэтому косинус угла используют как меру смысловой близости эмбеддингов: длина вектора там часто не важна, важно направление.

Пример: поиск похожих товаров

Товар описан вектором из 256 чисел. Чтобы найти похожие, считают скалярные произведения запроса со всеми товарами и берут топ-к. Для 1 млн товаров это одно умножение матрицы на — то, что видеокарта делает за миллисекунды.

В механизме внимания то же самое: — насколько -й запрос «резонирует» с -м ключом. Деление на нужно, чтобы при большой размерности значения не улетали в область, где softmax насыщается.

4

Собственные векторы и SVD

Как найти направления, вдоль которых данные «живут» на самом деле.

Собственный вектор — направление, которое преобразование не поворачивает, а только масштабирует: . Для ковариационной матрицы данных собственные векторы — это оси, вдоль которых разброс максимален, а собственные значения — величина этого разброса.

Обозначения
  • стандартное отклонение — разброс величины
  • награда, полученная агентом на шаге
  • транспонирование: строка вместо столбца
Сингулярное разложение: любая матрица = поворот × растяжение × поворот
  • Первые компонент SVD дают наилучшее приближение матрицы рангом (теорема Эккарта — Янга) — это математическая основа PCA и сжатия эмбеддингов.
  • Отношение — число обусловленности: чем оно больше, тем сильнее шум в данных влияет на решение системы.
  • LoRA обучает низкоранговую поправку — ту же идею «мало компонент хватает» применяют к весам LLM.
PC1PC2
λ₁0.711
λ₂0.041
объяснённая дисперсия PC194.5%
PC1 — направление максимальной дисперсии; крутите корреляцию и смотрите, как меняется доля объяснённой дисперсии

Связанные темы

Линейная алгебра в ML

Vector70%

Вектор · Математический справочник

Упорядоченный набор чисел; в ML — представление объекта в пространстве признаков.

Matrix70%

Матрица · Математический справочник

Прямоугольная таблица чисел, задающая линейное преобразование или набор объектов.

Norm70%

Норма · Математический справочник

Мера длины вектора; выбор нормы определяет геометрию задачи.

Distance70%

Расстояние · Математический справочник

Мера непохожести объектов — основа кластеризации, k-NN и поиска.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector70%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Metric spaces70%

Метрические пространства · Топологический анализ данных

Множество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.