Глубокое обучение

Mixture of Experts

Смесь экспертов

новинкаНовое или быстро растущее направление

Архитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.

Ключевые тезисы

  • Router выбирает k экспертов из N; активными оказываются единицы процентов параметров.
  • Балансировка загрузки экспертов — отдельная задача со своим слагаемым в функции потерь.
  • Память нужна под все параметры, поэтому выигрыш именно в вычислениях, а не в объёме модели.
Тема также относится к главам:Генеративный ИИСемейства моделей

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Маршрутизация и разреженность

Как активируется только часть модели.

Обозначения
  • истинное значение целевой переменной
  • объект: вектор признаков
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
Router выбирает k экспертов из N и взвешивает их выходы
  • При N = 64 и k = 2 активны около 3% экспертных параметров на каждый токен.
  • Балансировка загрузки нужна, иначе router схлопывается на нескольких «любимых» экспертах.
  • Память под все параметры всё равно требуется — экономятся вычисления, а не VRAM.
2

Практические следствия

Что это значит для эксплуатации.

  • MoE-модель с 100B параметров может считать как плотная на 15B — но требует памяти как 100B.
  • Распределение экспертов по узлам добавляет сетевой обмен на каждом слое.
  • Качество при равных активных параметрах обычно выше, чем у плотной модели, за счёт большей ёмкости.

Связанные темы

Эффективность моделей