Генеративный ИИ

LoRA

LoRA

новинкаНовое или быстро растущее направление

Обучение низкоранговых добавок к весам вместо полного дообучения модели.

Что означает каждый компонент
  • исходные веса модели — они заморожены и не обучаются
  • низкоранговая поправка: две узкие матрицы, произведение которых имеет ранг r
  • ранг адаптера (обычно 8–64). Обучается доля процента параметров вместо всей модели

Ключевые тезисы

  • Обучается доля процента параметров при близком к полному качестве.
  • Адаптеры малы, их легко хранить и переключать на лету.
  • QLoRA позволяет дообучать крупные модели на одной GPU.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Низкоранговая поправка

Обучаем 0.1% параметров вместо 100%.

Обозначения
  • приращение — малое изменение величины
  • награда, полученная агентом на шаге
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • матрица преобразования
Пример

Слой — это 16.7 млн параметров. При LoRA обучает тысяч — в 256 раз меньше.

  • Адаптер весит мегабайты: можно хранить десятки стилей и переключать их на лету.
  • задаёт масштаб поправки; типично .
  • QLoRA: базовая модель в 4 битах + адаптеры в 16 битах — дообучение 70B-модели на одной GPU.
2

Практика применения LoRA

Какие слои адаптировать и с каким рангом.

  • Классика — адаптировать матрицы внимания и ; расширение на все линейные слои даёт небольшой прирост при большей стоимости.
  • хватает для стилевой адаптации, — для доменной.
  • обычно берут равным .
  • Адаптеры можно «вплавить» в веса (merge_and_unload) — тогда инференс не имеет накладных расходов.

Связанные темы

Эффективность моделей · Адаптация языковых моделей

Transfer Learning80%

Перенос обучения · Глубокое обучение

Использование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.

Mixture of Experts80%

Смесь экспертов · Глубокое обучение

Архитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.

Distillation80%

Дистилляция · Генеративный ИИ

Обучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.

GPU Inference80%

GPU-инференс · Системный дизайн ML-сервисов

Как выжать из видеокарты пропускную способность и не переплачивать.

Cost Model80%

Экономика сервиса · Системный дизайн ML-сервисов

Стоимость одного предсказания и точка, где модель перестаёт окупаться.

Prompting80%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Fine-tuning80%

Дообучение · Генеративный ИИ

Адаптация предобученной модели под домен или формат на собственных данных.

RLHF80%

RLHF · Генеративный ИИ

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

PPO80%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.

GPT80%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.