Обучение низкоранговых добавок к весам вместо полного дообучения модели.
- исходные веса модели — они заморожены и не обучаются
- низкоранговая поправка: две узкие матрицы, произведение которых имеет ранг r
- ранг адаптера (обычно 8–64). Обучается доля процента параметров вместо всей модели
Ключевые тезисы
- Обучается доля процента параметров при близком к полному качестве.
- Адаптеры малы, их легко хранить и переключать на лету.
- QLoRA позволяет дообучать крупные модели на одной GPU.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Низкоранговая поправка
Обучаем 0.1% параметров вместо 100%.
- приращение — малое изменение величины
- награда, полученная агентом на шаге
- номер или количество: индекс шага, число соседей, кластеров или позиций
- матрица преобразования
Слой — это 16.7 млн параметров. При LoRA обучает тысяч — в 256 раз меньше.
- Адаптер весит мегабайты: можно хранить десятки стилей и переключать их на лету.
- задаёт масштаб поправки; типично –.
- QLoRA: базовая модель в 4 битах + адаптеры в 16 битах — дообучение 70B-модели на одной GPU.
2Практика применения LoRA
Какие слои адаптировать и с каким рангом.
- Классика — адаптировать матрицы внимания и ; расширение на все линейные слои даёт небольшой прирост при большей стоимости.
- – хватает для стилевой адаптации, – — для доменной.
- обычно берут равным .
- Адаптеры можно «вплавить» в веса (
merge_and_unload) — тогда инференс не имеет накладных расходов.
Связанные темы
Эффективность моделей · Адаптация языковых моделей
Transfer Learning80%
Перенос обучения · Глубокое обучениеИспользование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Mixture of Experts80%
Смесь экспертов · Глубокое обучениеАрхитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.
Distillation80%
Дистилляция · Генеративный ИИОбучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
GPU Inference80%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Cost Model80%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Fine-tuning80%
Дообучение · Генеративный ИИАдаптация предобученной модели под домен или формат на собственных данных.
RLHF80%
RLHF · Генеративный ИИДообучение по человеческим предпочтениям: модель награды + оптимизация политики.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
PPO80%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.
GPT80%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.