Базовая модель заморожена, обучается лишь небольшой набор дополнительных параметров — , , префиксы.
Ключевые тезисы
- Adapter — маленький bottleneck-модуль внутри блока : сжатие, нелинейность, разжатие и .
- Обучается меньше процента весов, поэтому под каждую задачу хранится не копия модели, а файл в десятки мегабайт.
- Исходные веса не меняются — катастрофическое забывание базовых способностей исключено по построению.
Подробный разбор
Adapter — небольшой обучаемый модуль внутри блока : узкий bottleneck из двух с нелинейностью между ними и остаточной связью вокруг. Базовая модель заморожена целиком, обновляют только эти модули.
- стандартное отклонение — разброс величины
- награда, полученная агентом на шаге
| Метод | Что обучается | Особенность |
|---|---|---|
| Adapter | bottleneck-модули внутри блоков | добавляет слои — небольшая на |
| низкоранговая поправка к весов | после обучения вливается в веса, нет | |
| Prefix / P-tuning | обучаемые векторы-префиксы к входу | не трогает архитектуру вовсе |
| QLoRA | поверх 4-битной базы | больших моделей на одной карте |
- Обучается доля процента параметров, поэтому под каждую задачу хранится файл в десятки мегабайт, а не копия модели.
- Исходные веса не меняются — базовые способности не забываются, а можно переключать на лету.
- Качество при разумном r близко к полному на узких задачах; на радикальной смене домена полное дообучение всё ещё сильнее.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Генеративный ИИ» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Сжатие моделей
Pruning80%
Прунинг · Глубокое обучениеУдаление наименее значимых весов, каналов или голов внимания из уже обученной сети ради скорости инференса.
Distillation80%
Дистилляция · Генеративный ИИОбучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
Mixed Precision80%
Смешанная точность · Оптимизация обученияОбучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
GPU Inference80%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Профильная компетенция для роли: LLM-инженер.
Усиливает профиль: NLP-инженер, Продуктовый инженер, Исследователь.
Спрашивают на собеседовании: Cloud.ru — Платформа обучения, Т1 — Документы и ассистенты.
Глава «Генеративный ИИ» последний раз правилась . Нашли ошибку — напишите.