Удаление наименее значимых весов, каналов или голов из уже обученной сети ради скорости .
Ключевые тезисы
- Неструктурированный обнуляет отдельные веса — сжимает файл, но без специального железа не ускоряет.
- Структурированный убирает целые каналы, головы и слои: становятся меньше, ускорение реальное.
- После обрезки почти всегда нужен дообучающий проход (), чтобы вернуть потерянную точность.
Подробный разбор
| Вид | Что удаляется | Ускорение | Качество |
|---|---|---|---|
| Неструктурированный | отдельные веса по величине | только со спец. поддержкой разреженности | падает медленно, можно убрать 80–90% |
| Структурированный | каналы, головы , слои | прямое: меньше | падает быстрее, обычно 20–50% |
| N:M-разреженность | N весов из каждых M | есть на современных | компромисс между первыми двумя |
- Обучить модель до нужного качества.
- Оценить значимость: величина веса, вклад в потери, средняя канала.
- Удалить наименее значимое и дообучить остаток () — без этого шага качество проседает заметно.
- Повторить итеративно: несколько мягких проходов дают лучший результат, чем одна агрессивная обрезка.
и решают одну задачу разными способами: прунинг урезает исходную сеть, обучает новую маленькую модель на мягких выходах большой. Они совместимы: обрезали, дистиллировали, квантовали.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Глубокое обучение» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Сжатие моделей
Distillation80%
Дистилляция · Генеративный ИИОбучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
PEFT and Adapters80%
Экономное дообучение · Генеративный ИИБазовая модель заморожена, обучается лишь небольшой набор дополнительных параметров — адаптеры, LoRA, префиксы.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
Mixed Precision80%
Смешанная точность · Оптимизация обученияОбучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
GPU Inference80%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Профильная компетенция для роли: LLM-инженер.
Усиливает профиль: MLOps-инженер, Продуктовый инженер.
Спрашивают на собеседовании: YADRO — Эффективность моделей.
Глава «Глубокое обучение» последний раз правилась . Нашли ошибку — напишите.