Обучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
Ключевые тезисы
- Ученик учится на «мягких» распределениях учителя, а не только на метках.
- Для LLM это чаще всего дообучение на ответах сильной модели по вашим запросам.
- Каскад «маленькая модель + эскалация в большую» часто выгоднее чистой дистилляции.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как дистиллировать
Три рабочих варианта.
- По логитам: ученик приближает распределение учителя (классический Hinton-подход).
- По ответам: ученик дообучается на выходах сильной модели по вашим реальным запросам.
- По рассуждениям: в обучающие примеры включаются цепочки рассуждений учителя.
- коэффициент, задающий вес слагаемого или скорость обновления
- истинное значение целевой переменной
- распределение, предсказанное моделью
- функция потерь — то, что минимизируется при обучении
- норма — длина вектора
2Каскад вместо дистилляции
Часто более выгодная альтернатива.
Маленькая модель отвечает сама и оценивает свою уверенность; при низкой уверенности запрос уходит к большой модели. При доле эскалации 20% средняя стоимость падает в несколько раз почти без потери качества.
- Порог эскалации подбирается по кривой «стоимость — качество» на валидации.
- Нужна честная оценка уверенности: логиты, самосогласованность или отдельный классификатор.
- Каскад проще внедрить и откатить, чем дистиллированную модель.
Связанные темы
Эффективность моделей
Transfer Learning80%
Перенос обучения · Глубокое обучениеИспользование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Mixture of Experts80%
Смесь экспертов · Глубокое обучениеАрхитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
GPU Inference80%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Cost Model80%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.