Данные

Synthetic Data

Синтетические данные

новинкаНовое или быстро растущее направление

Генерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.

Ключевые тезисы

  • Работает лучше всего там, где процесс порождения известен: рендеринг, симуляция, шаблоны документов.
  • Разрыв домена (sim-to-real) — главная проблема: модель учится на артефактах генератора.
  • Синтетика от LLM полезна для холодного старта, но требует проверки на дубликаты и смещения.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Способы получить синтетику

От простых аугментаций до генеративных моделей.

МетодГде работаетОграничение
Аугментацииизображения, аудио, текстне создаёт новых сущностей
Симуляция / рендерингзрение, робототехникаразрыв домена sim-to-real
Шаблоны и правиладокументы, логи, табличные данныене покрывает редкие случаи
Генеративные моделитекст, изображениянаследует смещения и может дублировать обучающие данные
2

Риски и проверки

Как не обучить модель на артефактах генератора.

  • Тестовая выборка всегда только реальная — иначе оценка не значит ничего.
  • Проверяйте, отличает ли простой классификатор синтетику от реальных данных: если отличает легко, разрыв домена велик.
  • Следите за дубликатами: генератор склонен воспроизводить обучающие примеры почти дословно.
  • Доля синтетики в обучении — гиперпараметр; часто оптимум далеко не 100%.

Связанные темы

Разметка и слабый надзор