Практика ML

Active Learning

Активное обучение

актуальноТекущий рабочий стандарт

Размечать в первую очередь те объекты, которые дадут наибольший прирост качества.

Ключевые тезисы

  • Стратегии отбора: наименьшая уверенность, наибольшая энтропия, разногласие ансамбля.
  • Экономия разметки достигает 2–5 раз на задачах с дорогими экспертами.
  • Опасность: выборка перестаёт быть репрезентативной, и оценка качества смещается.
Тема также относится к главам:ДанныеРазметка и объём данных

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Стратегии отбора

Что размечать в первую очередь.

СтратегияИдея
Least confidenceобъекты с максимальной неуверенностью модели
Margin samplingминимальный разрыв между двумя топ-классами
Entropyмаксимальная энтропия распределения по классам
Query by committeeобъекты, по которым модели ансамбля расходятся
Diversityпокрытие пространства признаков, а не только сложные случаи
На практике

Чистая неуверенность склонна выбирать выбросы и шум разметки. Практичнее комбинировать её с разнообразием и отбирать батчами, а не по одному.

2

Риски

Чем платят за экономию разметки.

  • Обучающая выборка перестаёт быть репрезентативной — оценка качества на ней смещается.
  • Отложенный тест обязан набираться случайно, а не активным отбором.
  • Смена модели меняет и стратегию отбора: накопленная выборка «заточена» под старую.

Связанные темы

Разметка и слабый надзор