Программная разметка эвристиками и правилами вместо ручной: быстро, шумно и часто достаточно.
Ключевые тезисы
- Несколько несовершенных правил объединяются в одну метку с оценкой их надёжности.
- LLM всё чаще используется как источник слабой разметки для холодного старта.
- Валидационный набор всё равно должен быть размечен вручную — иначе оценка бессмысленна.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Функции разметки
Несколько несовершенных правил вместо одного идеального.
def lf_keyword(x): return SPAM if "выигрыш" in x.text.lower() else ABSTAIN
def lf_links(x): return SPAM if x.n_links > 5 else ABSTAIN
def lf_sender_age(x): return HAM if x.sender_days > 365 else ABSTAINМодель объединения (label model) оценивает надёжность каждого правила по их согласию друг с другом — без единой размеченной вручную метки — и выдаёт вероятностные метки для обучения.
2LLM как источник разметки
Современный вариант слабой разметки.
- Быстрый холодный старт: тысячи размеченных примеров за часы вместо недель.
- Обязательна ручная проверка выборки: систематическая ошибка модели перейдёт в вашу модель целиком.
- Валидационный и тестовый наборы всегда размечаются людьми.
- Полезный приём: LLM размечает, человек проверяет только спорные случаи (низкая уверенность).
Связанные темы
Разметка и слабый надзор
Data Labeling85%
Разметка данных · ДанныеОрганизация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Synthetic Data85%
Синтетические данные · ДанныеГенерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Active Learning85%
Активное обучение · Практика MLРазмечать в первую очередь те объекты, которые дадут наибольший прирост качества.
Cohen's Kappa85%
Каппа Коэна · МетрикиСогласие двух разметчиков или модели с разметкой с поправкой на случайные совпадения.
Error analysis85%
Анализ ошибок · Оценка моделейРучной разбор случаев, где модель ошибается: почти всегда даёт больше, чем очередной перебор гиперпараметров.