Извлечение текста из изображений и сканов: детекция областей текста и его распознавание.
Ключевые тезисы
- Классический стек: детектор строк + CRNN с CTC-функцией потерь.
- Качество измеряют по CER и WER.
- Document AI-модели (Donut, LayoutLM) читают структуру документа, а не только символы.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Классический стек OCR
Детекция строк, распознавание, постобработка.
- Предобработка: выпрямление (deskew), бинаризация, удаление шума.
- Детекция текста: DBNet, CRAFT — находят области со строками.
- Распознавание: CRNN с CTC-потерями или трансформерный декодер.
- Постобработка: словари, регулярные выражения, проверка контрольных сумм.
CTC решает проблему выравнивания: модель выдаёт последовательность произвольной длины, а функция потерь суммирует по всем возможным выравниваниям с эталоном.
2Как работает CTC
Распознавание без разметки по символам.
Модель выдаёт распределение по символам для каждого «столбца» изображения. Проблема: мы не знаем, какой столбец какому символу соответствует. CTC вводит пустой символ и суммирует вероятности по всем выравниваниям, дающим нужную строку.
- истинное значение целевой переменной
- объект: вектор признаков
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
- произведение по всем элементам
- число π ≈ 3.14159
Отсюда правило: повторяющиеся буквы («класс») требуют пустого символа между ними, иначе они схлопнутся в одну.
Связанные темы
Мультимодальность
Multimodal Models75%
Мультимодальные модели · Компьютерное зрениеЕдиное пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
Multimodal Models75%
Мультимодальные модели · Генеративный ИИЕдиная модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.
Vision Transformers75%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
LLM75%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.