СКБ Контур

Документы и OCR, проверка контрагентов, продуктовый ML

Разработчик сервисов для бизнеса: отчётность, электронный документооборот, проверка контрагентов, бухгалтерия. ML встроен в продукты, которыми пользуются сотни тысяч компаний: распознавание документов, поиск рисков в данных о юрлицах, подсказки в интерфейсе. Отбор инженерный, с упором на аккуратность и на понимание предметной области.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление и продукт: документооборот, проверка контрагентов, бухгалтерские сервисы.

  2. Алгоритмическая секция

    Алгоритмическая секция: структуры данных, сложность, чистый код.

  3. ML-секция: модели, признаки, валидация

    ML-секция: постановка, признаки, валидация, метрики. Много внимания качеству данных.

  4. Секция по NLP

    Направленческая секция: работа с документами и текстами, извлечение сущностей, поиск.

  5. Секция дизайна ML-системы

    На middle+ — дизайн сервиса: распознавание потока документов или скоринг контрагентов.

  6. Финальная встреча

    Команда и задачи, разговор о том, как устроена работа с продуктом.

Что оценивают на любом направлении
  • Понимание предметной области: документы и отчётность имеют жёсткие форматы и смысл.
  • Аккуратность: ошибка в реквизите или в оценке контрагента доходит до клиента сразу.
  • Готовность работать с открытыми государственными данными и их особенностями.
  • Инженерная культура: код в продукте, а не в ноутбуке.

Чем проверяют себя перед отбором

4 формата проверки из отбора СКБ Контур — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Живое кодирование: решение вслух и код в редакторе

На чём валятся
  • Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
  • Отсутствие практики — теория известна, но простая задача пишется час.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

Токенизация, представления, трансформеры, поиск и оценка

На чём валятся
  • Ответ «возьму BERT» без бейзлайна и без разговора о стоимости инференса.
  • Метрики NER по токенам вместо сущностей.
24 вопроса в банкеТест: NLP

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Программа подготовки под компанию

20 тем по всем направлениям СКБ Контур — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 20 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под СКБ Контур · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Документы и распознаваниеDocument AI

Распознавание и разбор документов, извлечение реквизитов, классификация типов, сопоставление с учётными данными. Специфика — разнообразие форматов и требование высокой точности в ключевых полях.

Пройти тест: Computer Vision (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под СКБ Контур · Документы и распознавание.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Как классифицировать тип документа до извлечения полей?

По совокупности сигналов: ключевые слова, структура страницы, наличие характерных таблиц и печатей. Классификация типа нужна, чтобы выбрать схему извлечения; ошибка здесь приводит к тому, что модель ищет несуществующие поля, поэтому порог уверенности с отправкой на ручную проверку обязателен.

Разбор в атласе: Text classification — Классификация текстов
Таблицы в документах — почему это отдельная проблема?

Потому что смысл задаётся геометрией: строка и колонка определяют значение, а распознавание даёт плоский текст. Нужны детекция структуры таблицы, восстановление ячеек и связей с заголовками. Ошибка в разборе структуры портит все значения сразу, а не одно поле.

Разбор в атласе: Object Detection — Детекция объектов
Как экономить на разметке в потоке новых форматов?

Активным обучением: размечать в первую очередь документы, где модель не уверена или где её ответ расходится с проверкой пользователя. Плюс предразметка моделью с ручной правкой. Это на порядок дешевле сплошной разметки и быстрее покрывает новые форматы.

Разбор в атласе: Active Learning — Активное обучение
Какую метрику обещать клиенту?

Долю документов без ручных правок и точность по критичным полям отдельно. Средняя точность по всем полям скрывает то, что важно: сумма и ИНН весят больше, чем название города. И обязательно — долю документов, отправленных на проверку: она показывает реальную экономию.

Разбор в атласе: Precision — Точность
Что сделать руками до собеседования
  • Соберите классификатор типа документа с порогом и очередью ручной проверки.
  • Реализуйте разбор таблицы с восстановлением структуры и оцените ошибки на уровне ячеек.
  • Постройте цикл активного обучения и измерьте экономию разметки.