ВТБ

Кредитный риск, витрины данных, документы и процессы

Второй по размеру банк страны с большой собственной ИТ-разработкой. ML-задачи распределены между риск-блоком, розницей и корпоративным бизнесом, а отдельная большая часть работы — инженерия данных: витрины, качество, регламенты. На собеседовании это заметно по вниманию к тому, откуда берутся данные и кто отвечает за их корректность.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление и блок: риски, розница, корпоративный бизнес, платформа данных.

  2. Отборочное тестирование способностей

    На части позиций и на стажировках — онлайн-тестирование до собеседования.

  3. SQL-секция

    SQL-секция: соединения, оконные функции, работа с историческими срезами витрин.

  4. ML-секция: модели, признаки, валидация

    ML-секция: модели на табличных данных, валидация, метрики и требования к воспроизводимости расчёта.

  5. Секция по инженерии данных

    Для платформенных ролей — секция по инженерии данных: пайплайны, качество, регламенты обновления витрин.

  6. Финальная встреча

    Руководитель: задачи, уровень, требования к документации моделей и согласованиям.

Что оценивают на любом направлении
  • Воспроизводимость расчёта: результат должен повторяться через полгода на тех же данных.
  • Понимание регуляторных требований к моделям и документированию.
  • Работа с историческими срезами: значение признака на дату, а не сегодняшнее состояние.
  • Уверенный SQL и понимание устройства хранилища.

Чем проверяют себя перед отбором

4 формата проверки из отбора ВТБ — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Числовые, вербальные и логические тесты до первой встречи

На чём валятся
  • Попытка считать точно всё подряд: времени хватает примерно на две трети задач, и выигрывает тот, кто оценивает порядок величины.
  • Ответ «из общих знаний», а не из приведённых данных, — в вербальной части это прямая ошибка.

SQL-секция

SQL interview

Соединения, оконные функции и цена запроса на большой таблице

На чём валятся
  • COUNT(*) вместо COUNT(поле) после LEFT JOIN — классическая тихая ошибка.
  • Запрос без фильтра по ключу разбиения: на боевой таблице он просто не доедет.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

Пайплайны, потоки, идемпотентность и качество данных

На чём валятся
  • Схема без ответа на вопрос «что происходит при повторном запуске».
  • Поток там, где хватило бы часового батча, — и наоборот, сутки задержки там, где нужны минуты.

Программа подготовки под компанию

20 тем по всем направлениям ВТБ — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 20 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под ВТБ · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Риск-моделиRisk Modelling

Модели вероятности дефолта, потерь при дефолте и досрочного погашения. Специфика — регламентная валидация, длинные горизонты и требование объяснимого поведения на каждом сегменте.

Пройти тест: Классический ML (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под ВТБ · Риск-модели.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Чем оценка вероятности отличается от ранжирования и почему в рисках нужна именно первая?

Ранжирование требует лишь правильного порядка, а резервы и ценообразование считаются по самим вероятностям. Поэтому модель должна быть калибрована: предсказанные 3 % должны означать три дефолта на сотню. Проверяют это калибровочной кривой и метриками вроде Brier и log-loss, а не только AUC.

Разбор в атласе: Calibration — Калибровка
Как построить выборку, если значение признака меняется во времени?

Срезом на дату наблюдения: для каждой заявки признаки берутся такими, какими они были на момент решения. Джойн к текущему состоянию клиента — типовая утечка, которая даёт отличную валидацию и провал в проде. В хранилище для этого держат исторические срезы или таблицы с интервалами действия.

Разбор в атласе: Data leakage — Утечка данных
Портфель изменился после смены политики выдач. Что делать с моделью?

Сначала измерить сдвиг — распределения признаков и скора по сегментам. Если сдвиг в признаках, но зависимость та же, хватит перекалибровки; если поменялась сама зависимость, нужна переобученная модель на данных новой политики, а до неё — ручные ограничения на сегменты, где модель работает вне своего опыта.

Разбор в атласе: Drift Detection — Детекция дрейфа
Какую документацию ждут от автора модели?

Постановку и область применения, описание выборки и её ограничений, перечень признаков с источниками, схему валидации и её результаты, регламент мониторинга и условия пересмотра. Это не бюрократия: без описания области применения модель через год начинают использовать на сегменте, для которого она не строилась.

Разбор в атласе: MLOps Maturity — Уровни зрелости MLOps
Что сделать руками до собеседования
  • Соберите выборку со срезом признаков на дату решения и сравните качество с наивным джойном к текущему состоянию.
  • Постройте калибровочную кривую и перекалибруйте модель на свежем периоде.
  • Посчитайте индекс стабильности распределений между поколениями заявок.