Т-Банк

Антифрод, скоринг, рекомендации и голосовой помощник

Банк, выросший из технологической компании: почти всё продуктовое решение проходит через эксперимент, а модели работают в реальном времени под нагрузкой. На собеседовании это видно по упору на метрики продукта, A/B-тесты и умение довести модель до онлайн-сервиса с жёстким бюджетом задержки.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Разговор с рекрутером: направление, опыт, ожидания. Иногда предлагают короткий тест или задачу на данных до секций.

  2. Алгоритмическая секция

    Структуры данных, сложность, аккуратный код. Отдельная от ML секция, и готовиться к ней нужно отдельно.

  3. ML-секция: модели, признаки, валидация

    Постановка задачи, признаки, валидация, метрики. Много вопросов про то, как вы поняли, что модель работает, а не только про её устройство.

  4. Продуктовая секция и A/B

    Дизайн эксперимента, выбор метрики, интерпретация результата. Спрашивают и о том, что делать, когда метрика не выросла.

  5. Финальная встреча

    Разговор с руководителем: задачи команды, процессы, уровень.

Что оценивают на любом направлении
  • Метрика продукта важнее метрики модели: нужно уметь связать одно с другим.
  • Эксперимент как норма: любое изменение защищается A/B-тестом, а не рассуждением.
  • Онлайн-инференс под нагрузкой: задержка и отказоустойчивость — часть задачи, а не чужая забота.
  • Уверенный SQL: данных много, и разбираться в них приходится самому.

Чем проверяют себя перед отбором

3 формата проверки из отбора Т-Банк — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Живое кодирование: решение вслух и код в редакторе

На чём валятся
  • Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
  • Отсутствие практики — теория известна, но простая задача пишется час.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

Продуктовая секция и A/B

Statistics & experimentation

Дизайн эксперимента, значимость и решение по результату

На чём валятся
  • Остановка теста в момент, когда p-value впервые стало меньше 0,05.
  • Вывод по срезу, найденному после эксперимента, без поправки.

Программа подготовки под компанию

20 тем по всем направлениям Т-Банк — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 20 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под Т-Банк · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Антифрод и рискиFraud & Risk ML

Обнаружение мошенничества и оценка риска в реальном времени. Специфика — сильнейший дисбаланс классов, состязательный характер задачи (противник адаптируется) и цена ошибки, разная в две стороны.

Пройти тест: Классический ML (24 вопроса)
Собрать программу подготовки

Эти 8 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под Т-Банк · Антифрод и риски.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Положительных примеров 0,1 %. Почему ROC-AUC здесь вводит в заблуждение и что смотреть вместо него?

ROC-AUC усредняет по всем порогам и на сильном дисбалансе выглядит завышенным: доля ложноположительных считается от огромного числа отрицательных, поэтому даже плохая модель даёт красивую кривую. Смотреть надо PR-AUC и точность на том рабочем участке полноты, который реально используется, — например, precision при recall 0,3.

Разбор в атласе: PR-AUC — PR-AUC
Как выбрать порог, если ложный пропуск стоит 50 000 рублей, а ложная блокировка — потерянный клиент?

Через матрицу стоимостей: назначить цену каждому типу ошибки и минимизировать ожидаемые потери, а не максимизировать F1. Для этого нужны калиброванные вероятности — иначе ожидание считается по числам, которые вероятностями не являются. Порог пересматривают вместе с бизнесом и перепроверяют после каждого переобучения.

Разбор в атласе: Calibration — Калибровка
Мошенники адаптируются к модели. Как это меняет процесс работы с ней?

Задача становится нестационарной по построению: распределение меняется в ответ на саму модель. Отсюда частое переобучение, мониторинг дрейфа как обязательный, а не желательный элемент, доля правил рядом с моделью для быстрой реакции и отдельный контур поиска новых схем без разметки — аномалии.

Разбор в атласе: Drift Detection — Детекция дрейфа
Как построить валидацию, чтобы она отражала реальную работу антифрода?

Только по времени: обучение до момента T, проверка после. Случайное разбиение даст утечку через признаки, агрегированные по пользователю, и завысит качество. Дополнительно смотрят стабильность метрики по неделям — модель, хорошая в среднем и разваливающаяся в отдельные периоды, в проде опасна.

Разбор в атласе: Data leakage — Утечка данных
Что сделать руками до собеседования
  • Возьмите датасет с сильным дисбалансом и постройте PR-кривую, выберите порог по матрице стоимостей.
  • Сравните калиброванные и некалиброванные вероятности бустинга: посчитайте ожидаемые потери в обоих случаях.
  • Сделайте разбиение по времени и покажите, насколько оптимистичнее случайное.