Сбер

Скоринг и риски, GigaChat, речь, зрение и промышленный ML

Крупный банк и экосистема: модели работают под регуляторными требованиями и на больших объёмах данных. Кроме качества модели спрашивают про интерпретируемость, стабильность во времени и промышленную эксплуатацию.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Разговор с рекрутером и уточнение направления: розница, риски, корпоративный блок, продуктовые команды экосистемы.

  2. Отборочное тестирование способностей

    На части вакансий и почти на всех стажировках до встречи с командой предлагают онлайн-тест: числовые и вербальные задачи на время. Отсеивает он больше, чем кажется.

  3. ML-секция: модели, признаки, валидация

    Классический ML, статистика и разбор конкретного кейса из вашего опыта до деталей валидации.

  4. SQL-секция

    SQL и Python на данных: данных много, они живут в хранилище, и готовить выборку приходится самому.

  5. Тестовое задание на данных

    Небольшая задача на данных либо разбор кода вживую: важна аккуратность, а не экзотические приёмы.

  6. Секция по направлению

    Углублённые вопросы: риск-моделирование, NLP и LLM, зрение, речь или инженерия ML — в зависимости от команды.

  7. Финальная встреча

    Разговор с руководителем: задачи команды, ожидания по уровню, процессы и требования к документированию моделей.

Что оценивают на любом направлении
  • Интерпретируемость: решение модели нужно уметь объяснить бизнесу и проверяющему.
  • Стабильность модели во времени: мониторинг дрейфа, регулярная валидация, переобучение по регламенту.
  • Уверенный SQL и работа с большими выборками — данных много, и они живут в хранилище.
  • Понимание требований к персональным данным и безопасности при работе с моделями.

Чем проверяют себя перед отбором

4 формата проверки из отбора Сбер — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Числовые, вербальные и логические тесты до первой встречи

На чём валятся
  • Попытка считать точно всё подряд: времени хватает примерно на две трети задач, и выигрывает тот, кто оценивает порядок величины.
  • Ответ «из общих знаний», а не из приведённых данных, — в вербальной части это прямая ошибка.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

SQL-секция

SQL interview

Соединения, оконные функции и цена запроса на большой таблице

На чём валятся
  • COUNT(*) вместо COUNT(поле) после LEFT JOIN — классическая тихая ошибка.
  • Запрос без фильтра по ключу разбиения: на боевой таблице он просто не доедет.

Датасет, несколько дней и разбор решения на защите

На чём валятся
  • Гонка за третьим знаком метрики вместо разбора данных.
  • Ноутбук на 600 ячеек без структуры и без фиксации зерна случайности.
24 вопроса в банкеТест: Классический ML

Программа подготовки под компанию

55 тем по всем направлениям Сбер — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 55 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 11 недель под Сбер · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Скоринг и рискиCredit Risk ML

Кредитный скоринг, антифрод, поведенческие модели. Ключевое — качество на длинном горизонте, интерпретируемость и корректная работа с дисбалансом.

Пройти тест: Классический ML (24 вопроса)
Собрать программу подготовки

Эти 12 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 3 недели под Сбер · Скоринг и риски.

Проверяем, вошли ли вы…

Типовые вопросы секции (5)
Почему логистическая регрессия до сих пор жива в скоринге?

Она интерпретируема, устойчива, легко валидируется и объясняется регулятору. Бустинг берут там, где прирост качества оправдывает сложность объяснения.

Разбор в атласе: Logistic Regression — Логистическая регрессия
Что такое PSI и зачем он нужен?

Population Stability Index измеряет расхождение распределения признака или скора между периодами. Рост PSI — сигнал дрейфа и повода для перевалидации модели.

Разбор в атласе: Drift Detection — Детекция дрейфа
Дефолтов 1 %. Как строить и оценивать модель?

Взвешивание классов или сэмплирование, метрики PR-AUC и recall на рабочем пороге, калибровка вероятностей под расчёт ожидаемых потерь.

Разбор в атласе: Imbalanced Data — Дисбаланс классов
Как объяснить отказ конкретному клиенту?

Локальная интерпретация: SHAP-значения признаков для этого наблюдения, сведённые к понятным причинам. Модель без объяснения в такие процессы не пускают.

Разбор в атласе: SHAP — SHAP
Как построить валидацию, если целевое событие наступает через год?

Разделение по времени с выдержкой окна наблюдения, отдельная out-of-time выборка и контроль того, что признаки известны на момент решения.

Разбор в атласе: Cross-validation — Кросс-валидация
Что сделать руками до собеседования
  • Построить скоринговую модель и сравнить логистическую регрессию с бустингом на out-of-time выборке.
  • Посчитать PSI по признакам и скору между кварталами.
  • Подготовить объяснение решения модели на уровне отдельного клиента.