МТС

Отток и персонализация, речь и разговорный ИИ, облако и данные

Телеком, выросший в экосистему: связь, финтех, медиа, облако и собственные ИИ-разработки. ML-задачи делятся на две большие группы — работа с абонентской базой (отток, предложения, кредитный скоринг) и речевые технологии с языковыми моделями для контакт-центров и ассистентов.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет, в какую часть группы вы идёте: телеком-аналитика, финтех, облако или ИИ-разработка. Наборы секций у них разные.

  2. SQL-секция

    SQL и данные: абонентские витрины большие, и почти любая задача начинается с выборки.

  3. ML-секция: модели, признаки, валидация

    ML-секция: классические модели на табличных данных, валидация во времени, метрики под задачу удержания или скоринга.

  4. Секция по речи

    Для речевых команд — направленческая секция: распознавание, синтез, качество на телефонном канале.

  5. Секция дизайна ML-системы

    На middle+ — дизайн системы: кампания на миллионы абонентов или голосовой сервис реального времени.

  6. Финальная встреча

    Руководитель, задачи команды, уровень.

Что оценивают на любом направлении
  • Работа с абонентскими данными как с чувствительными: обезличивание, доступы, ограничения на использование.
  • Понимание, что модель оттока существует ради кампании удержания, и метрика — эффект кампании, а не AUC.
  • Уверенный SQL на больших витринах и понимание стоимости запроса.
  • Для речевых ролей — понимание ограничений телефонного канала: 8 кГц, шум, короткие реплики.

Чем проверяют себя перед отбором

4 формата проверки из отбора МТС — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

SQL-секция

SQL interview

Соединения, оконные функции и цена запроса на большой таблице

На чём валятся
  • COUNT(*) вместо COUNT(поле) после LEFT JOIN — классическая тихая ошибка.
  • Запрос без фильтра по ключу разбиения: на боевой таблице он просто не доедет.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

Распознавание и синтез: признаки, декодирование, метрики

На чём валятся
  • Оценка качества на чистых студийных записях при боевом потоке из телефонии.
  • Отсутствие разговора о задержке в задачах реального времени.
24 вопроса в банкеТест: Речь: ASR и TTS

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Программа подготовки под компанию

20 тем по всем направлениям МТС — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 20 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под МТС · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Отток и персональные предложенияChurn & CVM

Предсказание оттока, подбор тарифа и предложения, оценка отклика на кампанию. Специфика — решение принимается не по вероятности, а по ожидаемой выгоде от вмешательства.

Пройти тест: Классический ML (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под МТС · Отток и персональные предложения.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Модель оттока выдаёт вероятность. Почему нельзя звонить всем с вероятностью выше 0,7?

Потому что цель — не найти уходящих, а изменить их решение. Часть абонентов уйдёт независимо от звонка, часть останется и без него, а кого-то звонок только подтолкнёт. Правильная величина — прирост вероятности остаться от вмешательства, и её оценивают отдельной моделью на данных эксперимента.

Разбор в атласе: A/B testing — A/B-тестирование
Как валидировать модель оттока?

Только по времени: обучение до момента T, проверка на последующем окне, и метрику смотрят по неделям, а не в среднем. Случайное разбиение даёт утечку через агрегаты по абоненту и завышает качество; кроме того, тарифная сетка и акции меняются, и модель обязана выдерживать эти сдвиги.

Разбор в атласе: Data leakage — Утечка данных
Как выбрать размер кампании, если колл-центр обрабатывает 50 тысяч контактов в неделю?

Ранжированием по ожидаемой выгоде и отсечением по мощности: берутся первые 50 тысяч по приросту вероятности, умноженному на ценность абонента. Метрика для защиты — не recall, а дополнительный доход на контакт по сравнению со случайной выборкой той же величины.

Разбор в атласе: Precision@K — Точность@K
Бизнес спрашивает, почему конкретный абонент попал в кампанию. Что отвечать?

Разложением вклада признаков для этого объекта и сравнением с типичным профилем. Плюс честная оговорка: модель показывает связь, а не причину, и объяснение годится для проверки здравого смысла и для скрипта разговора, но не для утверждений о причинах ухода.

Разбор в атласе: SHAP — SHAP
Что сделать руками до собеседования
  • Постройте модель оттока на открытых данных и сравните отбор по вероятности с отбором по ожидаемому приросту.
  • Сделайте разбиение по времени и покажите, насколько оптимистичнее случайное.
  • Посчитайте экономику кампании: стоимость контакта, ценность удержанного абонента, порог по мощности.