Selectel

ML-платформа и инференс, надёжность сервисов, прогноз нагрузки

Провайдер облачной инфраструктуры и выделенных серверов, включая аренду карт для обучения и инференса. ML-специалист здесь работает по обе стороны: строит сервисы для клиентов, которые обучают свои модели, и применяет модели внутри — для прогноза нагрузки, планирования мощностей и обнаружения отказов оборудования.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление: ML-сервисы для клиентов, внутренняя аналитика и надёжность, платформа.

  2. Алгоритмическая секция

    Алгоритмическая секция: структуры данных, сложность, системное мышление.

  3. Секция по продакшену и MLOps

    Секция по эксплуатации: контейнеры, выкат, мониторинг, работа с GPU-инфраструктурой.

  4. Секция дизайна ML-системы

    Дизайн-секция: сервис инференса с SLA — задержка, отказоустойчивость, стоимость.

  5. ML-секция: модели, признаки, валидация

    ML-секция: модели и валидация — глубина зависит от роли, во внутренней аналитике она выше.

  6. Финальная встреча

    Команда, задачи, уровень.

Что оценивают на любом направлении
  • Мышление категориями SLA: доступность и задержка — это обязательства, а не пожелания.
  • Понимание стоимости ресурсов: карта в простое — это прямые потери.
  • Готовность отвечать за эксплуатацию, а не только за качество модели.
  • Умение объяснить клиенту технические ограничения без упрощений, которые вводят в заблуждение.

Чем проверяют себя перед отбором

4 формата проверки из отбора Selectel — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Живое кодирование: решение вслух и код в редакторе

На чём валятся
  • Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
  • Отсутствие практики — теория известна, но простая задача пишется час.

Пайплайны, выкат, мониторинг, дрейф и воспроизводимость

На чём валятся
  • Модель, живущая в ноутбуке: «отдали файл с весами и всё».
  • Мониторинг только по задержке и ошибкам сервиса, без качества и дрейфа.
24 вопроса в банкеТест: MLOps и инженерия

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

Программа подготовки под компанию

20 тем по всем направлениям Selectel — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 20 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под Selectel · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Платформа инференсаInference Platform

Сервисы для запуска моделей клиентов: изоляция, масштабирование, батчинг, учёт потребления. Специфика — чужие модели с непредсказуемым профилем нагрузки и жёсткие обязательства по доступности.

Пройти тест: Дизайн ML-систем (22 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под Selectel · Платформа инференса.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Как масштабировать сервис инференса на GPU?

Не так, как обычный веб-сервис: карта дорога, и главное — утилизация. Масштабируют числом реплик по очереди запросов, а внутри реплики — динамическим батчингом. Холодный старт модели на карте занимает секунды, поэтому автоматическое масштабирование должно работать на опережение.

Разбор в атласе: Scaling — Масштабирование
Клиенты жалуются на нестабильную задержку. Где искать?

В очереди и в соседях: динамический батчинг увеличивает задержку при росте нагрузки, а несколько моделей на одной карте конкурируют за память и вычисления. Смотрят распределение задержки по квантилям, а не среднюю: проблема почти всегда в хвосте.

Разбор в атласе: Observability — Наблюдаемость
Как считать стоимость обслуживания клиентской модели?

По занятой карте и по времени: доля карты, память под веса и кеш, среднее число запросов. Отсюда решения о совмещении нескольких моделей на карте и об ограничении размера контекста — они напрямую определяют экономику сервиса.

Разбор в атласе: Cost Model — Экономика сервиса
Что должно произойти при отказе узла с моделями?

Переключение трафика на здоровые реплики без ручного вмешательства, повтор идемпотентных запросов, честный отказ с понятным кодом там, где повтор невозможен. Плюс ограничение нагрузки, чтобы отказ одного узла не уронил остальные каскадом.

Разбор в атласе: Reliability — Отказоустойчивость
Что сделать руками до собеседования
  • Разверните модель в контейнере на GPU и замерьте задержку по квантилям под нагрузкой.
  • Настройте динамический батчинг и постройте кривую «задержка — пропускная способность».
  • Проверьте поведение сервиса при отказе одной реплики под нагрузкой.