Cloud.ru

Облачные ML-сервисы, модели как сервис, платформа для обучения

Облачный провайдер с большим направлением ИИ-сервисов: доступ к моделям по API, платформа для обучения и дообучения, инструменты для работы с данными. Специфика работы — вы строите то, чем пользуются другие ML-команды, поэтому вопросы на собеседовании смещены от «как обучить модель» к «как сделать, чтобы тысяча клиентов обучала модели одновременно».

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление: ИИ-сервисы и модели по API, платформа обучения, инфраструктура данных.

  2. Алгоритмическая секция

    Алгоритмическая секция: структуры данных, сложность, аккуратный код.

  3. Секция по LLM, RAG и агентам

    Для сервисов с языковыми моделями — секция по LLM: дообучение, обслуживание, оценка, стоимость токена.

  4. Секция по продакшену и MLOps

    Секция по эксплуатации: выкат, мониторинг, изоляция клиентов, воспроизводимость.

  5. Секция дизайна ML-системы

    Дизайн-секция: мультиарендный сервис инференса или платформа дообучения целиком.

  6. Финальная встреча

    Команда, задачи, уровень.

Что оценивают на любом направлении
  • Мультиарендность как основное ограничение: изоляция, квоты, справедливое распределение ресурсов.
  • Понимание экономики: стоимость токена и утилизация карт определяют жизнеспособность сервиса.
  • Умение проектировать API, которым пользуются другие инженеры.
  • Внимание к приватности данных клиентов, включая их использование для обучения.

Чем проверяют себя перед отбором

4 формата проверки из отбора Cloud.ru — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Живое кодирование: решение вслух и код в редакторе

На чём валятся
  • Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
  • Отсутствие практики — теория известна, но простая задача пишется час.

Пайплайны, выкат, мониторинг, дрейф и воспроизводимость

На чём валятся
  • Модель, живущая в ноутбуке: «отдали файл с весами и всё».
  • Мониторинг только по задержке и ошибкам сервиса, без качества и дрейфа.
24 вопроса в банкеТест: MLOps и инженерия

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Программа подготовки под компанию

19 тем по всем направлениям Cloud.ru — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 19 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под Cloud.ru · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Модели как сервисModels as a Service

Обслуживание языковых и мультимодальных моделей по API: квоты, задержка, стоимость, безопасность. Специфика — непредсказуемый профиль запросов и требование одинакового качества обслуживания для всех клиентов.

Пройти тест: Генеративный ИИ и LLM (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под Cloud.ru · Модели как сервис.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Что определяет пропускную способность сервиса языковых моделей?

Память карты и KV-кеш: число одновременных последовательностей ограничено именно им, а не вычислениями. Отсюда непрерывный батчинг, вытеснение и приоритеты, ограничение длины контекста и раздельные пулы для коротких и длинных запросов.

Разбор в атласе: LLM Serving — Обслуживание LLM
Один клиент шлёт очень длинные запросы и мешает остальным. Что делать?

Квоты и изоляция: ограничение по токенам в единицу времени, отдельные очереди по классам запросов, приоритеты и справедливое планирование. Без этого один потребитель съедает кеш карты и портит задержку всем — классическая проблема мультиарендности.

Разбор в атласе: Scaling — Масштабирование
Как обещать клиенту стабильную задержку при генерации?

Разделять метрики: время до первого токена и скорость генерации — это разные обещания. Первое зависит от очереди и длины запроса, второе — от загруженности карты. SLA формулируют по квантилям каждой метрики отдельно, иначе обещание невыполнимо.

Разбор в атласе: Requirements and SLA — Требования и SLA
Клиент спрашивает, используете ли вы его данные для обучения. Что должно быть в ответе?

Точный режим: хранятся ли запросы, сколько, кто имеет доступ, используются ли для дообучения и как отказаться. Это часть архитектуры — журналирование и изоляция должны быть спроектированы так, чтобы ответ был честным и проверяемым.

Разбор в атласе: Privacy and Security — Приватность и безопасность
Что сделать руками до собеседования
  • Разверните открытую модель с непрерывным батчингом и замерьте время до первого токена под нагрузкой.
  • Введите квоты по токенам и проверьте, как это влияет на задержку остальных клиентов.
  • Посчитайте стоимость тысячи запросов при разной длине контекста.