YADRO

Вычислительная инфраструктура, обучение больших моделей, эффективность

Разработчик вычислительной и телеком-инфраструктуры: серверы, системы хранения, процессоры, оборудование связи. Для ML-специалиста здесь редкая специфика — работа близко к железу: как эффективно занять ускорители, сколько стоит обучение большой модели, как ускорить инференс на конкретной архитектуре. Отбор с сильным инженерным уклоном.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление: инфраструктура обучения, оптимизация моделей, прикладные ML-задачи в продуктах.

  2. Алгоритмическая секция

    Алгоритмическая секция: сложность, память, структуры данных. Близость к железу требует основ.

  3. Секция по глубокому обучению

    Секция по глубокому обучению: как устроено обучение, что происходит с памятью и градиентами.

  4. Секция по продакшену и MLOps

    Секция по эксплуатации: запуск обучения на кластере, воспроизводимость, мониторинг утилизации.

  5. Секция дизайна ML-системы

    На middle+ — дизайн: кластер обучения или сервис инференса под заданный бюджет.

  6. Финальная встреча

    Руководитель: задачи, уровень, работа на стыке с аппаратными командами.

Что оценивают на любом направлении
  • Понимание, где узкое место: вычисления, память, сеть или ввод-вывод данных.
  • Умение измерять, а не предполагать: профилирование как обычная часть работы.
  • Знание приёмов экономии памяти и ускорения обучения и инференса.
  • Готовность работать с несколькими аппаратными платформами и их ограничениями.

Чем проверяют себя перед отбором

4 формата проверки из отбора YADRO — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Живое кодирование: решение вслух и код в редакторе

На чём валятся
  • Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
  • Отсутствие практики — теория известна, но простая задача пишется час.

Обучение сетей: архитектуры, регуляризация, отладка

На чём валятся
  • Перечисление архитектур без понимания, что они решают.
  • Отсутствие плана отладки: «поменял бы параметры» вместо последовательности проверок.
24 вопроса в банкеТест: Глубокое обучение

Пайплайны, выкат, мониторинг, дрейф и воспроизводимость

На чём валятся
  • Модель, живущая в ноутбуке: «отдали файл с весами и всё».
  • Мониторинг только по задержке и ошибкам сервиса, без качества и дрейфа.
24 вопроса в банкеТест: MLOps и инженерия

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Программа подготовки под компанию

19 тем по всем направлениям YADRO — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 19 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под YADRO · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Инфраструктура обученияTraining Infrastructure

Запуск и сопровождение обучения больших моделей: распределение по картам и узлам, ввод-вывод данных, утилизация, отказы. Специфика — цена простоя кластера и то, что узкое место редко там, где его ищут в первую очередь.

Пройти тест: MLOps и инженерия (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под YADRO · Инфраструктура обучения.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Утилизация карт 40 %. Где искать причину?

Сначала в подаче данных: чтение и предобработка часто не успевают за вычислением. Затем в синхронизации между процессами и в размере батча. И только потом в самой модели. Профилировать нужно по шагам итерации — догадки здесь почти всегда ошибочны.

Разбор в атласе: Training Throughput — Ускорение обучения
Чем отличается параллелизм по данным от параллелизма по модели?

В первом на каждой карте полная копия модели и своя часть батча, синхронизируются градиенты; во втором модель разрезана между картами. Данные проще и эффективнее, пока модель помещается в память карты; когда не помещается, подключают тензорный и конвейерный параллелизм и платят за это связностью и сложностью.

Разбор в атласе: Distributed Training — Распределённое обучение
Обучение падает на 300-м шаге с нехваткой памяти. Что делать, не уменьшая модель?

Смешанная точность, накопление градиентов вместо большого батча, пересчёт активаций вместо их хранения, шардирование состояний оптимизатора. Порядок применения — от дешёвого к дорогому по потере скорости, и каждый шаг проверяется замером, а не ожиданием.

Разбор в атласе: Mixed Precision — Смешанная точность
Один узел из шестнадцати вышел из строя за час до конца обучения. Что должно спасти?

Регулярные контрольные точки и возможность продолжить с последней: на длинных запусках отказ узла — это не исключение, а ожидаемое событие. Частота сохранения выбирается по стоимости потерянных вычислений против стоимости записи состояния.

Разбор в атласе: Backups and Redundancy — Резервирование и бэкапы
Что сделать руками до собеседования
  • Профилируйте шаг обучения и определите, чем ограничена скорость: данными, вычислением или синхронизацией.
  • Сравните обучение со смешанной точностью и без по скорости и памяти.
  • Настройте контрольные точки и проверьте восстановление после принудительного сбоя.