Что проверяют на собеседовании

Разбор отбора в 42 компаниях свёлся к 20 форматам проверки — они повторяются от компании к компании. Здесь по каждому: что это, как проходит, что оценивают, на чём чаще всего валятся и чем закрывать пробелы — тест для самопроверки и темы атласа с разбором.

Отборочный этап

Проходит до встречи с командой и отсеивает поток. Готовиться к нему нужно заранее: пересдать обычно нельзя.

Отборочное тестирование способностей

Aptitude test

Числовые, вербальные и логические тесты до первой встречи

Автоматический тест на обработку информации в условиях нехватки времени: таблицы и графики с вопросами на проценты, доли и динамику, короткие тексты с проверкой выводов, последовательности фигур. Формат пришёл из массового найма и живёт в крупных банках, телекоме и корпорациях, где поток кандидатов измеряется тысячами; в продуктовых ИТ-компаниях он встречается реже и почти всегда — на стажировках.

Как проходит. Онлайн, до общения с командой. Жёсткий таймер на вопрос, вернуться к предыдущему нельзя, результат сравнивается с нормой по выборке — отсюда проходной балл в процентилях, а не в процентах правильных ответов.

Что оценивают
  • Скорость чтения таблицы или графика и корректный пересчёт долей, процентов и темпов роста.
  • Умение отличить то, что следует из текста, от того, что кажется правдоподобным.
  • Устойчивость к дефициту времени: решать приблизительно там, где точный счёт не нужен.
На чём валятся
  • Попытка считать точно всё подряд: времени хватает примерно на две трети задач, и выигрывает тот, кто оценивает порядок величины.
  • Ответ «из общих знаний», а не из приведённых данных, — в вербальной части это прямая ошибка.
Как готовиться
  • Прорешайте десяток задач на проценты, доли и изменение показателя в процентных пунктах против процентов — здесь теряют больше всего.
  • Потренируйтесь читать график и сразу называть порядок величины, не доставая калькулятор.
  • Проверьте себя на вопросах о распределениях и вероятности: базовая часть теста по статистике ровно об этом.
Материалы: темы атласаВстречается в отборе (7 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Статистика и вероятность

Отборочный контест

Online coding contest

Автоматически проверяемые задачи до собеседования

Набор алгоритмических задач с автоматической проверкой: решение отправляется в тестирующую систему, засчитываются только пройденные тесты. Так устроен вход в стажировки и школы почти всех крупных ИТ-компаний, а у части компаний — и в штат: контест дешевле секции и отсеивает поток до живых встреч.

Как проходит. Несколько задач на два-четыре часа, язык на выбор, ограничение по времени и памяти на тест. Обратная связь — только вердикт системы, объяснить решение словами возможности нет.

Что оценивают
  • Умение уложиться в асимптотику: задача с n до миллиона не примет решение за O(n²).
  • Аккуратность с граничными случаями — пустой ввод, переполнение, одинаковые элементы.
  • Скорость: задач больше, чем времени, и выбор порядка решения — часть проверки.
На чём валятся
  • Решение «в лоб», которое проходит примеры и падает на максимальных ограничениях.
  • Потеря часа на самой трудной задаче вместо двух средних.
Как готовиться
  • Восстановите ручную беглость: бинарный поиск, два указателя, префиксные суммы, обход графа — без подглядывания.
  • Научитесь по ограничениям определять допустимую сложность: n ≤ 10⁵ — это O(n log n), n ≤ 20 — перебор подмножеств.
  • Прорешайте задачи с таймером: контест проверяет ещё и работу в дефиците времени.
Материалы: темы атласаВстречается в отборе (2 компании)
Проверить себя: 29 вопросов и 2 открытые задачиТест: Алгоритмы и структуры данных

Живая секция

Разговор с инженером на 40–90 минут. Оценивается не только ответ, но и то, как вы к нему идёте.

Алгоритмическая секция

Algorithmic interview

Живое кодирование: решение вслух и код в редакторе

Отдельная от ML проверка, которая встречается у трети компаний разбора — и у продуктовых, и у банков, и у вендоров ПО. Спрашивают не редкие алгоритмы, а рабочий набор: массивы, хеш-таблицы, сортировки, деревья, графы, динамика. Вместе с решением оценивают умение рассуждать вслух, уточнять условие и чинить собственные ошибки.

Как проходит. 45–60 минут в общем редакторе без подсказок среды. Одна-две задачи, обсуждение сложности до написания кода, затем разбор граничных случаев и часто — просьба ускорить решение.

Что оценивают
  • Оценка сложности по времени и по памяти — до кода, а не после.
  • Выбор структуры данных под задачу и объяснение, почему именно она.
  • Чистота кода и работа с граничными случаями без напоминания.
  • Диалог: уточняющие вопросы в начале и внятная реакция на контрпример.
На чём валятся
  • Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
  • Отсутствие практики — теория известна, но простая задача пишется час.
  • Игнорирование просьбы «а можно быстрее»: она почти всегда означает замену перебора на словарь, указатели или префиксные суммы.
Как готовиться
  • Прорешайте 30–50 задач вслух: проговаривая сложность и проверяя код на краевых входах.
  • Отработайте типовые приёмы: два указателя, скользящее окно, префиксные суммы, обход графа, динамика по подотрезкам.
  • Пройдите тест по алгоритмам и закройте слабые оси разбором в атласе.
Материалы: темы атласаВстречается в отборе (16 компаний)
Проверить себя: 29 вопросов и 2 открытые задачиТест: Алгоритмы и структуры данных

Секция по Python и работе с данными

Python & data handling

Код, который готовит данные: агрегаты, соединения, пропуски

Практическая секция вокруг табличных данных: собрать признак из нескольких источников, посчитать агрегат по группе, обработать пропуски и дубликаты, объяснить, что произойдёт на данных в сто раз большего размера. Спрашивают у аналитиков и ML-специалистов там, где данные готовит сам исполнитель.

Как проходит. 40–60 минут в ноутбуке или редакторе. Иногда с настоящим датасетом, иногда «на словах»: как бы вы это посчитали и что здесь сломается.

Что оценивают
  • Уверенная работа с группировками, соединениями и оконными расчётами.
  • Внимание к пропускам, дубликатам и типам — до того, как посчитана метрика.
  • Понимание стоимости операции: что будет, когда таблица не помещается в память.
На чём валятся
  • Код, который работает на примере и не масштабируется: построчные циклы вместо векторных операций.
  • Молчаливое отбрасывание пропусков без объяснения, почему это допустимо.
Как готовиться
  • Повторите предобработку: пропуски, выбросы, кодирование категорий, приведение типов.
  • Потренируйтесь считать одну и ту же агрегацию в таблице и в SQL — на секции просят и то и другое.
  • Разберите, чем отличается обработка в памяти от распределённой: где заканчивается pandas.
Материалы: темы атласаВстречается в отборе (7 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: SQL и инженерия данных

SQL-секция

SQL interview

Соединения, оконные функции и цена запроса на большой таблице

Проверка того, что специалист достанет данные сам. Задачи продуктовые: конверсия по дням, удержание по когортам, топ-N внутри группы, первое и последнее событие пользователя. Синтаксис здесь не главное — главное, понимает ли человек, во что превращается запрос на таблице в сотни миллионов строк.

Как проходит. 30–60 минут: несколько задач возрастающей сложности, часто без выполнения запроса — код пишется в общем документе и обсуждается вслух.

Что оценивают
  • Оконные функции и понимание разницы между ROW_NUMBER, RANK и агрегатом с рамкой.
  • Корректная работа с NULL и внешними соединениями.
  • Понимание стоимости: разбиение, отсечение партиций, порядок фильтрации, дорогие DISTINCT и соединения.
На чём валятся
  • COUNT(*) вместо COUNT(поле) после LEFT JOIN — классическая тихая ошибка.
  • Запрос без фильтра по ключу разбиения: на боевой таблице он просто не доедет.
  • Ответ «оптимизирует движок» вместо объяснения, что именно произойдёт с данными.
Как готовиться
  • Прорешайте задачи на оконные функции: топ-N в группе, скользящие агрегаты, разница с предыдущей строкой.
  • Разберите три ловушки: NULL в NOT IN, дубликаты после соединения, счёт по внешнему соединению.
  • Проговорите, как устроено хранилище: разбиение, форматы, почему колоночное хранение быстрее для аналитики.
Материалы: темы атласаВстречается в отборе (20 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: SQL и инженерия данных

Секция по инженерии данных

Data engineering interview

Пайплайны, потоки, идемпотентность и качество данных

Разговор про то, как данные доезжают до модели: источники и захват изменений, батч против потока, оркестрация и перезапуски, проверки качества и контракты с командами-источниками. Обязательная секция для дата-инженеров и частая — для ML-инженеров в компаниях с большим потоком событий.

Как проходит. 60 минут вокруг конкретной схемы: «у нас есть такой источник и такое требование по свежести — спроектируйте загрузку». Часто с продолжением: «а теперь источник упал на шесть часов».

Что оценивают
  • Идемпотентность и поведение при перезапуске: не задваиваются ли данные.
  • Выбор между батчем и потоком по требованию к свежести, а не по моде.
  • Проверки качества на выходе и реакция на их срабатывание.
  • Понимание распределённой обработки: перемешивание, перекос ключа, стоимость соединения.
На чём валятся
  • Схема без ответа на вопрос «что происходит при повторном запуске».
  • Поток там, где хватило бы часового батча, — и наоборот, сутки задержки там, где нужны минуты.
  • Отсутствие проверок: задача завершилась успешно, а данных половина.
Как готовиться
  • Разберите идемпотентность и перезапись партиции как основной приём безопасного перезапуска.
  • Повторите гарантии доставки в очередях и способы дедупликации на стороне потребителя.
  • Проговорите проверки качества: объём, свежесть, доля пропусков, ссылочная целостность.
Материалы: темы атласаВстречается в отборе (4 компании)
Проверить себя: 24 вопроса и 2 открытые задачиТест: SQL и инженерия данных

ML-секция: модели, признаки, валидация

Core ML interview

Классика табличных задач и честная проверка качества

Ядро отбора для любой ML-роли. Линейные модели и бустинги, признаки и утечки, выбор метрики под задачу, схема валидации, дисбаланс классов, калибровка. Вопросы почти всегда цепляются за опыт в резюме: «вы писали про отток — как вы его валидировали».

Как проходит. 60–90 минут диалога. Начинается с задачи из вашего опыта, дальше уходит в детали: почему эта модель, почему эта метрика, как вы поняли, что она работает.

Что оценивают
  • Умение поставить задачу: что предсказываем, что делают с предсказанием, с чем сравниваем.
  • Валидация без утечек и разбиение, соответствующее тому, как модель будет работать.
  • Выбор метрики под цену ошибки, а не по привычке.
  • Разбор ошибок по срезам вместо одной агрегированной цифры.
На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
  • Accuracy на задаче с дисбалансом один к тысяче.
Как готовиться
  • Восстановите линию «постановка → бейзлайн → признаки → валидация → метрика → разбор ошибок» на своём же проекте.
  • Повторите метрики классификации и регрессии и условия, при которых каждая вводит в заблуждение.
  • Разберите утечки: признак из будущего, агрегаты по объекту, предобработка до разбиения.
Материалы: темы атласаВстречается в отборе (39 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Классический ML

Продуктовая секция и A/B

Statistics & experimentation

Дизайн эксперимента, значимость и решение по результату

Проверка того, что специалист умеет доказывать пользу изменения, а не только обучать модель. Гипотеза и метрика, размер выборки и мощность, длительность теста, множественные сравнения, интерпретация незначимого результата. В продуктовых компаниях эта секция часто весит не меньше ML-секции.

Как проходит. 45–60 минут: разбор сценария «выкатили изменение, метрика выросла на 1,5 % — что дальше» с уточнениями, которые ломают поспешный вывод.

Что оценивают
  • Понимание ошибок первого и второго рода и того, чем платят за снижение каждой.
  • Расчёт размера выборки до запуска и честное отношение к подглядыванию.
  • Учёт множественных сравнений и срезов.
  • Способность сказать «эффекта нет» и объяснить, что это тоже результат.
На чём валятся
  • Остановка теста в момент, когда p-value впервые стало меньше 0,05.
  • Вывод по срезу, найденному после эксперимента, без поправки.
  • Смешение статистической значимости с практической: эффект значим, но не окупает разработку.
Как готовиться
  • Повторите проверку гипотез, доверительные интервалы и расчёт мощности.
  • Разберите приёмы снижения дисперсии и типовые ловушки: подглядывание, сетевые эффекты, тяжёлые хвосты.
  • Потренируйтесь формулировать решение: что сделаете при росте, падении и отсутствии эффекта.
Материалы: темы атласаВстречается в отборе (6 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Статистика и вероятность

Секция по глубокому обучению

Deep learning interview

Обучение сетей: архитектуры, регуляризация, отладка

Разговор про нейросети как про инструмент, которым вы пользуетесь: что делает нормализация, почему расходится обучение, как подобрать шаг, чем отличается дообучение от обучения с нуля, где заканчивается память карты. Спрашивают там, где модели не табличные.

Как проходит. 60 минут: от устройства архитектуры к отладке. Частый ход — «лосс не падает, ваши действия по порядку».

Что оценивают
  • Понимание обратного распространения и того, что происходит с градиентами.
  • Регуляризация и ранняя остановка как ответ на переобучение, а не заклинание.
  • Отладка обучения: скорость обучения, инициализация, нормализация, размер батча.
  • Перенос обучения и работа с малым объёмом данных.
На чём валятся
  • Перечисление архитектур без понимания, что они решают.
  • Отсутствие плана отладки: «поменял бы параметры» вместо последовательности проверок.
Как готовиться
  • Повторите оптимизаторы и расписания шага обучения: чем Adam отличается от SGD с импульсом и когда это важно.
  • Разберите нормализацию и остаточные связи — вопросы про них задают почти всегда.
  • Проговорите план отладки: переобучить на одном батче, проверить данные, затем гиперпараметры.
Материалы: темы атласаВстречается в отборе (1 компания)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Глубокое обучение

Секция по NLP

NLP interview

Токенизация, представления, трансформеры, поиск и оценка

Направленческая секция для поиска, ассистентов, классификации обращений и извлечения сущностей. Проверяют всю цепочку — от токенизации до метрик, — и отдельно то, как вы оцениваете качество там, где правильный ответ не единственный.

Как проходит. 60 минут: теория вперемешку с вашим опытом. Частая развилка — «когда достаточно TF-IDF и логистической регрессии, а когда нужен трансформер».

Что оценивают
  • Подсловная токенизация и её связь с длиной последовательности и редкими словами.
  • Различие энкодерных и декодерных моделей и выбор под задачу.
  • Оценка качества: метрики по сущностям целиком, а не по токенам; оценка генерации.
  • Поиск по смыслу и гибрид с лексическим поиском.
На чём валятся
  • Ответ «возьму BERT» без бейзлайна и без разговора о стоимости инференса.
  • Метрики NER по токенам вместо сущностей.
Как готовиться
  • Соберите бейзлайн TF-IDF + линейная модель и сравните с дообученным трансформером на своих данных.
  • Разберите внимание и его сложность по длине последовательности.
  • Повторите оценку поиска и генерации: recall@k, MRR, метрики текста и их ограничения.
Материалы: темы атласаВстречается в отборе (2 компании)
Проверить себя: 24 вопроса и 2 открытые задачиТест: NLP

Секция по компьютерному зрению

Computer vision interview

Свёртки и трансформеры, детекция, сегментация, метрики

Секция для задач с изображениями и видео: модерация, поиск по картинке, документы и OCR, промышленный контроль, беспилотные технологии. Спрашивают архитектуры, работу с данными и метрики, которые в зрении устроены сложнее, чем в классификации.

Как проходит. 60 минут: устройство модели, затем практика — мало данных, редкий класс, расхождение офлайна и прода.

Что оценивают
  • Как считается mAP и что означает порог IoU.
  • Различие одноэтапных и двухэтапных детекторов и выбор под требования по задержке.
  • Аугментации и перенос обучения как ответ на нехватку размеченных данных.
  • Поиск причин расхождения качества между офлайном и продом.
На чём валятся
  • Метрика «точность» в задаче детекции.
  • Аугментации «по ощущениям», без проверки влияния на метрику.
  • Разный препроцессинг в обучении и инференсе — самая частая причина просадки в проде.
Как готовиться
  • Разберите метрики детекции и сегментации: IoU, mAP, усреднение по порогам.
  • Повторите перенос обучения и аугментации, включая их влияние на редкие классы.
  • Проверьте на своём проекте, совпадает ли препроцессинг обучения и инференса.
Материалы: темы атласаВстречается в отборе (3 компании)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Computer Vision

Секция по рекомендациям и ранжированию

RecSys & ranking interview

Кандидаты, ранжирование, метрики @K и расхождение с онлайном

Секция для лент, поиска, подборок и офферов. Ядро разговора — двухэтапная схема под бюджет задержки, офлайн-метрики и их вечное расхождение с результатами A/B, холодный старт и смещение показа.

Как проходит. 60 минут: от постановки к схеме. Часто сразу в формате дизайна: «как бы вы построили рекомендации для нашего каталога».

Что оценивают
  • Понимание, зачем нужен отбор кандидатов и чем он ограничивает потолок качества.
  • Метрики @K и их связь с тем, что видит пользователь.
  • Смещение показа в логах и способы с ним работать.
  • Холодный старт для пользователя и для объекта.
На чём валятся
  • Одна модель на весь каталог без разговора о задержке.
  • Вывод по офлайн-метрике без признания, что логи собраны старой моделью.
Как готовиться
  • Разберите метрики ранжирования: precision@K, recall@K, NDCG, MRR.
  • Повторите двухэтапную схему и требования к кандидатогенерации.
  • Проговорите план расследования, когда офлайн вырос, а A/B нет.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (5 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Рекомендательные системы

Секция по временным рядам и спросу

Time series interview

Стационарность, валидация во времени, прогноз спроса

Секция для прогноза спроса, нагрузки, остатков и цен — в ритейле, логистике, промышленности и финансах. Главное, что проверяют: понимает ли человек, что данные упорядочены, и не рушит ли он это порядком обычной кросс-валидацией.

Как проходит. 60 минут вокруг конкретного ряда: сезонность, праздники, промо, пропуски, прерывистый спрос и горизонт прогноза.

Что оценивают
  • Валидация по времени и бэктест на нескольких окнах.
  • Сезонность и календарные эффекты как признаки, а не как шум.
  • Выбор между статистическими моделями и признаковым прогнозом бустингом.
  • Метрики прогноза и их поведение при нулях и разных масштабах рядов.
На чём валятся
  • Случайное разбиение — мгновенный отказ на этой секции.
  • MAPE на рядах с нулями.
  • Прогноз без горизонта: «на будущее» вместо «на 14 дней вперёд с обновлением раз в сутки».
Как готовиться
  • Повторите стационарность, автокорреляцию и разложение на тренд и сезонность.
  • Соберите признаковый прогноз: лаги, скользящие агрегаты, календарь, промо.
  • Разберите метрики: MAE, RMSE, WAPE и почему MAPE часто неприменима.
Материалы: темы атласаВстречается в отборе (6 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Временные ряды

Секция по речи

Speech interview

Распознавание и синтез: признаки, декодирование, метрики

Секция для голосовых помощников, контакт-центров и биометрии. Спрашивают представление звука, акустические и языковые модели, декодирование, метрики распознавания и качество синтеза.

Как проходит. 60 минут: устройство системы и практика — шум, акценты, доменные слова, задержка в реальном времени.

Что оценивают
  • Признаки звука и их связь с архитектурой модели.
  • Метрика WER и то, какие ошибки она не различает.
  • Работа с доменной лексикой и редкими словами.
  • Требования реального времени: потоковое распознавание против офлайнового.
На чём валятся
  • Оценка качества на чистых студийных записях при боевом потоке из телефонии.
  • Отсутствие разговора о задержке в задачах реального времени.
Как готовиться
  • Повторите цепочку от сигнала к тексту: признаки, акустическая модель, декодирование.
  • Разберите метрики распознавания и оценки синтеза.
  • Проговорите, как адаптировать систему к домену и шуму.
Материалы: темы атласаВстречается в отборе (1 компания)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Речь: ASR и TTS

Секция по LLM, RAG и агентам

LLM & RAG interview

Дообучение, поиск с генерацией, оценка и стоимость

Самая молодая секция отбора и самая быстрорастущая: ассистенты, поиск по базе знаний, обработка документов, агенты. Проверяют не знание модных слов, а понимание того, когда нужен RAG, когда дообучение, как это оценивать и сколько это стоит на запрос.

Как проходит. 60 минут: типичная задача — «сделать ассистента по нашей базе знаний». Дальше уточнения: галлюцинации, свежесть данных, приватность, бюджет.

Что оценивают
  • Разделение задач retrieval и генерации и отдельная оценка каждой.
  • Выбор между промптом, RAG, дообучением и PEFT с обоснованием.
  • Оценка качества: чем измеряется ответ, где нужны люди, где LLM-судья и как проверяется его согласие с людьми.
  • Стоимость и задержка: длина контекста, кеш, маршрутизация на меньшую модель.
На чём валятся
  • «Дообучим модель» там, где проблема в поиске по документам.
  • Оценка «на глаз» без эталонного набора.
  • Отсутствие разговора о стоимости токенов и приватности данных.
Как готовиться
  • Соберите RAG на своих документах и измерьте retrieval отдельно от ответа.
  • Разберите LoRA и другие экономные способы дообучения.
  • Проговорите защиту от инъекций в промпт и работу с персональными данными.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (6 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Генеративный ИИ и LLM

Секция по продакшену и MLOps

MLOps interview

Пайплайны, выкат, мониторинг, дрейф и воспроизводимость

Проверка инженерной части: как модель попадает в прод и что с ней происходит дальше. Версионирование данных и моделей, воспроизводимость обучения, контейнеры и выкат, мониторинг качества и дрейфа, регламент переобучения.

Как проходит. 60 минут: часто по следам вашего опыта — «расскажите, как у вас выкатывалась модель» с уточнениями про откат, тесты и алерты.

Что оценивают
  • Воспроизводимость: можно ли повторить обучение полугодовой давности.
  • Выкат: теневой режим, канарейка, откат, хранение версий.
  • Мониторинг: что меряется, какие алерты и кто их получает.
  • Тесты в ML: на данные, на пайплайн, на модель.
На чём валятся
  • Модель, живущая в ноутбуке: «отдали файл с весами и всё».
  • Мониторинг только по задержке и ошибкам сервиса, без качества и дрейфа.
  • Переобучение по расписанию без проверки, что новая модель лучше старой.
Как готовиться
  • Разберите связку трекинга экспериментов, версионирования данных и реестра моделей.
  • Повторите способы выката и отката и то, чем теневой режим отличается от канареечного.
  • Проговорите, что мониторить, когда разметка приходит с задержкой в месяц.
Материалы: темы атласаВстречается в отборе (5 компаний)
Проверить себя: 24 вопроса и 2 открытые задачиТест: MLOps и инженерия

Научная секция

Research interview

Статьи, воспроизведение результатов и математика под ними

Секция для исследовательских ролей: лаборатории компаний, команды предобучения моделей, R&D. Обсуждают ваши работы и работы других: что именно предложено, какой эксперимент это доказывает, что в нём слабо и как бы вы это проверили.

Как проходит. 60–90 минут: разбор одной-двух статей, часто по вашему выбору, и вывод формул на доске.

Что оценивают
  • Умение отделить вклад работы от её оформления.
  • Критика эксперимента: абляции, честность сравнения, статистическая значимость результатов.
  • Математическая база: производные, вероятность, оптимизация.
  • Воспроизводимость: что нужно, чтобы повторить результат.
На чём валятся
  • Пересказ аннотации вместо разбора метода.
  • Отсутствие критики: «статья хорошая, результат лучше предыдущего».
Как готовиться
  • Разберите две-три свежие работы по своему направлению до уровня «могу воспроизвести».
  • Повторите математику: градиенты, вероятностные модели, функции потерь и их смысл.
  • Потренируйтесь называть, какая абляция подтверждает заявленный вклад.
Материалы: темы атласаВстречается в отборе (1 компания)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Глубокое обучение

Секция по ML в безопасности

ML for security

Редкие события, состязательный противник и цена ложной тревоги

Секция в компаниях информационной безопасности и в антифроде: обнаружение аномалий и вредоносной активности, работа с крайне редким положительным классом и с противником, который адаптируется к вашей модели.

Как проходит. 60 минут: постановка вроде «ловим вредоносные файлы» или «ловим захват аккаунта» с переходом к порогам, ложным срабатываниям и устареванию модели.

Что оценивают
  • Работа с сильным дисбалансом и выбор рабочей точки по цене ошибок.
  • Обнаружение аномалий без разметки и его ограничения.
  • Состязательность: атаки на модель, отравление данных, обход детектора.
  • Регламент обновления: как быстро система реагирует на новую схему.
На чём валятся
  • ROC-AUC как единственная метрика при доле положительных в сотые доли процента.
  • Статичная модель без плана обновления в состязательной задаче.
  • Игнорирование нагрузки на аналитиков: поток ложных тревог убивает систему быстрее плохой метрики.
Как готовиться
  • Разберите PR-AUC и выбор порога по матрице стоимостей.
  • Повторите методы поиска аномалий и их поведение на смещённых данных.
  • Проговорите атаки на модели и защиту от них.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (3 компании)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Классический ML

Проектная секция

Открытая задача без единственного правильного ответа: проверяется ход рассуждения целиком.

Секция дизайна ML-системы

ML system design

От постановки до эксплуатации на одной доске

Главный фильтр на middle и выше. Задача формулируется одной фразой — «спроектируйте поиск по фото», «сделайте антифрод», — а дальше нужно самому развернуть её в систему: требования, метрики, данные, признаки, модель, инференс, эксперимент, мониторинг, деградация.

Как проходит. 60–90 минут на виртуальной доске. Интервьюер меняет условия по ходу: вырос трафик, упал источник данных, бюджет урезали втрое.

Что оценивают
  • Уточнение требований до архитектуры: трафик, задержка, цена ошибки, объём данных.
  • Связь метрики модели с метрикой продукта.
  • Разделение офлайн- и онлайн-части, работа с признаками и их согласованность.
  • План выката, эксперимента и отката.
  • Мониторинг, дрейф, переобучение и поведение системы при отказе.
На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
  • Отсутствие бейзлайна и плана деградации.
Как готовиться
  • Прогоните вслух три-четыре кейса целиком по одной канве и засеките время.
  • Выучите канву, а не решения: требования → метрики → данные → модель → инференс → эксперимент → эксплуатация.
  • Разберите кейсы атласа: задержка в рекомендациях, антифрод, LLM в проде, качество телеметрии.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (24 компании)
Проверить себя: 22 вопроса и 2 открытые задачиТест: Дизайн ML-систем

Домашняя работа

Работа дома с последующей защитой: ценится инженерная культура, а не третий знак метрики.

Тестовое задание на данных

Take-home assignment

Датасет, несколько дней и разбор решения на защите

Домашняя задача с данными: построить модель, объяснить выбор и оформить результат. Иногда — соревнование с лидербордом, иногда — открытая задача без единственного правильного ответа. Оценивают не столько метрику, сколько инженерную культуру и ход рассуждения.

Как проходит. От двух дней до недели. Результат — код и краткий отчёт; затем защита на 30–60 минут, где спрашивают именно про ваши решения.

Что оценивают
  • Разведочный анализ и выводы из него, а не картинки ради картинок.
  • Бейзлайн и честное сравнение с ним.
  • Валидация, соответствующая задаче, и отсутствие утечек.
  • Воспроизводимость: код запускается у проверяющего.
  • Отчёт: что сделано, что не сделано и почему.
На чём валятся
  • Гонка за третьим знаком метрики вместо разбора данных.
  • Ноутбук на 600 ячеек без структуры и без фиксации зерна случайности.
  • Отсутствие раздела «ограничения и что я бы сделал дальше» — его ждут почти всегда.
Как готовиться
  • Отработайте скелет решения: разведка → бейзлайн → валидация → модель → разбор ошибок → выводы.
  • Заготовьте шаблон проекта: структура папок, фиксированное зерно, README с запуском.
  • Научитесь укладываться: лучше законченное простое решение, чем незаконченное сложное.
Материалы: темы атласаВстречается в отборе (1 компания)
Проверить себя: 24 вопроса и 2 открытые задачиТест: Классический ML

Откуда это собрано

Описания форматов — обобщение открытых источников: карьерных страниц компаний, публичных рассказов инженеров о том, как устроен их отбор, и отзывов кандидатов. Это типовая картина, а не регламент конкретной компании: состав и порядок секций меняются от команды к команде и от года к году. Проверить в атласе можно другое — знает ли человек то, что на этих секциях спрашивают; для этого у каждого формата стоит тест и темы с разбором.

К компаниям →