Алгоритмическая секция
Algorithmic interviewЖивое кодирование: решение вслух и код в редакторе
Отдельная от ML проверка, которая встречается у трети компаний разбора — и у продуктовых, и у банков, и у вендоров ПО. Спрашивают не редкие алгоритмы, а рабочий набор: массивы, хеш-таблицы, сортировки, деревья, графы, динамика. Вместе с решением оценивают умение рассуждать вслух, уточнять условие и чинить собственные ошибки.
Как проходит. 45–60 минут в общем редакторе без подсказок среды. Одна-две задачи, обсуждение сложности до написания кода, затем разбор граничных случаев и часто — просьба ускорить решение.
Что оценивают- Оценка сложности по времени и по памяти — до кода, а не после.
- Выбор структуры данных под задачу и объяснение, почему именно она.
- Чистота кода и работа с граничными случаями без напоминания.
- Диалог: уточняющие вопросы в начале и внятная реакция на контрпример.
На чём валятся- Молчаливое написание кода: интервьюер оценивает ход рассуждения, а не только результат.
- Отсутствие практики — теория известна, но простая задача пишется час.
- Игнорирование просьбы «а можно быстрее»: она почти всегда означает замену перебора на словарь, указатели или префиксные суммы.
Как готовиться- Прорешайте 30–50 задач вслух: проговаривая сложность и проверяя код на краевых входах.
- Отработайте типовые приёмы: два указателя, скользящее окно, префиксные суммы, обход графа, динамика по подотрезкам.
- Пройдите тест по алгоритмам и закройте слабые оси разбором в атласе.
Материалы: темы атласаВстречается в отборе (16 компаний)Секция по Python и работе с данными
Python & data handlingКод, который готовит данные: агрегаты, соединения, пропуски
Практическая секция вокруг табличных данных: собрать признак из нескольких источников, посчитать агрегат по группе, обработать пропуски и дубликаты, объяснить, что произойдёт на данных в сто раз большего размера. Спрашивают у аналитиков и ML-специалистов там, где данные готовит сам исполнитель.
Как проходит. 40–60 минут в ноутбуке или редакторе. Иногда с настоящим датасетом, иногда «на словах»: как бы вы это посчитали и что здесь сломается.
Что оценивают- Уверенная работа с группировками, соединениями и оконными расчётами.
- Внимание к пропускам, дубликатам и типам — до того, как посчитана метрика.
- Понимание стоимости операции: что будет, когда таблица не помещается в память.
На чём валятся- Код, который работает на примере и не масштабируется: построчные циклы вместо векторных операций.
- Молчаливое отбрасывание пропусков без объяснения, почему это допустимо.
Как готовиться- Повторите предобработку: пропуски, выбросы, кодирование категорий, приведение типов.
- Потренируйтесь считать одну и ту же агрегацию в таблице и в SQL — на секции просят и то и другое.
- Разберите, чем отличается обработка в памяти от распределённой: где заканчивается pandas.
Материалы: темы атласаВстречается в отборе (7 компаний)SQL-секция
SQL interviewСоединения, оконные функции и цена запроса на большой таблице
Проверка того, что специалист достанет данные сам. Задачи продуктовые: конверсия по дням, удержание по когортам, топ-N внутри группы, первое и последнее событие пользователя. Синтаксис здесь не главное — главное, понимает ли человек, во что превращается запрос на таблице в сотни миллионов строк.
Как проходит. 30–60 минут: несколько задач возрастающей сложности, часто без выполнения запроса — код пишется в общем документе и обсуждается вслух.
Что оценивают- Оконные функции и понимание разницы между ROW_NUMBER, RANK и агрегатом с рамкой.
- Корректная работа с NULL и внешними соединениями.
- Понимание стоимости: разбиение, отсечение партиций, порядок фильтрации, дорогие DISTINCT и соединения.
На чём валятся- COUNT(*) вместо COUNT(поле) после LEFT JOIN — классическая тихая ошибка.
- Запрос без фильтра по ключу разбиения: на боевой таблице он просто не доедет.
- Ответ «оптимизирует движок» вместо объяснения, что именно произойдёт с данными.
Как готовиться- Прорешайте задачи на оконные функции: топ-N в группе, скользящие агрегаты, разница с предыдущей строкой.
- Разберите три ловушки: NULL в NOT IN, дубликаты после соединения, счёт по внешнему соединению.
- Проговорите, как устроено хранилище: разбиение, форматы, почему колоночное хранение быстрее для аналитики.
Материалы: темы атласаВстречается в отборе (20 компаний)Секция по инженерии данных
Data engineering interviewПайплайны, потоки, идемпотентность и качество данных
Разговор про то, как данные доезжают до модели: источники и захват изменений, батч против потока, оркестрация и перезапуски, проверки качества и контракты с командами-источниками. Обязательная секция для дата-инженеров и частая — для ML-инженеров в компаниях с большим потоком событий.
Как проходит. 60 минут вокруг конкретной схемы: «у нас есть такой источник и такое требование по свежести — спроектируйте загрузку». Часто с продолжением: «а теперь источник упал на шесть часов».
Что оценивают- Идемпотентность и поведение при перезапуске: не задваиваются ли данные.
- Выбор между батчем и потоком по требованию к свежести, а не по моде.
- Проверки качества на выходе и реакция на их срабатывание.
- Понимание распределённой обработки: перемешивание, перекос ключа, стоимость соединения.
На чём валятся- Схема без ответа на вопрос «что происходит при повторном запуске».
- Поток там, где хватило бы часового батча, — и наоборот, сутки задержки там, где нужны минуты.
- Отсутствие проверок: задача завершилась успешно, а данных половина.
Как готовиться- Разберите идемпотентность и перезапись партиции как основной приём безопасного перезапуска.
- Повторите гарантии доставки в очередях и способы дедупликации на стороне потребителя.
- Проговорите проверки качества: объём, свежесть, доля пропусков, ссылочная целостность.
Материалы: темы атласаВстречается в отборе (4 компании)ML-секция: модели, признаки, валидация
Core ML interviewКлассика табличных задач и честная проверка качества
Ядро отбора для любой ML-роли. Линейные модели и бустинги, признаки и утечки, выбор метрики под задачу, схема валидации, дисбаланс классов, калибровка. Вопросы почти всегда цепляются за опыт в резюме: «вы писали про отток — как вы его валидировали».
Как проходит. 60–90 минут диалога. Начинается с задачи из вашего опыта, дальше уходит в детали: почему эта модель, почему эта метрика, как вы поняли, что она работает.
Что оценивают- Умение поставить задачу: что предсказываем, что делают с предсказанием, с чем сравниваем.
- Валидация без утечек и разбиение, соответствующее тому, как модель будет работать.
- Выбор метрики под цену ошибки, а не по привычке.
- Разбор ошибок по срезам вместо одной агрегированной цифры.
На чём валятся- «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
- Случайное разбиение в задаче, где данные упорядочены во времени.
- Accuracy на задаче с дисбалансом один к тысяче.
Как готовиться- Восстановите линию «постановка → бейзлайн → признаки → валидация → метрика → разбор ошибок» на своём же проекте.
- Повторите метрики классификации и регрессии и условия, при которых каждая вводит в заблуждение.
- Разберите утечки: признак из будущего, агрегаты по объекту, предобработка до разбиения.
Материалы: темы атласаВстречается в отборе (39 компаний)Продуктовая секция и A/B
Statistics & experimentationДизайн эксперимента, значимость и решение по результату
Проверка того, что специалист умеет доказывать пользу изменения, а не только обучать модель. Гипотеза и метрика, размер выборки и мощность, длительность теста, множественные сравнения, интерпретация незначимого результата. В продуктовых компаниях эта секция часто весит не меньше ML-секции.
Как проходит. 45–60 минут: разбор сценария «выкатили изменение, метрика выросла на 1,5 % — что дальше» с уточнениями, которые ломают поспешный вывод.
Что оценивают- Понимание ошибок первого и второго рода и того, чем платят за снижение каждой.
- Расчёт размера выборки до запуска и честное отношение к подглядыванию.
- Учёт множественных сравнений и срезов.
- Способность сказать «эффекта нет» и объяснить, что это тоже результат.
На чём валятся- Остановка теста в момент, когда p-value впервые стало меньше 0,05.
- Вывод по срезу, найденному после эксперимента, без поправки.
- Смешение статистической значимости с практической: эффект значим, но не окупает разработку.
Как готовиться- Повторите проверку гипотез, доверительные интервалы и расчёт мощности.
- Разберите приёмы снижения дисперсии и типовые ловушки: подглядывание, сетевые эффекты, тяжёлые хвосты.
- Потренируйтесь формулировать решение: что сделаете при росте, падении и отсутствии эффекта.
Материалы: темы атласаВстречается в отборе (6 компаний)Секция по глубокому обучению
Deep learning interviewОбучение сетей: архитектуры, регуляризация, отладка
Разговор про нейросети как про инструмент, которым вы пользуетесь: что делает нормализация, почему расходится обучение, как подобрать шаг, чем отличается дообучение от обучения с нуля, где заканчивается память карты. Спрашивают там, где модели не табличные.
Как проходит. 60 минут: от устройства архитектуры к отладке. Частый ход — «лосс не падает, ваши действия по порядку».
Что оценивают- Понимание обратного распространения и того, что происходит с градиентами.
- Регуляризация и ранняя остановка как ответ на переобучение, а не заклинание.
- Отладка обучения: скорость обучения, инициализация, нормализация, размер батча.
- Перенос обучения и работа с малым объёмом данных.
На чём валятся- Перечисление архитектур без понимания, что они решают.
- Отсутствие плана отладки: «поменял бы параметры» вместо последовательности проверок.
Как готовиться- Повторите оптимизаторы и расписания шага обучения: чем Adam отличается от SGD с импульсом и когда это важно.
- Разберите нормализацию и остаточные связи — вопросы про них задают почти всегда.
- Проговорите план отладки: переобучить на одном батче, проверить данные, затем гиперпараметры.
Материалы: темы атласаВстречается в отборе (1 компания)Секция по NLP
NLP interviewТокенизация, представления, трансформеры, поиск и оценка
Направленческая секция для поиска, ассистентов, классификации обращений и извлечения сущностей. Проверяют всю цепочку — от токенизации до метрик, — и отдельно то, как вы оцениваете качество там, где правильный ответ не единственный.
Как проходит. 60 минут: теория вперемешку с вашим опытом. Частая развилка — «когда достаточно TF-IDF и логистической регрессии, а когда нужен трансформер».
Что оценивают- Подсловная токенизация и её связь с длиной последовательности и редкими словами.
- Различие энкодерных и декодерных моделей и выбор под задачу.
- Оценка качества: метрики по сущностям целиком, а не по токенам; оценка генерации.
- Поиск по смыслу и гибрид с лексическим поиском.
На чём валятся- Ответ «возьму BERT» без бейзлайна и без разговора о стоимости инференса.
- Метрики NER по токенам вместо сущностей.
Как готовиться- Соберите бейзлайн TF-IDF + линейная модель и сравните с дообученным трансформером на своих данных.
- Разберите внимание и его сложность по длине последовательности.
- Повторите оценку поиска и генерации: recall@k, MRR, метрики текста и их ограничения.
Материалы: темы атласаВстречается в отборе (2 компании)Секция по компьютерному зрению
Computer vision interviewСвёртки и трансформеры, детекция, сегментация, метрики
Секция для задач с изображениями и видео: модерация, поиск по картинке, документы и OCR, промышленный контроль, беспилотные технологии. Спрашивают архитектуры, работу с данными и метрики, которые в зрении устроены сложнее, чем в классификации.
Как проходит. 60 минут: устройство модели, затем практика — мало данных, редкий класс, расхождение офлайна и прода.
Что оценивают- Как считается mAP и что означает порог IoU.
- Различие одноэтапных и двухэтапных детекторов и выбор под требования по задержке.
- Аугментации и перенос обучения как ответ на нехватку размеченных данных.
- Поиск причин расхождения качества между офлайном и продом.
На чём валятся- Метрика «точность» в задаче детекции.
- Аугментации «по ощущениям», без проверки влияния на метрику.
- Разный препроцессинг в обучении и инференсе — самая частая причина просадки в проде.
Как готовиться- Разберите метрики детекции и сегментации: IoU, mAP, усреднение по порогам.
- Повторите перенос обучения и аугментации, включая их влияние на редкие классы.
- Проверьте на своём проекте, совпадает ли препроцессинг обучения и инференса.
Материалы: темы атласаВстречается в отборе (3 компании)Секция по рекомендациям и ранжированию
RecSys & ranking interviewКандидаты, ранжирование, метрики @K и расхождение с онлайном
Секция для лент, поиска, подборок и офферов. Ядро разговора — двухэтапная схема под бюджет задержки, офлайн-метрики и их вечное расхождение с результатами A/B, холодный старт и смещение показа.
Как проходит. 60 минут: от постановки к схеме. Часто сразу в формате дизайна: «как бы вы построили рекомендации для нашего каталога».
Что оценивают- Понимание, зачем нужен отбор кандидатов и чем он ограничивает потолок качества.
- Метрики @K и их связь с тем, что видит пользователь.
- Смещение показа в логах и способы с ним работать.
- Холодный старт для пользователя и для объекта.
На чём валятся- Одна модель на весь каталог без разговора о задержке.
- Вывод по офлайн-метрике без признания, что логи собраны старой моделью.
Как готовиться- Разберите метрики ранжирования: precision@K, recall@K, NDCG, MRR.
- Повторите двухэтапную схему и требования к кандидатогенерации.
- Проговорите план расследования, когда офлайн вырос, а A/B нет.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (5 компаний)Секция по временным рядам и спросу
Time series interviewСтационарность, валидация во времени, прогноз спроса
Секция для прогноза спроса, нагрузки, остатков и цен — в ритейле, логистике, промышленности и финансах. Главное, что проверяют: понимает ли человек, что данные упорядочены, и не рушит ли он это порядком обычной кросс-валидацией.
Как проходит. 60 минут вокруг конкретного ряда: сезонность, праздники, промо, пропуски, прерывистый спрос и горизонт прогноза.
Что оценивают- Валидация по времени и бэктест на нескольких окнах.
- Сезонность и календарные эффекты как признаки, а не как шум.
- Выбор между статистическими моделями и признаковым прогнозом бустингом.
- Метрики прогноза и их поведение при нулях и разных масштабах рядов.
На чём валятся- Случайное разбиение — мгновенный отказ на этой секции.
- MAPE на рядах с нулями.
- Прогноз без горизонта: «на будущее» вместо «на 14 дней вперёд с обновлением раз в сутки».
Как готовиться- Повторите стационарность, автокорреляцию и разложение на тренд и сезонность.
- Соберите признаковый прогноз: лаги, скользящие агрегаты, календарь, промо.
- Разберите метрики: MAE, RMSE, WAPE и почему MAPE часто неприменима.
Материалы: темы атласаВстречается в отборе (6 компаний)Секция по речи
Speech interviewРаспознавание и синтез: признаки, декодирование, метрики
Секция для голосовых помощников, контакт-центров и биометрии. Спрашивают представление звука, акустические и языковые модели, декодирование, метрики распознавания и качество синтеза.
Как проходит. 60 минут: устройство системы и практика — шум, акценты, доменные слова, задержка в реальном времени.
Что оценивают- Признаки звука и их связь с архитектурой модели.
- Метрика WER и то, какие ошибки она не различает.
- Работа с доменной лексикой и редкими словами.
- Требования реального времени: потоковое распознавание против офлайнового.
На чём валятся- Оценка качества на чистых студийных записях при боевом потоке из телефонии.
- Отсутствие разговора о задержке в задачах реального времени.
Как готовиться- Повторите цепочку от сигнала к тексту: признаки, акустическая модель, декодирование.
- Разберите метрики распознавания и оценки синтеза.
- Проговорите, как адаптировать систему к домену и шуму.
Материалы: темы атласаВстречается в отборе (1 компания)Секция по LLM, RAG и агентам
LLM & RAG interviewДообучение, поиск с генерацией, оценка и стоимость
Самая молодая секция отбора и самая быстрорастущая: ассистенты, поиск по базе знаний, обработка документов, агенты. Проверяют не знание модных слов, а понимание того, когда нужен RAG, когда дообучение, как это оценивать и сколько это стоит на запрос.
Как проходит. 60 минут: типичная задача — «сделать ассистента по нашей базе знаний». Дальше уточнения: галлюцинации, свежесть данных, приватность, бюджет.
Что оценивают- Разделение задач retrieval и генерации и отдельная оценка каждой.
- Выбор между промптом, RAG, дообучением и PEFT с обоснованием.
- Оценка качества: чем измеряется ответ, где нужны люди, где LLM-судья и как проверяется его согласие с людьми.
- Стоимость и задержка: длина контекста, кеш, маршрутизация на меньшую модель.
На чём валятся- «Дообучим модель» там, где проблема в поиске по документам.
- Оценка «на глаз» без эталонного набора.
- Отсутствие разговора о стоимости токенов и приватности данных.
Как готовиться- Соберите RAG на своих документах и измерьте retrieval отдельно от ответа.
- Разберите LoRA и другие экономные способы дообучения.
- Проговорите защиту от инъекций в промпт и работу с персональными данными.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (6 компаний)Секция по продакшену и MLOps
MLOps interviewПайплайны, выкат, мониторинг, дрейф и воспроизводимость
Проверка инженерной части: как модель попадает в прод и что с ней происходит дальше. Версионирование данных и моделей, воспроизводимость обучения, контейнеры и выкат, мониторинг качества и дрейфа, регламент переобучения.
Как проходит. 60 минут: часто по следам вашего опыта — «расскажите, как у вас выкатывалась модель» с уточнениями про откат, тесты и алерты.
Что оценивают- Воспроизводимость: можно ли повторить обучение полугодовой давности.
- Выкат: теневой режим, канарейка, откат, хранение версий.
- Мониторинг: что меряется, какие алерты и кто их получает.
- Тесты в ML: на данные, на пайплайн, на модель.
На чём валятся- Модель, живущая в ноутбуке: «отдали файл с весами и всё».
- Мониторинг только по задержке и ошибкам сервиса, без качества и дрейфа.
- Переобучение по расписанию без проверки, что новая модель лучше старой.
Как готовиться- Разберите связку трекинга экспериментов, версионирования данных и реестра моделей.
- Повторите способы выката и отката и то, чем теневой режим отличается от канареечного.
- Проговорите, что мониторить, когда разметка приходит с задержкой в месяц.
Материалы: темы атласаВстречается в отборе (5 компаний)Научная секция
Research interviewСтатьи, воспроизведение результатов и математика под ними
Секция для исследовательских ролей: лаборатории компаний, команды предобучения моделей, R&D. Обсуждают ваши работы и работы других: что именно предложено, какой эксперимент это доказывает, что в нём слабо и как бы вы это проверили.
Как проходит. 60–90 минут: разбор одной-двух статей, часто по вашему выбору, и вывод формул на доске.
Что оценивают- Умение отделить вклад работы от её оформления.
- Критика эксперимента: абляции, честность сравнения, статистическая значимость результатов.
- Математическая база: производные, вероятность, оптимизация.
- Воспроизводимость: что нужно, чтобы повторить результат.
На чём валятся- Пересказ аннотации вместо разбора метода.
- Отсутствие критики: «статья хорошая, результат лучше предыдущего».
Как готовиться- Разберите две-три свежие работы по своему направлению до уровня «могу воспроизвести».
- Повторите математику: градиенты, вероятностные модели, функции потерь и их смысл.
- Потренируйтесь называть, какая абляция подтверждает заявленный вклад.
Материалы: темы атласаВстречается в отборе (1 компания)Секция по ML в безопасности
ML for securityРедкие события, состязательный противник и цена ложной тревоги
Секция в компаниях информационной безопасности и в антифроде: обнаружение аномалий и вредоносной активности, работа с крайне редким положительным классом и с противником, который адаптируется к вашей модели.
Как проходит. 60 минут: постановка вроде «ловим вредоносные файлы» или «ловим захват аккаунта» с переходом к порогам, ложным срабатываниям и устареванию модели.
Что оценивают- Работа с сильным дисбалансом и выбор рабочей точки по цене ошибок.
- Обнаружение аномалий без разметки и его ограничения.
- Состязательность: атаки на модель, отравление данных, обход детектора.
- Регламент обновления: как быстро система реагирует на новую схему.
На чём валятся- ROC-AUC как единственная метрика при доле положительных в сотые доли процента.
- Статичная модель без плана обновления в состязательной задаче.
- Игнорирование нагрузки на аналитиков: поток ложных тревог убивает систему быстрее плохой метрики.
Как готовиться- Разберите PR-AUC и выбор порога по матрице стоимостей.
- Повторите методы поиска аномалий и их поведение на смещённых данных.
- Проговорите атаки на модели и защиту от них.
Материалы: темы атласаКейсы системного дизайнаВстречается в отборе (3 компании)