Отборочный контест
Online coding contestАвтоматически проверяемые задачи до собеседования
На чём валятся- Решение «в лоб», которое проходит примеры и падает на максимальных ограничениях.
- Потеря часа на самой трудной задаче вместо двух средних.
Поиск, реклама, беспилотники, Алиса и рекомендации
ML-задачи Яндекса выросли из поиска и рекламы: ранжирование, обработка языка, речь, зрение и рекомендации на большом трафике. Отсюда и упор на собеседовании — алгоритмическая база, честная работа с метриками и умение довести модель до сервиса, который держит нагрузку.
Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.
Разговор с рекрутером: опыт, направление, ожидания. Иногда — короткое техническое задание или тест перед секциями.
Вход на стажировки и в школы разработки начинается с контеста: задачи с автоматической проверкой и жёстким ограничением по времени. В штат берут и без него, но на массовом наборе он стоит первым.
Задачи на структуры данных и сложность, решение вслух и код. Это отдельная от ML секция, и её чаще всего проваливают из-за отсутствия практики.
Теория и практика вашего направления: постановка задачи, признаки, модель, метрики, разбор ошибок. Вопросы идут от вашего же опыта в резюме.
Спроектировать сервис вокруг модели: данные, обучение, инференс, метрики, нагрузка, откат. Ждут не идеальной схемы, а понятного хода рассуждений.
Обсуждение задач конкретной команды, мотивации и уровня. Здесь помогает точное понимание того, чем вы хотите заниматься.
4 формата проверки из отбора Яндекс — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.
Автоматически проверяемые задачи до собеседования
На чём валятсяЖивое кодирование: решение вслух и код в редакторе
На чём валятсяКлассика табличных задач и честная проверка качества
На чём валятсяОт постановки до эксплуатации на одной доске
На чём валятся52 темы по всем направлениям Яндекс — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.
Эти 52 темы можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 10 недель под Яндекс · Все направления.
Проверяем, вошли ли вы…
Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.
Поиск, ассистенты, классификация обращений, извлечение сущностей и генерация. Ждут понимания всей цепочки: токенизация, представления, трансформеры, оценка качества.
Эти 12 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 3 недели под Яндекс · NLP.
Проверяем, вошли ли вы…
Частотные пары символов объединяются, пока не наберётся словарь заданного размера. Редкое слово собирается из подслов — исчезает проблема OOV, а длина последовательности растёт умеренно.
Разбор в атласе: Tokenization — Токенизация →BERT — энкодер с двунаправленным контекстом, обучен на masked language modeling, силён в понимании: классификация, NER, поиск. GPT — авторегрессионный декодер с causal-маской, силён в генерации.
Разбор в атласе: BERT — BERT →O(n²) по длине последовательности и по памяти. Отсюда ограничение контекста и семейство приёмов: разреженное и линейное внимание, скользящие окна, FlashAttention для эффективной реализации.
Разбор в атласе: Attention — Механизм внимания →Документы и запрос кодируются в эмбеддинги, поиск идёт ANN-индексом по косинусной близости. Гибрид с BM25 надёжнее: лексический поиск ловит точные термины, векторный — переформулировки.
Разбор в атласе: Semantic Search — Семантический поиск →Отдельно retrieval (recall@k, MRR по эталонным фрагментам) и отдельно ответ (точность фактов, наличие ссылок, оценка людьми или LLM-судьёй с проверкой согласия).
Разбор в атласе: RAG — Retrieval-Augmented Generation →Уточнять инструкцию и определения классов, мерить согласие (каппа Коэна), разбирать спорные примеры, при необходимости менять постановку задачи — модель не выучит то, о чём люди не договорились.
Разбор в атласе: Data Labeling — Разметка данных →