Lamoda

Рекомендации в моде, поиск по изображению, атрибуты каталога

Модный онлайн-ритейл: ассортимент обновляется сезонами, у товара десятки визуальных атрибутов, а покупателю важен не только товар, но и размер, посадка и стиль. Отсюда две сильные ML-темы — рекомендации с холодным стартом каждый сезон и компьютерное зрение, которое достаёт из фотографий то, чего нет в описаниях.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление: рекомендации и поиск, зрение и каталог, аналитика.

  2. Секция по Python и работе с данными

    Практическая секция: код и данные, работа с каталогом и событиями пользователей.

  3. ML-секция: модели, признаки, валидация

    ML-секция: постановка, признаки, валидация, метрики. Много вопросов про холодный старт.

  4. Секция по рекомендациям и ранжированию

    Направленческая секция: ранжирование, разнообразие выдачи, метрики @K и их связь с покупками.

  5. Секция дизайна ML-системы

    На middle+ — дизайн: рекомендации под сезонный каталог или пайплайн разметки изображений.

  6. Финальная встреча

    Команда, задачи, уровень.

Что оценивают на любом направлении
  • Понимание, что в моде каталог обновляется целиком: холодный старт — это не редкий случай, а норма.
  • Внимание к возвратам: продажа с возвратом — это не успех, и метрика обязана это учитывать.
  • Готовность работать с изображениями как с основным источником признаков о товаре.
  • Связь метрик ранжирования с деньгами: оборот после возвратов, а не клики.

Чем проверяют себя перед отбором

4 формата проверки из отбора Lamoda — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Код, который готовит данные: агрегаты, соединения, пропуски

На чём валятся
  • Код, который работает на примере и не масштабируется: построчные циклы вместо векторных операций.
  • Молчаливое отбрасывание пропусков без объяснения, почему это допустимо.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

Кандидаты, ранжирование, метрики @K и расхождение с онлайном

На чём валятся
  • Одна модель на весь каталог без разговора о задержке.
  • Вывод по офлайн-метрике без признания, что логи собраны старой моделью.

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Программа подготовки под компанию

18 тем по всем направлениям Lamoda — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 18 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под Lamoda · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Рекомендации и поискFashion RecSys

Подбор товаров, похожие модели, образы целиком, ранжирование каталога. Специфика — сезонность, размерность (одна модель в восьми размерах) и высокая доля возвратов.

Пройти тест: Рекомендательные системы (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под Lamoda · Рекомендации и поиск.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Каждый сезон каталог обновляется почти целиком. Как рекомендовать новинки?

Контентными признаками: эмбеддинги изображения и описания, бренд, категория, цена относительно сегмента. Коллаборативная часть подключается по мере накопления взаимодействий. Гибрид с плавным переходом между источниками — стандартная схема там, где холодный старт постоянен.

Разбор в атласе: k-NN — Метод k ближайших соседей
Почему целевой переменной нельзя брать просто покупку?

Из-за возвратов: в одежде они достигают десятков процентов, и модель, оптимизирующая покупки, охотно рекомендует товары, которые вернут. Целевая переменная — покупка без возврата, а метрика — оборот после возвратов; иначе система оптимизирует логистические издержки вверх.

Разбор в атласе: Problem formulation — Постановка задачи
Как учитывать размер и посадку?

Как отдельную задачу: профиль покупателя по прошлым покупкам и возвратам, признаки посадки конкретной модели (маломерит или нет) из истории возвратов по причине размера. Рекомендация размера снижает возвраты сильнее, чем улучшение ранжирования самих товаров.

Разбор в атласе: Feature engineering — Конструирование признаков
Выдача стала однообразной: десять похожих чёрных платьев. Что делать?

Вводить разнообразие явно: переранжирование с штрафом за близость уже отобранных объектов, квоты по брендам и категориям, максимальная релевантность при ограничении на схожесть. Метрику разнообразия меряют вместе с NDCG, иначе оптимизация релевантности всегда схлопывает выдачу.

Разбор в атласе: NDCG — NDCG
Что сделать руками до собеседования
  • Соберите гибридные рекомендации и проверьте их отдельно на новинках без истории.
  • Постройте метрику «оборот после возвратов» и сравните ранжирование по ней и по кликам.
  • Реализуйте переранжирование с ограничением на схожесть и измерьте потерю NDCG.