Wildberries

Каталог и поиск, рекомендации, спрос и качество данных о товарах

Крупнейший по обороту маркетплейс страны: карточки товаров создают сотни тысяч продавцов, и это определяет всю специфику ML. Данные грязные по построению — названия, категории и атрибуты приходится восстанавливать моделями, а прогноз спроса живёт в условиях постоянных акций и быстрой смены ассортимента.

Этапы отбора

Порядок и состав секций меняются от команды к команде — это типовая схема, собранная по открытым источникам. Этапы, на которых проверяют знания, ведут в разбор формата: что оценивают и чем закрывать пробелы.

Все форматы проверок →
  1. Скрининг

    Рекрутер уточняет направление и уровень. Набор быстрый, поэтому этапы обычно идут плотно.

  2. Секция по Python и работе с данными

    Практическая секция: Python и работа с таблицами, обработка пропусков и дубликатов, агрегаты.

  3. ML-секция: модели, признаки, валидация

    ML-секция: как поставили задачу, какие признаки, как валидировали, какую метрику защищали перед бизнесом.

  4. SQL-секция

    SQL по витринам маркетплейса: соединения, оконные функции, стоимость запроса на больших таблицах.

  5. Секция дизайна ML-системы

    На middle+ — дизайн решения: как система живёт при потоке новых карточек и сезонных всплесках.

  6. Финальная встреча

    Команда, задачи и ожидания по скорости работы: цикл выката здесь короткий.

Что оценивают на любом направлении
  • Готовность работать с данными, которые заполняют продавцы: дубликаты, ошибки в атрибутах, произвольные названия.
  • Скорость: решение, доведённое до продакшена, ценится выше идеально вылизанного эксперимента.
  • Понимание сезонности и акций как основного источника изменения спроса.
  • Умение считать метрику в деньгах, а не только в процентах.

Чем проверяют себя перед отбором

4 формата проверки из отбора Wildberries — и тест атласа под каждый. Слабые места видно сразу после захода, а темы для разбора собираются автоматически.

Код, который готовит данные: агрегаты, соединения, пропуски

На чём валятся
  • Код, который работает на примере и не масштабируется: построчные циклы вместо векторных операций.
  • Молчаливое отбрасывание пропусков без объяснения, почему это допустимо.

Классика табличных задач и честная проверка качества

На чём валятся
  • «Взял бустинг, получил 0.85 AUC» без бейзлайна и без объяснения, что это значит для продукта.
  • Случайное разбиение в задаче, где данные упорядочены во времени.
24 вопроса в банкеТест: Классический ML

SQL-секция

SQL interview

Соединения, оконные функции и цена запроса на большой таблице

На чём валятся
  • COUNT(*) вместо COUNT(поле) после LEFT JOIN — классическая тихая ошибка.
  • Запрос без фильтра по ключу разбиения: на боевой таблице он просто не доедет.

От постановки до эксплуатации на одной доске

На чём валятся
  • Прыжок в архитектуру с первой минуты, без требований и метрик.
  • Схема, которая заканчивается обучением модели: ни выката, ни мониторинга.
22 вопроса в банкеТест: Дизайн ML-систем

Программа подготовки под компанию

20 тем по всем направлениям Wildberries — если команда ещё не выбрана. Программа разложит их по неделям от математики к продакшену; под конкретное направление список короче, и его можно собрать ниже.

Собрать программу подготовки

Эти 20 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 4 недели под Wildberries · Все направления.

Проверяем, вошли ли вы…

Направления

Выберите направление: обязательные темы со ссылками в атлас, типовые вопросы с ответами и тест для самопроверки.

Все тесты →
Направление

Каталог, поиск и атрибутыCatalog NLP & Search

Категоризация товаров, извлечение атрибутов из названий и описаний, склейка дубликатов, поиск по каталогу. Специфика — тексты пишут продавцы, а не редакторы: сокращения, транслит, ключевые слова ради выдачи.

Пройти тест: NLP (24 вопроса)
Собрать программу подготовки

Эти 10 тем можно разложить по неделям: программа выстроит их от математики к продакшену, поставит тест в конце каждой недели и вернёт тему на повторение, если вы в ней ошиблись. Выйдет примерно 2 недели под Wildberries · Каталог, поиск и атрибуты.

Проверяем, вошли ли вы…

Типовые вопросы секции (4)
Как склеивать дубликаты карточек от разных продавцов?

Как задачу поиска пар: сначала дешёвая блокировка кандидатов (по бренду, категории, эмбеддингу названия, хешу изображения), затем модель, решающая «это один товар или нет» на признаках сходства текста, атрибутов и картинки. Полный перебор пар невозможен, поэтому качество блокировки определяет потолок.

Разбор в атласе: Semantic Search — Семантический поиск
В дереве категорий тысячи классов, у многих — единицы примеров. Как классифицировать?

Иерархически: сначала верхний уровень, затем уточнение внутри ветки, с объединением совсем редких классов. Для длинного хвоста помогают эмбеддинги и поиск ближайших соседей вместо обучения отдельного классификатора, а метрику считают макро-усреднением — иначе редкие категории не видно.

Разбор в атласе: Text classification — Классификация текстов
Продавцы набивают в название ключевые слова. Как это чинить?

Нормализацией и извлечением структуры: из названия достаются бренд, тип товара, ключевые параметры, остальное отбрасывается. Ставить фильтр по «спамности» отдельно от задачи категоризации полезно: тогда шум не втягивается в признаки модели и не поощряется выдачей.

Разбор в атласе: Text Normalization — Нормализация текста
Как понять, что извлечение атрибутов работает, если эталона нет?

Смесью проверок: асессорская выборка на несколько тысяч карточек как эталон, согласие модели с заполненными продавцами полями как косвенный сигнал и мониторинг доли извлечённых атрибутов по категориям. Резкое падение доли по одной категории обычно означает не деградацию модели, а изменение формата данных.

Разбор в атласе: Error analysis — Анализ ошибок
Что сделать руками до собеседования
  • Соберите классификатор категорий с иерархией и посчитайте макро-F1 по редким классам отдельно.
  • Реализуйте блокировку кандидатов для поиска дубликатов и измерьте recall блокировки.
  • Извлеките атрибуты из названий регулярными выражениями, а затем моделью — сравните покрытие и точность.