Ends in 3 weeks
79 participants
9 submissions

E-CUP 2026. Задача 3: Ценность пользователей поиска

Участникам необходимо решить задачу предсказания суммарной стоимости заказов пользователей за следующие 30 дней на основе обезличенных данных их ежедневной активности в Поиске и Каталоге.

Правила участия

Нажимая кнопку «Участвовать» и/или «Отправить решение», вы соглашаетесь с Условиями конкурса Соревнования E-CUP «Ozon Tech»
 

Постановка задачи

Нам важно глубже понимать поведение пользователя на площадке, чтобы определять покупательский потенциал, рост/снижение активности и на этой основе принимать решения, влияющие на долгосрочную выручку. 

Одной из ключевых задач для онлайн-платформ является предсказание пожизненной ценности пользователя (LTV, Lifetime Value). В качестве оценки LTV пользователя «здесь и сейчас» может выступать его ожидаемый суммарный GMV (Gross Merchandise Value) на горизонте нескольких недель или месяцев. Однако, чтобы эта оценка была полезной, требуется качественнно моделировать пользовательское поведение на длительных временных интервалах.

В этом соревновании участникам предлагается заняться пользовательским моделированием. Ваша задача — построить алгоритм, предсказывающий суммарный GMV пользователя в Поиске и Каталоге за следующие 30 дней: 

  • Для решения задачи участникам предоставляются более 30 миллионов обезличенных записей об активности 250 000 клиентов в Поиске и Каталоге;
  • Каждая запись — сводка за один день со статистической информацией о покупках, добавлениях в корзину, поисковых запросах и стоимости заказов; 
    Осторожнее с данными, ведь это прореженные ряды, а их полное дозаполнение нулевой активностью может раздуть данные до 100 миллионов строк!
  • Данные предоставляются за временной интервал с 1 января 2025 по 13 февраля 2026. Ваша задача — предсказать суммарную стоимость заказов для интервала с 14 февраля 2026 по 15 марта 2026.

Подступиться к этой задаче можно самыми разными способами. Здесь вам могут помочь как классический ML, так и подходы с временными рядами, или даже BTYD-методы. На дворе 2026 год, поэтому вы можете попробовать токенизировать дневное пользовательское поведение и проверить, не пришло ли время нейросетей для решения подобных задач.

Подробнее про данные и их структуру можно узнать на странице Данные”


Формат решений

Это табличное соревнование с разметкой предоставленного вам .csv-файла. Вам необходимо создать алгоритм, способный по предоставленным в рамках соревнования данным, создать новый табличный .csv-файл с двумя столбцами:

user_id, predict
2, 0.0
7, 486.96535
...
918481, 31.039128
  • user_id – идентификатор пользователя;
  • predict – предсказание вашего алгоритма. 

Предсказания необходимо построить для всех 250 000 клиентов. 

Примеры sample_submission.csv доступны на странице Данные.


Проверка решений

Решения проверяются автоматически путем сопоставления с известными истинными историческими значениями суммарного GMV пользователей. Истинные исторические значения в тестовых данных доступны только организаторам.

Метрика соревнования

В качестве метрики соревнования выступает RMSLE (Root Mean Squared Logarithmic Error) с log1p по всем предсказаниям:

$$RMSLE = \sqrt{ \frac{1}{n} \sum_{i=1}^{n} (\log(1 + y_{i}) - \log(1 + \hat{\overline{y}}_{i} ))^2 }$$ 

$$\hat{\overline{y}}_{i} = max(0, \hat{y}_{i}) $$

$$\text{Где:}$$

$$n \text{ — число клиентов},$$

$$y_{i} \text{ — истинные значения суммарного GMV клиента i за следующие 30 дней},$$

$$\hat{y}_{it} \text{ — предсказанные значения суммарного GMV клиента i за следующие 30 дней}.$$

Соотношение public/private в соревновании составляет 20/80: 

  • 20% (50,000) клиентов используются для результатов на public-лидерборде.  
  • 80% (200,000) клиентов используются для результатов на private-лидерборде.

Обратите внимание: если в качестве предсказаний предоставляются отрицательные значения, то они принудительно зануляются.

Ограничения для команд:

  • Максимальное число решений в день: 5
  • Максимальное число участников в команде: 5
  • Число выбранных финальных решений: 2

Определение призеров

В соответствии с правилами, соревнование проходит в несколько этапов:

  1. Онлайн-этап соревнования:
    • В рамках онлайн-этапа соревнования, участники отправляют свои решения и улучшают свой результат на public-лидерборде. 
    • В конце онлайн-формата участники выбирают свои финальные решения, а на их основе формируется итоговый private-лидерборд.
    • Топ-15 команд с private-лидерборда переходят на следующий этап.
  2. Этап определения финалистов: 
    • Жюри запрашивают для оценки исходные репозитории финальных решений у команд из топ-15. Также результаты работы команд проверяются на соответствие правилам.
    • Полученные репозитории оцениваются по дополнительным критериям на усмотрение жюри. Оцениваются качество работы с данными и моделями, ресурсоемкость решений и новизна подходов решений. 
    • Специфичными для задачи LTV tie-breaker метриками являются Gini по предсказаниям клиентов, а также сравнение суммарного предсказанного GMV по всем клиентам (по RMSPE). Однако результаты данной проверки учитываются в совокупности со всеми остальными критериями, включая результат и место на private-лидерборде.
    • В результате всех проверок, жюри утверждает 5 команд-финалистов.
  3. Финальный этап и определение призеров: 
    • Команды-финалисты приглашаются для участия в питч-сессии очно в Москве и онлайн.
    • Команда должна будет презентовать свое решение и ее репозиторий перед жюри.
    • На основе презентаций жюри утверждает 3 команды победителей.
    • Награждение победителей пройдёт на конференции E-CODE.

Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy