Участникам необходимо решить задачу идентификации одинаковых товаров на основе текстовой информации из их карточек.
Нажимая кнопку «Участвовать» и/или «Отправить решение», вы соглашаетесь с Условиями конкурса Соревнования E-CUP «Ozon Tech»
Дубли карточек товаров вводят пользователей в заблуждение и усложняют навигацию на маркетплейсе. Задача соотнесения или идентификации одинаковых товаров (матчинга) актуальна и востребованна для любой крупной онлайн-платформы: она должна решаться максимально точно, а скорость самого решения должна поспевать за ростом числа товаров.
В этом соревновании участникам предстоит решить упрощенную постановку задачи матчинга: сами пары кандидатов из Retrieval части задачи уже собраны заранее и подготовлены к тому, чтобы их классифицировали. Однако, не все так просто:
Подробнее про данные и их структуру можно узнать на странице “Данные”.
Это контейнерное соревнование:
Решение получает на вход следующие именованные аргументы:
--items_path -i путь к файлу с данными о товарах (например, items.parquet); --matches_path -i путь к файлу с подготовленными парами id товаров (например, matches.parquet); --output-path -o имя файла, в который вам нужно сохранить результат (например, submit.csv).Результатом работы решения должен быть .csv-файл с тремя столбцами:
id1 должен содержать предоставленные идентификаторы первых товаров в паре для сравнения;id2 должен содержать предоставленные идентификаторы вторых товаров в паре для сравнения;predict должен быть вашим результатом классификации (num — разрешены «сырые» результаты предсказаний).В архиве с решением должны быть все необходимые для работы модели файлы.
Главное — в архиве должен быть файл metadata.json с указанием используемого докер-образа (рекомендуем начать с `odsai/ecup26-baseline:1.0`) и строки для запуска вашей модели:
{
"image": "odsai/ecup26-matching-baseline:1.0",
"entry_point": "python -u run.py"
}
Участники могут собрать свой собственный Docker-образ:
metadata.json и тогда проверочная система при запуске скачает архив вашего образа;15,000 MB;Решения проверяются автоматически, а сама проверка проходит в 3 стадии:
.csv файлы с результатами классификации пар;Check, отладочные 1000 пар товаров, которые не идут в рейтинг;Public test, для результатов на Public-лидерборде в течение соревнования;Private test, для итоговых результатов Private-лидерборда..csv-формату;Метрика соревнования — Macro Averaged PR-AUC (Area Under Precision-Recall Curve; площадь под кривой «полнота-точность»).
По каждой из 20 категорий считается PR-AUC, после чего все полученные результаты метрики усредняются.
Для расчета метрики используется ее sklearn имплементация:
from sklearn.metrics import average_precision_score
Обратите внимание, что использование функции auc для самой Precision-Recall кривой средствами sklearn приведет к завышению показателей метрики ввиду особенностей процедуры подсчета (интерполяции точек кривой).
Соотношение public/private в соревновании составляет приблизительно 30/70:
Check: 1 минутаPublic: 6 минутPrivate: 13 минутВ соответствии с правилами, соревнование проходит в несколько этапов:
Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy