Ends in 3 weeks
76 participants

Данные

Глоссарий для matches.parquet и matches_llm.parquet 

  • id1 – идентификатор первого товара в паре для сравнения
  • id2 — идентификатор второго товара в паре для сравнения
  • target – целевая метка совпадения товаров: 0 и 1 для ручной разметки; от 0 до 1 для разметки с помощью llm

Глоссарий для items.parquet и items_human.parquet 

  • id – идентификатор товара
  • name — текст с названием товара
  • attributes – текст с свернутыми json аттрибутами товара
  • category – категория товара

Все товары из items_human.parquet содержатся в полном файле items.parquet. Этот файл будет полезен для локальной эмуляции процедуры запуска решения и отладки производительности решений. На вход решениям будут подаваться данные с новыми товарами и их парами. В новых данных о товарах будут только те товары, что участвуют в парном сравнении. Суммарный объем тестовых данных сопоставим с комбинацией из matches.parquet + items_human.parquet.

Примеры решений

Базовое решение представлено в двух версиях: 

  1. Архив с полностью валидным и проходящим проверочную систему базовым решением matching-baseline-submit.zip. В составе архива используется модель cross-encoder/ms-marco-MiniLM-L12-v2 (huggingface). 
    Эта модель в baseline решении служит ориентиром максимально допустимого времени полного исполнения решения (18.5 минут при общем лимите в 20 минут). 
  2. Для отладки, архив с базовым решением без самой модели matching-baseline-lightweight.zip. Основной вес в архиве базового решения занимает сама модель. Для полностью корректного рабочего решения, все модели и артефакты решения должны уже быть включены в архив и/или в образ. 

Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy