214.2MB, подмножество данных о товарах, что присутствуют только в данных ручной разметки пар
matches.parquet и matches_llm.parquet id1 – идентификатор первого товара в паре для сравненияid2 — идентификатор второго товара в паре для сравненияtarget – целевая метка совпадения товаров: 0 и 1 для ручной разметки; от 0 до 1 для разметки с помощью llmitems.parquet и items_human.parquet id – идентификатор товараname — текст с названием товараattributes – текст с свернутыми json аттрибутами товараcategory – категория товараВсе товары из items_human.parquet содержатся в полном файле items.parquet. Этот файл будет полезен для локальной эмуляции процедуры запуска решения и отладки производительности решений. На вход решениям будут подаваться данные с новыми товарами и их парами. В новых данных о товарах будут только те товары, что участвуют в парном сравнении. Суммарный объем тестовых данных сопоставим с комбинацией из matches.parquet + items_human.parquet.
1.2GB, пример валидного baseline решения с использованием MiniLM-L12-v2 Cross-Encoder
19.6KB, облегченная версия baseline решения без модели в составе сабмита
Базовое решение представлено в двух версиях:
matching-baseline-submit.zip. В составе архива используется модель cross-encoder/ms-marco-MiniLM-L12-v2 (huggingface). matching-baseline-lightweight.zip. Основной вес в архиве базового решения занимает сама модель. Для полностью корректного рабочего решения, все модели и артефакты решения должны уже быть включены в архив и/или в образ. Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy