Ends in 27 hours
82 participants
20 submissions

Описание данных

  • train.csv — обучающая выборка с разметкой. Колонки: id, title, text, date, outlet, target.
  • test.csv — тестовые данные, на которых нужно сделать предсказания predict. Колонки: id, title, text, date, outlet.
  • sample_submission.csv — пример файла с предсказаниями (колонки id, predict); во всех строках подставлено одно значение.
  • baseline.ipynb — Jupyter-ноутбук с начальным решением (протестировано с применением интерпретатора Python 3.12.4).

Описание колонок

КолонкаТипОписание
idintУникальный идентификатор публикации
titlestrЗаголовок публикации
textstrЛид статьи — первые 500 символов
datedateДата публикации (YYYY-MM-DD)
outletstrИздание (СМИ), где вышла публикация
targetfloatНормированная заметность — целевая переменная (только в train.csv)

Целевая переменная

target — это заметность, нормированная внутри каждого издания (z-оценка по изданию отдельно в train и test):

$$\text{target} = \frac{\text{visibility} - \mu_{\text{издание}}}{\sigma_{\text{издание}}}$$

train

CSV | 4.79 MB

email

test

CSV | 2.12 MB

email

sample_submission

CSV | 30.55 KB

email

baseline

IPYNB | 3.57 KB

email

Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy