Задача хакатона — научить модель предсказывать, какие новости Омска окажутся наиболее популярными. Её подготовили преподаватели кафедры «Прикладная математика и фундаментальная информатика» ОмГТУ!
Принимая участие в соревновании, вы соглашаетесь с Правилами участия.
В 2026 году Омск носит статус Культурной столицы России. В городе проходят сотни спортивных, культурных и общественных событий, каждое из них по-разному отражается в СМИ. Одни публикации остаются почти незамеченными, другие получают широкий резонанс. При планировании информационного сопровождения мероприятий важно заранее понимать и оценивать, насколько заметной окажется та или иная публикация.
Сервисы медиамониторинга (например, «Медиалогия») оценивают каждую публикацию числом — заметностью. Чем выше значение, тем сильнее публикация «звучит» в медиаполе. Но заметность сильно зависит от издания. Материал в крупном СМИ почти всегда заметнее заметки в районной газете, и это не заслуга текста. Поэтому в задаче предлагается предсказывать нормированную заметность: насколько публикация заметнее обычной для своего же издания. Так название СМИ перестаёт быть «ярлыком», и выигрывает тот, кто лучше извлекает сигнал из содержания.
Участникам предлагается построить модель, которая по основной информации о публикации (заголовок, лид статьи и издание) предсказывает её нормированную заметность. Это задача обработки естественного языка (NLP) и регрессии. Решение должно работать на ресурсах центрального процессора без использования мощностей видеокарт.
Качество оценивается модулем коэффициента ранговой корреляции Спирмена между предсказанной и истинной нормированной заметностью:
Метрика считается автоматически при отправке решения. При этом тест делится на публичную (виден предварительный результат в лидерборде) и приватную (определяет итоговые места) части.
Набор данных собран на основе мониторинга публикаций об омских событиях. Каждая строка соответствует одной публикации в СМИ.
Файлы:
| Файл | Назначение |
|---|---|
train.csv | обучающая выборка с известной заметностью |
test.csv | тестовая выборка без заметности, на ней делаются предсказания |
sample_submission.csv | пример файла с предсказаниями |
Колонки:
id — уникальный идентификатор публикации;title — заголовок публикации;text — лид статьи (первые 500 символов);date — дата публикации;outlet — издание (СМИ), где вышла публикация;target — нормированная заметность (только в train.csv; это и есть целевая переменная).target — это z-оценка заметности внутри каждого издания: насколько публикация заметнее типичной для своего СМИ. У любого издания среднее target равно нулю, поэтому угадать значение просто по названию издания нельзя, нужен текст.
Особенности данных, о которых стоит знать:
outlet) выдаётся как признак, но само по себе не помогает: целевой признак нормирован внутри издания.Этот baseline специально сделан простым и служит примером организации конвейера обработки данных. Решение протестировано с применением интерпретатора Python 3.12.4.
На проверку отправляется CSV-файл с двумя колонками: id и predict. Каждая строка представлена в виде пары «идентификатор публикации из test.csv» и «предсказанная нормированная заметность». Файл должен покрывать все id из test.csv.
Абсолютные значения не важны сами по себе, поскольку метрика смотрит на порядок. Важно правильно ранжировать публикации.
Приватный обмен идеями (private sharing), решениями и кодом между участниками запрещён. В случае обнаружения этого факта, все причастные решения аннулируются.
Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy