В рамках проекта я выбрала Steam Games Dataset, опубликованный на платформе Kaggle и агрегирующий информацию об играх, размещённых в Steam. Это интересно, так как подобные статистики дают больше понимания о популярности тех или иных игр на рынке.
Датасет содержит сведения о более чем 20 000 игр, включая дату релиза, цену, жанры, количество положительных и отрицательных пользовательских отзывов, а также дополнительные продуктовые метрики.
В данном проекте проводится анализ данных об играх, опубликованных в Steam, с целью выявления взаимосвязи между ценой, жанрами и пользовательскими оценками.
Проект сочетает анализ данных, визуализацию и интерпретацию результатов в исследовательском и объясняющем формате.
Источник данных: Steam Games Dataset (Kaggle).
Описание датасета
Для анализа используется открытый датасет Steam Games Dataset, размещённый на платформе Kaggle. Он содержит информацию об играх, опубликованных в Steam, включая дату релиза, цену, жанры и пользовательские отзывы.
Датасет представляет интерес, так как отражает реальные рыночные условия цифровой дистрибуции игр и позволяет изучать продуктовые и пользовательские метрики.
Загрузка данных
Здесь вы видите часть датасета в виде таблицы
Первичный анализ данных
После загрузки данных проводится первичный анализ структуры датасета. Цель этого этапа определить объём данных, типы признаков и возможные проблемы, такие как пропущенные значения или некорректные типы данных.
Анализ структуры данных позволяет определить, какие признаки являются числовыми, категориальными или временными, а также выявить столбцы с пропущенными значениями, которые потребуют дополнительной обработки.
Полученный список признаков используется для выбора ключевых переменных, которые будут задействованы в дальнейшем анализе и визуализации.
Описательная статистика позволяет оценить распределение числовых признаков, таких как цена и пользовательские показатели, а также выявить потенциальные выбросы и асимметрию распределений.
Анализ пропущенных значений показывает, какие признаки требуют очистки или исключения из анализа. Это необходимо для повышения корректности статистических выводов и визуализаций.
Пользовательские оценки и рейтинг
В датасете представлены абсолютные значения положительных и отрицательных отзывов. Для корректного анализа требуется привести их к относительной метрике, которая отражает общее восприятие игры пользователями.
В рамках проекта пользовательский рейтинг рассчитывается как доля положительных отзывов от общего числа отзывов.
Полученная метрика пользовательского рейтинга принимает значения от 0 до 1, где более высокие значения соответствуют более позитивному восприятию игры.
Использование относительного рейтинга позволяет избежать искажений, связанных с абсолютным количеством отзывов у популярных и нишевых проектов.
Free-to-Play и платные игры
Модель распространения является важным фактором, влияющим на пользовательские ожидания и оценки. На данном этапе игры разделяются на бесплатные и платные на основе значения цены.
Разделение игр на бесплатные и платные позволит в дальнейшем сравнить пользовательские оценки между различными моделями монетизации и выявить возможные различия в восприятии качества.
Дата релиза и динамика рынка
Для анализа изменения рынка Steam во времени необходимо преобразовать дату релиза в числовой формат и выделить год выпуска игры.
Проблема с разбором даты релиза Колонка Release date содержит разные форматы или некорректные значения.
Ограничения данных и фокус исследования
В процессе анализа было выявлено, что данные о дате релиза содержат значительное количество пропущенных значений, что делает временной анализ ненадёжным.
В связи с этим фокус исследования смещён на анализ взаимосвязи между ценой, жанрами и пользовательскими оценками игр.
Подготовка данных к визуализации
Перед построением графиков проводится финальная подготовка данных: очистка цен, ограничение диапазонов значений и отбор релевантных наблюдений для анализа.
Распределение цен игр в Steam




