Концепция
Я выбрала датасет про кроссовки, потому что давно увлекаюсь sneaker-культурой и сама регулярно покупаю кроссовки, у меня их целая коллекция! Поэтому анализ данных про них для меня особенно интересен.
Данные взяты с Kaggle из набора «Sneakers Dataset for Shoes Market Analysis». Внутри — таблица с информацией о разных моделях кроссовок: бренд, цены и скидки, а также оценки пользователей. Этот набор подходит для анализа ценовых уровней, сравнения брендов и поиска закономерностей между ценой, скидками и пользовательскими оценками.

Для визуализации данных я планирую использовать следующие типы графиков:
• гистограмма • столбчатая диаграмма • точечная диаграмма • тепловая карта корреляций
Почему именно эти графики?
• Гистограмма поможет быстро понять, в каком ценовом диапазоне находится основная часть моделей • Столбчатая диаграмма нужна, чтобы наглядно сопоставить бренды по скидкам (например, по медианной скидке) и увидеть, кто чаще использует дисконт как инструмент • Точечную диаграмму я использую для проверки связи между ценой и пользовательским рейтингом: видно, влияет ли стоимость на оценку и образуются ли группы моделей • Тепловая карта корреляций даст общий обзор числовых зависимостей между ценой, скидкой, рейтингом и количеством отзывов

Визуальное оформление
Палитру выбрала такую, исходя из моих ассоциаций с культурой кроссовок: синий и голубой воспринимаются как технологии и скорость, что-то новое, а темно-зеленый добавляет ощущение баланса, спокойствия и удобства, графитовый и бело-серый уравновешивают и дополняют более яркие цвета.
Обработка данных
Инструменты проекта:
• Python — среда выполнения анализа • Pandas — загрузка и обработка таблицы (чтение CSV, очистка, приведение типов, расчет новых столбцов) • NumPy — вычисления (логарифмирование цены) • Matplotlib — визуализация и стилизация графиков • matplotlib.colors — кастомная цветовая карта для тепловой карты корреляций
Colab не имеет доступа к файлам на моем компьютере напрямую, поэтому я загружаю CSV в среду выполнения. Это первый обязательный шаг, чтобы дальше работать с данными через Panda.
Код
После загрузки я проверяю рабочую папку Colab (/content), чтобы убедиться, что файл действительно находится там и доступен для чтения.
Код
Я нахожу загруженный CSV в /content, читаю его в DataFrame и вывожу первые строки, чтобы убедиться, что данные открылись корректно и колонки распознаны.
Код
Чтобы визуализации выглядели как единая серия инфографики, я задаю палитру и глобальные настройки Matplotlib: фон, сетку, цвета текста, размеры подписей и заголовков.
Код
На этом шаге я проверяю размер таблицы, названия колонок и количество пропусков. Это нужно, чтобы понять, требуется ли очистка и какие поля можно использовать в графиках.
Код
В датасетах часто встречается технический столбец Unnamed: 0 (индекс из предыдущего сохранения). Я удаляю его.
Также привожу ключевые числовые колонки к числам (Price, Discount, Rating, Count_of_Rating), чтобы корректно считать новые признаки и строить визуализации.
Код
Чтобы анализ был более содержательным, я создаю новые показатели:
• discount_rate — скидка в долях (0…1) • final_price — цена после скидки • log_final_price — логарифм цены (нужен, чтобы точечный график был читаемым при большом разбросе цен)
Код
Перед визуализациями я смотрю базовую статистику по ключевым числовым полям. Это помогает интерпретировать графики: понимать типичные значения и разброс.
Код
Графики
Для начала я построила гистрограмму.
Код




