Исходный размер 2480x3500

Намасте! Спасибо, что ехали с Uber!

Исходный размер 4353x1917

➠ Вводная часть ➠

Для анализа мною был выбран датасет "Uber Data Analytics Dashboard" с сайта Kaggle в формате csv. В нем содержится информация о 148 770 заказах и предоставляет полное представление о характеристиках поездок - оценки, отмены, поведение клиентов, финансовые показатели, тип транспортного средства и т.п.

Мне хотелось более глубоко изучить то, что с одной стороны, для нас является чем-то обыденным, с другой стороны, на что можно было бы посмотреть "под другим углом". Поэтому мой выбор пал на анализ такси (которое мы видим ежедневно и привыкли их к однотипному виду), но под призмой индийского Uber (в котором самая частая форма такси - это рикша).

Я сделала графики разных видов (тепловая карта, гистограмма, круговая диаграмма, горизонтальная столбчатая диаграмма, точечная диаграмма, линейный график) для того, чтобы наглядно и интересно отобразить аналитику, что поможет донести ключевые выводы до читателей.

Исходный размер 5199x2063

Визуальное оформление проекта вдохновлено:

➠ Колористикой Индии

В качестве цветовой палитры я выбрала оттенки, напоминающие флаг Индии (эти цвета используются также для такси) на фоне светло-голубого неба.

➠ Индийскими скульптурами

Они напоминают мне пластилин и мультфильмы с самобытными персонажами. Для проекта я создала своего персонажа с помощью нейросети Reve.

➠ Динамикой транспорта

Передаю с помощью шрифтов и стрелок "в движении".

➠ Языком Хинди

Шрифт "Bowler", который я использую в графиках, имеет схожую монотонность с письменностью в Индии, а также имеет технологичный характер, соответствующий категории "транспорт".

➠ Начальный этап работы ➠

Исходный размер 944x252
Исходный размер 4353x574

Монтирование Google Drive в Google Colab

Исходный размер 4353x728

Импорт библиотеки pandas для работы с табличными данными Чтение CSV-файла с данными

Исходный размер 4353x1344

Установка шрифта Bowler как шрифта по умолчанию для всех графиков

➠ Визуализация данных ➠

В ходе работы я использовала следующие библиотеки Python: ➠ Pandas (библиотека для анализа и обработки данных), ➠ Matplotlib (основная библиотека для визуализации данных), ➠ Numpy (основная библиотека для научных вычислений), ➠ Seaborn (библиотека для статистической визуализации данных).

➠ ГРАФИК № 1. ➠

Связь оценок водителей и клиентов с ценой поездки
Исходный размер 4353x2677
Исходный размер 947x784

➠ Самые низкие оценки (3) и водители, и клиенты ставят при наиболее дорогих поездках (580+ INR (индийских рупий) (510+ RUB)). ➠ Оценка выше 4.5 и от клиентов, и от водителей в основном получается при цене поездки 500-540 INR (439-474 RUB).


Возможно, в Индии более дорогие поездки не в силу комфортных условий, а из-за сильных пробок/длинных маршрутов через перегруженные районы/пиков спроса. Эти факторы ухудшают опыт обеих сторон. Примерный сценарий в таком случае: Клиент видит цену выше среднего → Завышенные ожидания и требования → Сервис как был, так и остался на среднем уровне + возможно прибавились обстоятельства наподобие пробок → Неоправданные ожидания → Плохая оценка от клиента → Ухудшение настроения водителя → Плохая оценка от водителя


Рейтинг отражает скорее разницу между ожиданиями и реальностью, чем качество сервиса.

➠ ГРАФИК № 2. ➠

Частота комбинаций оценок
Исходный размер 4353x2356
Исходный размер 1219x576

➠ Самая частая комбинация оценок (условие одинаковой оценки от водителя и от клиента) - [4.5-клиент, 4.5-водитель] (встречается в 16 000 поездках). ➠ Нередкие комбинации - [4.5-водитель, 4.0-клиент], [4.0-водитель, 4.5-клиент], [4.5-водитель, 4.0-клиент)] (количество поездок около 10000-12000). ➠ Комбинация [4.0-водитель, 4.0-клиент] встречается примерно в 8000 поездках. ➠ Зеленая диагональ не образовалась, а значит не все оценки совпадают часто.


Выходит, что в Индии поездки чаще проходят практически отлично (оценка 4.5), значит сервис в основном устраивает как тех, кто им пользуется, так и тех, кто его предоставляет.

➠ ГРАФИК № 3. ➠

Распределение разницы между оценками
Исходный размер 4353x1620
Исходный размер 1355x579

➠ Преобладающее количество (в баллах) разницы - от 0.00 до 0.25 (практически в 30000 поездках). ➠ Разница менее, чем в 1 балл, встречается примерно в 80000 поездках. ➠ Разница более, чем в 1 балл, встречается примерно в 14000 поездках.


Это значит, что работает в основном "зеркальное" оценивание (несмотря на то, что водители и клиенты не видят оценки друг друга, разница зачастую совсем небольшая) и чаще поездки проходят без выраженных недовольств одной из сторон.

➠ ГРАФИК № 4. ➠

Распределение отмен поездок: клиенты vs водители
Исходный размер 4353x2291
Исходный размер 1043x654

➠ Отмены клиентами - 28%. ➠ Отмены водителями - 72%.


Наблюдается существенная разница между количеством отмены каждой из сторон. Немного странным кажется то, что почти 3 из 4 отмен происходят по инициативе водителей. Возможно, в Индии гораздо больше весомых для отмены водителями факторов, нежели чем для отмены клиентами. Рассмотрим этот вопрос в следующем графике.

➠ ГРАФИКИ № 5 И № 6. ➠

Причины отмены водителями и причины отмены клиентами
Исходный размер 4353x2933
Намасте! Спасибо, что ехали с Uber!
Проект создан 17.01.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше