Original size 620x875

Создание стилизованных графиков по датасету

PROTECT STATUS: not protected

РУБРИКАТОР

  1. Вводная часть
  2. Обработка данных
  3. Стилизация графиков
  4. Графики
  5. Описание применения генеративной модели
  6. Ссылки
  7. Источники информации

ВВОДНАЯ ЧАСТЬ

Для работы я выбрала датасет Coffee Taste Test из открытых данных сайта Kaggle.

Я выбрала этот датасет, потому что очень люблю кофе и обязательно выпиваю как минимум одну чашку каждый день. Мне стало интересно проанализировать какие-нибудь данные, связанные с кофе.

В своей работе я использовала четыре вида графиков: круговая диаграмма, столбчатая диаграмма, горизонтальная столбчатая диаграмма и коробочная диаграмма. Я подумала, что эти четыре больше всего подходят для стилизации под кофейную тему, поскольку круговая напоминает вид сверху на чашку, столбчатая — вид сбоку, горизонтальная — стол, а коробочная навивает мысли о коробках для кофе.

ОБРАБОТКА ДАННЫХ

Процесс обработки данных начался с подключения необходимых библиотек: pandas, matplotlib.pyplot, seaborn, numpy. Затем, я добавила датасет и вырезала из него только те колонки, которые буду анализировать.

big
Original size 999x540

Список колонок из таблицы, которые понадобятся

Дальше я прошлась по всем выбранным колонкам и посчитала сколько пропусков в каждой колонке.

Original size 755x558

Выявление пустых ячеек

Получив результат подсчета, я сформировала гипотезу: в данных есть люди, про которых мало что известно, и большинство пропусков относятся к ним. Чтобы ее проверить я посчитала количество людей с пропусками.

Original size 588x268

Количество людей с пропусками в данных

Оказалось, что строк с пропусками примерно 13% от общего числа. Я решила убрать проблемные строчки, поскольку еще останется 87% данных, по которым будет удобнее строить графики.

Original size 749x72

Убираем пустые строки

Далее я убрала лишние данные в строке «Пол», оставив только «Male» и «Female», а остальные объединила под названием «Other».

Original size 1370x286

Обработка данных колонки «Пол»

После этого я приступила к построению графиков по данным. Сначала я анализировала где и по какой причине люди пьют кофе. Результат представлялся в виде круговых диаграмм.

Original size 733x522

Выявление места и причины для питья кофе

Следующий график отражает любимые напитки и топпинги. Результат представлялся в виде столбчатых диаграмм.

Original size 760x729

Любимые напитки и топпинги

Следующая диаграмма отражает сколько чашек кофе пьют люди разных возрастов. Ширина полосы показывает процент людей по количеству чашек из 100%. Результат представлялся в виде горизонтальных диаграмм.

Original size 1239x233

Чашки кофе на возраст

После нее созданы подобные диаграммы с анализом предпочтений по крепости и прожарке среди людей разных возрастов.

Крепкость / Прожарка

Последние четыре диаграммы посвящены оценке четырех кофейных напитков у групп разных возрастов и с показателями по полу. Результат представлялся в виде коробочных диаграмм.

Original size 1650x472

Оценка напитков 1

Original size 1663x472

Оценка напитков 2

Original size 1659x462

Оценка напитков 3

Original size 1650x469

Оценка напитков 4

СТИЛИЗАЦИЯ ГРАФИКОВ

У меня не было конкретного референса для стилизации, я хотела придумать ее сама. Поэтому нашла только названия цвето, создала график-палитру с оттенками кофейных напитков и использовала эти цвета для окрашивания диаграмм. Также я прочитала, что можно создать паттерны из знаков ’’-’’, ’’/’’, ’’.’’, ’’*’’ и ’’||’’, поэтому некоторые графики дополнила паттернами.

Создание стилизованных графиков по датасету
Project created at 25.09.2024