Original size 730x1119

«Титанический» анализ датасета

PROTECT STATUS: not protected

Введение

Драма «непотопляемого» Титаника будоражит сердца уже многих поколений. Чудо технологического прогресса того времени, колоссальных размеров пассажирский лайнер мощностью пятьдесят пять тысяч лошадиных сил, способный вместить почти две с половиной тысячи человек, потерпел крушение, разрушительностью под стать своим габаритам. Более чем две трети людей: от мала до велика, различных социальных классов и достатка, были поглощены тогда холодными водами Атлантики. Невольно хочется задаться рядом непростых вопросов:

— Сколько семей мучительно разлучилось в тот день? — Сколько матерей потеряли ребенка? — Сколько молодых так и не встретило старость?

big
Original size 1678x903

На Kaggle я нашла базу данных (далее — БД) с информацией о пассажирах Титаника. Данные блистали разнообразием и содержали такие параметры, как: пол, класс билета (оно же социальный класс), факт выживания или смерти, порт, из которого человек совершил посадку, а также возраст, номер каюты и даже семейные связи — наличие детей или братьев с сёстрами.

Я решила проанализировать эту БД, чтобы ответить, как минимум, на часть вопросов не просто статистического, но и социального, психологического и философского характера.

Использованными в исследовании программами и инструментами являются:

- Google Colab с соответствующими настройками чтения csv. файлов и визуализации - DeepSeek (для правки кода с целью минимизации неожиданных ошибок)

Процесс обработки данных

Original size 1014x441

Перед исследованием БД, я подготовила рабочий файл к чтению датасета: импортировала специальные библиотеки — для работы конкретно с данными Kaggle и массивами, для построения и визуализации графиков. Далее я установила визуальные константы для форматирования графиков: цвета в оттенках бежевого, желтого и коричневого, коричневую обводку и моноширинный шрифт. Вдохновением послужили старые фотографии, созданные в сепии, а также верстка текста на печатной машинке. Всё это отсылает к эпохе, когда существовал Титаник.

0

Визуальное вдохновение

Методы анализа можно сравнить с исследованием БД при помощи формул Microsoft Excel: в основном использовались «СЧЁТ» (вычисление объема данных в отдельных колонках), «ЕСЛИ» (операции над данными, подчиняющихся объединению, либо пересечению условий) и «СЧЁТЕСЛИ» (сортировка данных, также подконтрольная условиям)

Коды и графики

Original size 1104x648

Для более комплексных вычислений понадобилось сначала визуализировать более примитивную статистику: на основе столбца «Пол» было выявлено процентное соотношение мужчин и женщин, находившихся на корабле.

Для визуализации данных использовались в основном столбчатые и круговые диаграммы.

Original size 1189x359
Original size 1078x507

Колонка «Возраст» была поделена математически, при помощи установки «пороговых значений» на конкретные категории.

Original size 792x264
Original size 699x489

Далее, уже располагая «отфильтрованным» из колонки «Пол» числом женщин, было произведено пересечение с колонками «Наличие детей» и «Факта смерти/выживания».

Original size 844x291
Original size 771x486

После похожая операция была произведена с колонками «Факта смерти/выживания» и «Наличия братьев/сестёр»

Original size 1174x343
Original size 886x489

Дабы логически завершить анализ «факторов выживаемости», было создано распределение в зависимости от порта посадки.

Original size 739x542
Original size 1501x636

Также, подытоживая исследование, включающее женщин с детьми, было произведено их распределение, в зависимости от класса билета.

Original size 809x571
Original size 1513x636
«Титанический» анализ датасета
Project created at 14.01.2026