Python та інструменти

Pandas: основи роботи з даними в Python

3 вересня 2026 р.

Pandas: основи роботи з даними в Python

Якщо ви працюєте з даними в Python, рано чи пізно ви зустрінете pandas — найпопулярнішу бібліотеку для роботи з табличними даними. Вона стала фактичним стандартом і є однією з перших речей, які варто опанувати початківцю в дата саєнс.

Що таке pandas

Pandas дозволяє зручно завантажувати, очищати, перетворювати й аналізувати дані. Уявіть Excel, але керований кодом: усе, що ви робите мишею в таблиці, тут робиться командами, які легко повторити, автоматизувати й застосувати до мільйонів рядків.

Підключають бібліотеку зазвичай так:

import pandas as pd

Скорочення pd — усталена традиція, яку ви побачите майже в будь-якому коді.

DataFrame — головна структура

Центральний обʼєкт pandas — це DataFrame, двовимірна таблиця з рядками та іменованими стовпцями. Є ще Series — окремий стовпець. Практично вся робота зводиться до маніпуляцій із DataFrame.

Завантажити дані з файлу дуже просто:

df = pd.read_csv("data.csv")

Pandas вміє читати не лише CSV, а й Excel, JSON, дані з баз даних та багато іншого.

Перший погляд на дані

Перш ніж щось робити, дані варто оглянути. Для цього є кілька незамінних команд:

df.head()      # перші кілька рядків
df.info()      # типи стовпців і пропущені значення
df.describe()  # базова статистика по числових стовпцях
df.shape       # кількість рядків і стовпців

Ці чотири рядки дають швидке уявлення про структуру, розмір і якість даних.

Вибір і фільтрація

Щоб узяти окремий стовпець, звертаються за його назвою:

df["age"]

Фільтрація рядків за умовою читається майже як звичайна фраза:

df[df["age"] > 30]

Ця команда поверне всі рядки, де вік більший за 30. Умови можна комбінувати, поєднуючи їх логічними операторами.

Групування та агрегація

Одна з найпотужніших можливостей pandas — групування. Наприклад, щоб порахувати середню зарплату за кожним відділом:

df.groupby("department")["salary"].mean()

Принцип «розбити — застосувати — обʼєднати» лежить в основі більшості аналітичних завдань: розбиваємо дані на групи, рахуємо потрібну величину для кожної та збираємо результат.

Очищення даних

Реальні дані майже завжди «брудні»: пропуски, дублікати, неправильні типи. Pandas дає інструменти для їх упорядкування:

df.dropna()             # прибрати рядки з пропусками
df.fillna(0)            # заповнити пропуски значенням
df.drop_duplicates()    # прибрати дублікати

Очищення часто забирає більшу частину часу аналітика, тому ці операції варто знати добре.

Чому це важливо

Pandas — це фундамент, на якому будується решта роботи з даними. Перш ніж навчати модель, дані треба зібрати, очистити й дослідити — і майже завжди це роблять саме в pandas. Тому вкладений у цю бібліотеку час окупається на кожному наступному кроці.

Порада для початківців

Не намагайтеся запамʼятати всі функції — їх сотні. Достатньо засвоїти базові операції з цієї статті й навчитися шукати решту в документації. Найкращий спосіб навчитися — взяти будь-який набір даних, що вам цікавий, і почати ставити йому питання за допомогою pandas.

Підсумок

Pandas — це основний інструмент для роботи з табличними даними в Python. Її серце — структура DataFrame, а ключові навички — завантаження файлів, огляд даних, фільтрація, групування та очищення. Опанувавши ці основи, ви отримаєте міцний фундамент для аналітики та машинного навчання.

Шукаєте роботу?

Перегляньте відкриті вакансії у Data Science, ML та аналітиці.

До вакансій