Pandas: основи роботи з даними в Python
3 вересня 2026 р.

Якщо ви працюєте з даними в Python, рано чи пізно ви зустрінете pandas — найпопулярнішу бібліотеку для роботи з табличними даними. Вона стала фактичним стандартом і є однією з перших речей, які варто опанувати початківцю в дата саєнс.
Що таке pandas
Pandas дозволяє зручно завантажувати, очищати, перетворювати й аналізувати дані. Уявіть Excel, але керований кодом: усе, що ви робите мишею в таблиці, тут робиться командами, які легко повторити, автоматизувати й застосувати до мільйонів рядків.
Підключають бібліотеку зазвичай так:
import pandas as pd
Скорочення pd — усталена традиція, яку ви побачите майже в будь-якому коді.
DataFrame — головна структура
Центральний обʼєкт pandas — це DataFrame, двовимірна таблиця з рядками та іменованими стовпцями. Є ще Series — окремий стовпець. Практично вся робота зводиться до маніпуляцій із DataFrame.
Завантажити дані з файлу дуже просто:
df = pd.read_csv("data.csv")
Pandas вміє читати не лише CSV, а й Excel, JSON, дані з баз даних та багато іншого.
Перший погляд на дані
Перш ніж щось робити, дані варто оглянути. Для цього є кілька незамінних команд:
df.head() # перші кілька рядків
df.info() # типи стовпців і пропущені значення
df.describe() # базова статистика по числових стовпцях
df.shape # кількість рядків і стовпців
Ці чотири рядки дають швидке уявлення про структуру, розмір і якість даних.
Вибір і фільтрація
Щоб узяти окремий стовпець, звертаються за його назвою:
df["age"]
Фільтрація рядків за умовою читається майже як звичайна фраза:
df[df["age"] > 30]
Ця команда поверне всі рядки, де вік більший за 30. Умови можна комбінувати, поєднуючи їх логічними операторами.
Групування та агрегація
Одна з найпотужніших можливостей pandas — групування. Наприклад, щоб порахувати середню зарплату за кожним відділом:
df.groupby("department")["salary"].mean()
Принцип «розбити — застосувати — обʼєднати» лежить в основі більшості аналітичних завдань: розбиваємо дані на групи, рахуємо потрібну величину для кожної та збираємо результат.
Очищення даних
Реальні дані майже завжди «брудні»: пропуски, дублікати, неправильні типи. Pandas дає інструменти для їх упорядкування:
df.dropna() # прибрати рядки з пропусками
df.fillna(0) # заповнити пропуски значенням
df.drop_duplicates() # прибрати дублікати
Очищення часто забирає більшу частину часу аналітика, тому ці операції варто знати добре.
Чому це важливо
Pandas — це фундамент, на якому будується решта роботи з даними. Перш ніж навчати модель, дані треба зібрати, очистити й дослідити — і майже завжди це роблять саме в pandas. Тому вкладений у цю бібліотеку час окупається на кожному наступному кроці.
Порада для початківців
Не намагайтеся запамʼятати всі функції — їх сотні. Достатньо засвоїти базові операції з цієї статті й навчитися шукати решту в документації. Найкращий спосіб навчитися — взяти будь-який набір даних, що вам цікавий, і почати ставити йому питання за допомогою pandas.
Підсумок
Pandas — це основний інструмент для роботи з табличними даними в Python. Її серце — структура DataFrame, а ключові навички — завантаження файлів, огляд даних, фільтрація, групування та очищення. Опанувавши ці основи, ви отримаєте міцний фундамент для аналітики та машинного навчання.