Статистика та аналітика

Описова статистика: середнє, медіана та дисперсія

3 вересня 2026 р.

Описова статистика: середнє, медіана та дисперсія

Перш ніж будувати складні моделі, дані треба зрозуміти. Саме для цього існує описова статистика — набір простих показників, що коротко характеризують великий масив чисел. Без них аналіз даних неможливий.

Дві головні групи показників

Описова статистика відповідає на два питання: де приблизно розташовані дані та наскільки вони розкидані. Перше описують міри центру, друге — міри розкиду.

Міри центру

Середнє арифметичне (mean) — сума всіх значень, поділена на їхню кількість. Це найвідоміший показник, але й найпідступніший: він дуже чутливий до екстремальних значень.

Медіана (median) — значення, що стоїть посередині, якщо всі дані впорядкувати. Половина значень менша за неї, половина більша. Медіана стійка до викидів.

Мода (mode) — значення, яке трапляється найчастіше. Особливо корисна для категоріальних даних.

Чому середнє буває оманливим

Класичний приклад — зарплати. Уявіть невелику компанію, де девʼятеро працівників отримують по 20 тисяч, а десятий, власник, — 500 тисяч. Середня зарплата вийде близько 68 тисяч, хоча жоден зі звичайних працівників стільки не отримує. Медіана ж дорівнюватиме 20 тисячам і чесно опише типового працівника.

Правило просте: коли в даних є сильні викиди або розподіл несиметричний, медіана зазвичай інформативніша за середнє.

Міри розкиду

Знати центр недостатньо — важливо розуміти, наскільки значення відрізняються між собою.

Розмах (range) — різниця між максимумом і мінімумом. Простий, але дуже чутливий до викидів.

Дисперсія (variance) — середнє квадратів відхилень значень від середнього. Показує, наскільки сильно дані «розсіяні».

Стандартне відхилення (standard deviation) — корінь із дисперсії. Його зручність у тому, що воно виражене в тих самих одиницях, що й самі дані, тож його легше інтерпретувати.

Два набори даних можуть мати однакове середнє, але зовсім різний розкид. Наприклад, температура +20° у середньому може означати як стабільний комфортний клімат, так і різкі перепади від морозу до спеки — і саме стандартне відхилення покаже цю різницю.

Квартилі та викиди

Дані часто ділять на чотири рівні частини — квартилі. Різниця між третім і першим квартилем називається міжквартильним розмахом (IQR) і показує, у якому діапазоні лежить «середня половина» даних. За допомогою IQR зручно виявляти викиди — значення, що надто далеко відхиляються від решти. Саме цю логіку використовує графік «ящик з вусами».

Навіщо це потрібно

Описова статистика — це перший крок будь-якого аналізу. Вона допомагає помітити помилки в даних (наприклад, вік 200 років), зрозуміти форму розподілу, виявити викиди й правильно підготувати дані до моделювання. Пропустивши цей етап, легко побудувати модель на зіпсованих даних і отримати безглузді результати.

Підсумок

Описова статистика коротко характеризує дані через міри центру (середнє, медіана, мода) та міри розкиду (розмах, дисперсія, стандартне відхилення). Головний практичний урок: середнє чутливе до викидів, тож для несиметричних даних надійніша медіана, а розуміння розкиду не менш важливе за розуміння центру. Це базова грамотність, без якої не обходиться жоден аналітик даних.

Шукаєте роботу?

Перегляньте відкриті вакансії у Data Science, ML та аналітиці.

До вакансій