Статистика. Основы.
Статистика и математика являются важными частями DataScience. Сегодня поговорим про самые простые и довольно часто встречающиеся понятия.
Мода - значение, которое встречается в наборе данных чаще всего, например мода данного набора значений [1,1,2,2,2,2,2,3,3,3] - 2. Для вычисления моды можно использовать метод из Pandas. Пример из официальной документации:
>>> df = pd.DataFrame({'A': [1, 2, 1, 2, 1, 2, 3]})Медиана - если отсортировать список, например список котиков по мере увеличения их роста, в середине будет находиться котик, обладающий самым типичным размером.
>>> df.mode()
A
0 1
1 2
В Pandas есть соответствующий метод median().
Среднее значение - если у нас есть несколько значений, то для нахождения медианы нужно сложить значения и разделить пополам (или же сложить значения и разделить на их количество если их больше, чем два).
Выброс - значение, сильно выбивающееся из ряда значений. Выбросы могут сильно исказить многие статистические методы, поэтому что бы избавиться он них, убирают некий процент самых больших и самых малых значений.
Размах - разница между самым большим и самым малым значением. Так как размах чувствителен к выбросам, для его вычисления применяют межквартильный размах - когда из нашего ряда убраны 25% самых больших и самых малых значений.
Отклонение - разность между средним и самым большим значением.
Стандартное отклонение - для этого нужно сложить все отклонения и поделить на количество значений и возвести в квадрат. std - standard deviation (стандартное отклонение).
>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count 3.0
mean 2.0
std 1.0
min 1.0
25% 1.5
50% 2.0
75% 2.5
max 3.0
dtype: float64
P.S. Данная информация является базовой, для ознакомления с основами статистики, если будет интересно, я буду раз продолжить знакомство со статисткой DataScience.
