Панды корреляция
Pandas corr - это метод библиотеки Pandas, который используется для вычисления коэффициента корреляции между двумя или более сериями данных. Это может быть очень полезным для анализа зависимости между различными переменными в наборе данных.
Пример использования метода corr():
python
import pandas as pd
# создание двух серий данных
ser1 = pd.Series([1, 2, 3, 4, 5])
ser2 = pd.Series([5, 4, 3, 2, 1])
# вычисление коэффициента корреляции
corr = ser1.corr(ser2)
print(corr) # -1.0
Выходным значением является коэффициент корреляции, который будет отображаться в диапазоне от -1 до 1. Значение -1 означает, что две серии данных имеют сильную обратную корреляцию, тогда как значение 1 означает, что они имеют сильную прямую корреляцию. Значение 0 означает, что между двумя сериями данных нет корреляции.
Кроме того, метод corr() также имеет параметры для вычисления корреляции между всеми столбцами набора данных:
python
df = pd.DataFrame({'A': [1, 2, 3, 4, 5], 'B': [5, 4, 3, 2, 1]})
# использование метода corr() на наборе данных
corr_matrix = df.corr()
print(corr_matrix)
Значения корреляции будут отображаться в таблице, в которой строки и столбцы являются метками столбцов в наборе данных. Заметим, что значения на диагонали таблицы будут равны 1, так как столбцы всегда коррелируют сами с собой на 100%.