PD Get Dummies - простой способ обработки данных в Python
pd.get_dummies() - это функция, которая используется для преобразования категориальных переменных в бинарные признаки (dummy variables) при анализе данных. Это означает, что функция создает новый столбец для каждого уникального значения в исходном столбце и заполняет его нулями и единицами в зависимости от того, встречается ли значение в соответствующей строке или нет.
Пример использования pd.get_dummies():
Исходный датафрейм:
| Имя | Цвет |
| ------- | ------ |
| Том | Красный|
| Джек | Синий |
| Мэри | Зеленый|
| Фрэнк | Красный|
| Лиза | Зеленый|
| Грег | Красный|
Используя pd.get_dummies(), мы можем преобразовать столбец "Цвет" в новые столбцы с бинарными признаками:
import pandas as pd
df = pd.read_csv('example.csv')
dummy_df = pd.get_dummies(df['Цвет'], prefix='Цвет')
df = pd.concat([df, dummy_df], axis=1)
df.drop('Цвет', axis=1, inplace=True)
print(df.head())
Результат:
| Имя | Цвет_Красный | Цвет_Зеленый | Цвет_Синий |
| ------- | ------------ | ------------ | ------------ |
| Том | 1 | 0 | 0 |
| Джек | 0 | 0 | 1 |
| Мэри | 0 | 1 | 0 |
| Фрэнк | 1 | 0 | 0 |
| Лиза | 0 | 1 | 0 |
| Грег | 1 | 0 | 0 |
Мы можем видеть, что функция создала новые столбцы для каждого уникального значения "Цвета" и заполнила их нулями и единицами, в зависимости от того, содержится ли значение в исходной строке или нет. Теперь мы можем использовать полученные бинарные признаки для анализа данных вместо исходного нечислового значения "Цвет".