Pandas Duplicated: Dealing with Duplicate Data in Pandas
Метод pandas duplicated() используется для проверки дубликатов в DataFrame. Он возвращает булевый объект, который указывает, является ли строка дубликатом другой строки или нет.
Пример использования:
python
import pandas as pd
# Создаем DataFrame
df = pd.DataFrame({
'Name': ['John', 'Paul', 'George', 'Ringo', 'John'],
'Age': [22, 34, 30, 28, 22],
'City': ['London', 'Liverpool', 'London', 'Liverpool', 'London']
})
# Проверяем дубликаты
duplicates = df.duplicated()
# Выводим результат
print(duplicates)
Результат:
0 False
1 False
2 False
3 False
4 True
dtype: bool
В данном примере последняя строка с именем "John" была помечена как дубликат, так как в DataFrame уже была строка с таким же именем и возрастом.
Метод duplicated() также позволяет проверять дубликаты только в определенных столбцах. Например, если мы хотим проверить только дубликаты по столбцу "Name", мы можем использовать следующий код:
python
duplicates = df.duplicated(subset='Name')
Этот код вернет тот же результат, что и предыдущий, но только для столбца "Name".
Метод duplicated() также имеет параметр keep, который определяет, какие дубликаты сохранять. По умолчанию оставляются все дубликаты, но вы можете выбрать, сохранять только первый или последний:
python
duplicates = df.duplicated(subset='Name', keep='first')
Этот код сохраняет только первый дубликат в каждой группе.
Таким образом, метод duplicated() очень полезен для проверки дубликатов в DataFrame и может использоваться в различных ситуациях.