Datasets for Machine Learning with Scikit-learn Library
Scikit-learn (sklearn) - это библиотека для машинного обучения на языке Python, в которой представлены различные наборы данных (datasets) для обучения моделей. Эти наборы данных могут быть использованы как для классических задач машинного обучения (например, классификация, регрессия), так и для более продвинутых, например, кластеризации или обучения с подкреплением.
Sklearn содержит много готовых наборов данных, которые могут быть загружены и использованы для обучения и тестирования моделей. Примеры таких наборов данных:
1. Набор данных iris - содержит информацию о 150 экземплярах цветочного вида ириса, каждый из которых описывается четырьмя функциями (длина наружной доли околоцветника, ширина наружной доли околоцветника и т.д.). Этот набор данных часто используется в задачах классификации.
2. Набор данных digits - содержит рукописные цифры из набора MNIST, каждая из которых представлена в виде вектора 64 признаков. Этот набор данных часто используется в задачах распознавания символов и цифр.
3. Набор данных california_housing - содержит информацию о ценах на жилье в Калифорнии. Этот набор данных используется для задач регрессии.
Пример кода загрузки и использования набора данных iris из sklearn:
python
from sklearn.datasets import load_iris
# Загрузка набора данных
iris = load_iris()
# Описание набора данных
print(iris.DESCR)
# Признаки и метки классов
X = iris.data
y = iris.target
В данном примере используется функция load_iris для загрузки набора данных. Описание набора данных выводится на экран, а признаки (X) и метки классов (y) сохраняются в отдельных переменных. Далее, эти данные можно использовать для обучения моделей машинного обучения.