Датасеты — набор данных, используемый для обучения и валидации моделей машинного обучения.
Датасеты могут быть версионированы и привязаны к конкретным запускам для обеспечения воспроизводимости экспериментов.
Перед началом работы убедитесь, что выполнены следующие условия:
Создан ML-проект, в котором будет сохранен ран.
Создайте артефакт типа dataset:
import wandb# Initialize the runrun = wandb.init(project="<name_project>")# Create a dataset artifactdataset = wandb.Artifact(name="<name_run>",type="<type_artifact>",description="Training dataset for classification")Где:
<name_project> — название ML-проекта.
<name_run> — название рана.
<type_artifact> — тип артефакта: dataset.
Добавьте данные в датасет:
# Add a filedataset.add_file("data/train.csv")# Add a directorydataset.add_dir("data/training/")# Add data by referencedataset.add_reference("s3://bucket/path/to/data")
Загрузите датасет
# Log the datasetrun.log_artifact(dataset)# Finish the runrun.finish()
Пример полного кода:
import wandb# Initialize the runrun = wandb.init(project="my-new-project")# Create a dataset artifactdataset = wandb.Artifact(name="chrun-data",type="dataset",description="Training dataset for classification")# Add a filedataset.add_file("data/train.csv")# Add a directorydataset.add_dir("data/training/")# Add data by referencedataset.add_reference("s3://bucket/path/to/data")# Log the datasetrun.log_artifact(dataset)# Finish the runrun.finish()
Датасет создан и загружен в ML-проект.