Облачная платформаEvolution

Загрузить датасет


Датасеты — набор данных, используемый для обучения и валидации моделей машинного обучения.

Датасеты могут быть версионированы и привязаны к конкретным запускам для обеспечения воспроизводимости экспериментов.

Перед началом работы

Перед началом работы убедитесь, что выполнены следующие условия:

Порядок действий

  1. Создайте артефакт типа dataset:

    import wandb
    # Initialize the run
    run = wandb.init(project="<name_project>")
    # Create a dataset artifact
    dataset = wandb.Artifact(
    name="<name_run>",
    type="<type_artifact>",
    description="Training dataset for classification"
    )

    Где:

    • <name_project> — название ML-проекта.

    • <name_run> — название рана.

    • <type_artifact> — тип артефакта: dataset.

  2. Добавьте данные в датасет:

    # Add a file
    dataset.add_file("data/train.csv")
    # Add a directory
    dataset.add_dir("data/training/")
    # Add data by reference
    dataset.add_reference("s3://bucket/path/to/data")
  3. Загрузите датасет

    # Log the dataset
    run.log_artifact(dataset)
    # Finish the run
    run.finish()

Пример полного кода:

import wandb
# Initialize the run
run = wandb.init(project="my-new-project")
# Create a dataset artifact
dataset = wandb.Artifact(
name="chrun-data",
type="dataset",
description="Training dataset for classification"
)
# Add a file
dataset.add_file("data/train.csv")
# Add a directory
dataset.add_dir("data/training/")
# Add data by reference
dataset.add_reference("s3://bucket/path/to/data")
# Log the dataset
run.log_artifact(dataset)
# Finish the run
run.finish()

Результат

Датасет создан и загружен в ML-проект.

../../../_images/s__guides__tracking-artifacts-create.webp