Эксперименты с ML-моделями позволяют фиксировать и сравнивать запуски обучения моделей с разными параметрами, результаты обучения и выходные метрики.
В Distributed Train управлять экспериментами возможно с помощью утилиты MLflow.
Для работы с MLflow рекомендуем использовать образ jupyter server версии 0.0.96 и выше.
Для подключения к MLflow:
Перейдите в Distributed Train → Jupyter Servers.
На странице New Launcher выберите MLflow.
В открывшемся окне укажите требуемые настройки.
Подробнее — в документации MLflow.
Чтобы использовать MLflow:
Оберните код обучения модели в точке входа скрипта (if __name__ == "__main__") в конструкцию:
with mlflow.start_run():
Настройте логируемые в MLflow параметры, метрики и модель. Используйте пример на Github.
mlflow.log_param(..)mlflow.log_metric(..)mlflow.sklearn.log_model(..)
Все эксперименты и артефакты, созданные утилитой и моделью, можно найти в интерфейсе утилиты.
Не рекомендуется удалять файлы в каталоге mlflow. Это может вызывать проблемы при запуске MLflow.