- Начало работы с ML Space
- Решение проблем
- Решение проблем при обучении моделей
- Ошибка NCCL WARN в логах задачи обучения
- Ошибка «Permission denied, please try again» при запуске задачи обучения
- Tensorflow/Pytorch не видит GPU, низкая скорость обучения
- При выполнении команды «torch.cuda.is_available()» возвращается «False»
- Ошибка «CUDA error: an illegal memory access was encountered»
- Задача завершилась с ошибкой OOMKilled
- Не получается подключиться к GitLab ML Space через SSH
- Тарификация
- Термины и сокращения
- Обратиться в поддержку
Задача завершилась с ошибкой OOMKilled
Возможная причина: высокая утилизация памяти на одном или нескольких узлах (воркерах или мастере).
Рекомендации по решению:
Используйте типы инстансов с большим объемом оперативной памяти.
Оптимизируйте работу с памятью.
Уменьшите batch_size в коде обучения.
Была ли статья полезной ?
Предыдущая статья
Ошибка «CUDA error: an illegal memory access was encountered»
Следующая статья
Решение проблем при работе с Jupyter Servers