- Начало работы с ML Space
- Решение проблем
- Решение проблем при обучении моделей
- Ошибка NCCL WARN в логах задачи обучения
- Ошибка «Permission denied, please try again» при запуске задачи обучения
- Tensorflow/Pytorch не видит GPU, низкая скорость обучения
- При выполнении команды «torch.cuda.is_available()» возвращается «False»
- Ошибка «CUDA error: an illegal memory access was encountered»
- Задача завершилась с ошибкой OOMKilled
- Не получается подключиться к GitLab ML Space через SSH
- Тарификация
- Термины и сокращения
- Обратиться в поддержку
Ошибка «CUDA error: an illegal memory access was encountered»
Возможные варианты решения:
Запустить скрипт обучения с параметром CUDA_LAUNCH_BLOCKING=1 для получения трассировки ошибки.
Уменьшить batch size и убедиться, что никакие другие процессы (например, Jupyter) не занимают видеопамять.
Использовать образ с более новыми версиями CUDA и PyTorch. Список образов для задач обучения.
Применить contiguous() к тензорам, из-за которых возникает ошибка.
См.также
Была ли статья полезной ?
Предыдущая статья
При выполнении команды «torch.cuda.is_available()» возвращается «False»
Следующая статья
Задача завершилась с ошибкой OOMKilled