Облачная платформаAdvanced

Введение в MRS Jobs

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

Задача MRS — это платформа выполнения программ MRS. Она используется для обработки и анализа данных пользователей. После создания задачи вся информация о задаче отображается на вкладке Jobs. Вы можете просматривать список всех задач, а также создавать и управлять задачами. Если вкладка Jobs не отображается на странице сведений о кластере, отправьте задачу в фоновом режиме.

Источниками данных, обрабатываемыми MRS, являются OBS или HDFS. OBS — это сервис объектного хранилища, предоставляющий вам масштабные, безопасные, надёжные и экономически эффективные возможности хранения данных. MRS может обрабатывать данные в OBS напрямую. Вы можете просматривать, управлять и использовать данные через веб‑страницу платформы управления или клиент OBS. Кроме того, вы можете использовать REST API независимо или интегрировать API в сервисные приложения для управления и доступа к данным.

Перед созданием задач загрузите локальные данные в OBS для вычисления и анализа MRS. MRS позволяет экспортировать данные из OBS в HDFS для вычислений и анализа. После завершения анализа и вычислений вы можете сохранить данные в HDFS или экспортировать их в OBS. HDFS и OBS также могут хранить сжатые данные в формате bz2 или gz.

Категория

Кластер MRS позволяет создавать и управлять следующими задачами: если кластер в состоянии Running не может создать задачу, проверьте состояние здоровья связанных компонентов на странице управления кластером. Подробности см. в Viewing and Customizing Cluster Monitoring Metrics.

  • MapReduce может быстро обрабатывать крупномасштабные данные параллельно. Это распределённая модель обработки данных и среда выполнения. MRS поддерживает отправку программ MapReduce JAR.
  • Spark — это распределённый фреймворк вычислений в памяти. MRS поддерживает задачи SparkSubmit, Spark Script и Spark SQL.
    • SparkSubmit: вы можете отправлять программы Spark JAR и Spark Python, выполнять Spark Application и вычислять и обрабатывать данные пользователей.
    • SparkScript: вы можете отправлять скрипты SparkScript и пакетно выполнять инструкции Spark SQL.
    • Spark SQL: вы можете использовать инструкции Spark SQL (похожие на SQL‑инструкции) для запросов и анализа данных пользователей в реальном времени.
  • Hive — это открытый хранилище данных, основанное на Hadoop. MRS позволяет отправлять скрипты HiveScript и выполнять инструкции Hive SQL.
  • Flink — это распределённый движок обработки больших данных, способный выполнять состоянийные вычисления как над неограниченными, так и над ограниченными потоками данных.
  • HadoopStreaming запускает задачи mapper или reducer.

Список задач

Задачи по умолчанию отображаются в списке задач в хронологическом порядке, при этом самые последние задания показываются вверху. Table 1 описывает параметры в списке заданий.

Table 1 Параметры списка заданий

Parameter

Description

Name/ID

Имя задания, которое задаётся при создании задания.

ID — уникальный идентификатор задания. После добавления задания система автоматически присваивает значение полю ID.

Username

Имя пользователя, который отправляет задание.

Type

Поддерживаются следующие типы данных:

  • DistCp: импорт и экспорт данных
  • MapReduce
  • Spark
  • SparkSubmit
  • SparkScript
  • Spark SQL
  • Hive SQL
  • HiveScript
  • Flink
  • Flink SQL
  • HadoopStreaming
NOTE:
  • После импорта и экспорта файлов на вкладке Files вы можете просмотреть задачу DistCp на вкладке Jobs.
  • Задания Spark, Hive и Flink можно добавить только в том случае, если компоненты Spark, Hive и Flink выбраны при создании кластера и кластер находится в рабочем состоянии.

Status

Состояние задания.

  • Submitted
  • Accepted
  • Running
  • Completed
  • Terminated
  • Abnormal

Result

Результат выполнения задачи.

  • Неопределено: указывает, что задача выполняется.
  • Successful: указывает, что задача успешно выполнена.
  • Killed: указывает, что задача была принудительно завершена во время выполнения.
  • Failed: указывает, что задача не удалось выполнить.
ПРИМЕЧАНИЕ:

После того как задача завершилась успешно или неудачно, её нельзя выполнить повторно. Однако вы можете добавить задачу и задать параметры задачи, чтобы отправить её повторно.

Queue Name

Имя очереди, привязанной к пользователю, отправляющему задачу

Submitted

Время отправки задачи.

Ended

Время, когда задание завершено или вручную остановлено.

Operation

Операции могут быть выполнены над заданием. Нажмите More для дополнительных операций в раскрывающемся списке.

  • Просмотр журнала: нажмите View Log для просмотра журналов в реальном времени работающих заданий. Подробнее см. Viewing Job Configuration and Logs.
  • Просмотр деталей: нажмите View Details для просмотра подробной конфигурационной информации о заданиях. Подробнее см. Viewing Job Configuration and Logs.
  • Остановить: вы можете нажать Stop, чтобы остановить запущенное задание. Подробнее см. Stopping a Job.
  • Просмотр результата: нажмите View Result для просмотра результатов выполнения заданий SparkSQL и SparkScript, статус которых Completed, а результат Successful.
  • Delete: удалите задание. Подробнее см. Deleting a Job.
    ПРИМЕЧАНИЕ:
    • Удалённое задание нельзя восстановить.
    • Если вы выбираете сохранять журналы заданий в OBS или HDFS, система сжимает и сохраняет журналы в соответствующий путь после завершения выполнения задания. Поэтому после завершения выполнения задания такого типа статус задания остаётся Running. После успешного сохранения журнала статус задания меняется на Completed. Длительность хранения журнала зависит от его размера и занимает несколько минут.
Table 2 Описание значка

Значок

Описание

Выберите диапазон времени для отправки задания, чтобы отфильтровать задания, отправленные в этом диапазоне.

Выберите определённый результат выполнения задания из раскрывающегося списка, чтобы отобразить задания с этим статусом.

  • All statuses: отфильтровать все задания.
  • Successful: отфильтровать успешно выполненные задания.
  • Undefined: отфильтровать выполняющиеся задания.
  • Killed: отфильтровать задания, остановленные вручную.
  • Failed: отфильтровать задания, которые не удалось выполнить.

Выберите определённый тип задания из раскрывающегося списка, чтобы отобразить задания данного типа.

  • All types
  • MapReduce
  • HiveScript
  • Distcp
  • SparkScript
  • Spark SQL
  • Hive SQL
  • SparkSubmit
  • Flink
  • Flink SQL
  • HadoopStreaming

В поле поиска задайте соответствующее условие поиска задания и нажмите .

  • Имя задания.
  • ID задания.
  • Имя пользователя.
  • Имя очереди.

Нажмите , чтобы вручную обновить список заданий.

Описание прав выполнения задания

Для кластера безопасности с включённой аутентификацией Kerberos пользователь должен синхронизировать IAM‑пользователя перед отправкой задания в веб‑интерфейсе MRS. После завершения синхронизации система MRS создаёт пользователя с тем же именем IAM‑пользователя. Наличие у пользователя прав отправки заданий зависит от IAM‑политики, привязанной к пользователю во время синхронизации IAM. Подробную информацию о политике отправки заданий см. в Table 1 в разделе Synchronizing IAM Users to MRS.

Когда пользователь отправляет задание, которое использует ресурсы конкретного компонента, например доступ к каталогам HDFS и таблицам Hive, пользователь admin (Manager administrator) должен предоставить соответствующее разрешение пользователю. Подробные действия следующие:

  1. Войдите в Manager как пользователь admin.
  2. Добавьте роль компонента, для которого пользователю требуется разрешение. Подробности см. в Creating a Role.
  3. Измените группу пользователей, к которой относится пользователь, отправляющий задачу, и добавьте новую роль компонента в группу пользователей. Для получения подробной информации см. Related Tasks.

    Note

    После изменения роли компонента, привязанной к группе пользователей, к которой относится пользователь, требуется некоторое время, чтобы разрешения роли вступили в силу.