В этой главе рассматривается, как разрабатывать задачу DLI.
Для получения дополнительной информации о конкретных разрешениях, включенных в agency, см. Configuring DLI Agency Permissions.
В качестве альтернативы вы можете улучшить вычислительную среду DLI, создав пользовательские образы. Конкретно, для повышения функций и производительности задач Spark и Flink можно создать пользовательские образы, загрузив базовые образы, предоставленные DLI, и добавив зависимости (файлы, JAR‑файлы или программное обеспечение) и частные возможности, необходимые для выполнения задачи. Это изменит среду выполнения контейнера для задач.
Например, вы можете добавить пакет Python или библиотеку C, связанную с машинным обучением, в пользовательский образ, чтобы расширить функции. Как создать пользовательский образ, см. Enhancing the Job Runtime Environment Using a Custom Image.
Flink поддерживает динамические типы данных, позволяя определять структуры данных во время выполнения без необходимости предварительно определённых метаданных.
Требованиями для доступа к нескольким источникам являются возможность DLI взаимодействовать с сетью источника данных и возможность DLI получить учетные данные доступа к источнику данных.
Это относится к заданиям SQL и заданиям Flink 1.12. Для получения подробной информации см. Using DLI Datasource Authentication to Manage Access Credentials for Data Sources.
Это относится к Spark 3.3.1 и более поздним версиям, а также Flink 1.15 и более поздним версиям.
Для получения подробной информации см. Managing Data Source Access Credentials Using DEW и Configuring an Agency to Allow DLI to Access Other Cloud Services.
Тип задания | Описание | Сценарий использования |
|---|---|---|
SQL job | Этот тип подходит для сценариев, в которых используются стандартные SQL‑запросы. Обычно он применяется для запросов и анализа структурированных данных. Для получения подробной информации см. Creating and Submitting a SQL Job. | Он применяется к сценариям, таким как запросы к хранилищу данных, генерация отчетов и онлайн‑аналитическая обработка (OLAP). |
Flink job | Этот тип специально разработан для обработки потоков данных в реальном времени, что делает его идеальным для сценариев, требующих низкой задержки и быстрой реакции. Он хорошо подходит для мониторинга в реальном времени и онлайн‑анализа.
| Он применяется к сценариям, требующим быстрой реакции, таким как мониторинг данных в реальном времени и системы рекомендаций в реальном времени. Flink Jar jobs подходят для сценариев анализа данных, требующих пользовательской логики потоковой обработки, сложного управления состоянием или интеграции с конкретными библиотеками. |
Spark job | Вычислительные задачи могут отправляться через интерактивные сеансы или пакетную обработку. Задачи отправляются в очереди, созданные в рамках эластичного пула ресурсов, что упрощает управление ресурсами и планирование задач. Он поддерживает несколько источников данных и форматов, предоставляя расширенные возможности обработки данных, включая, но не ограничиваясь SQL‑запросами и машинным обучением. Для получения подробной информации см. Creating a Spark Job. | Он подходит для масштабной обработки и анализа данных, таких как обучение моделей машинного обучения, анализ журналов и масштабный анализ данных. |
DLI позволяет отправлять задачи Flink или Spark, скомпилированные в виде JAR‑файлов, которые содержат необходимый код и информацию о зависимостях для выполнения задачи. Эти файлы используются для конкретных задач обработки данных, таких как запрос данных, анализ и машинное обучение. Вы можете управлять пакетами программ, необходимыми для задач, в консоли DLI.
Чтобы отправить задачу Spark Jar или Flink Jar, необходимо сначала загрузить пакет программ в OBS, создать пакет программ в DLI, а затем отправить пакет программ, данные и параметры задачи для её выполнения. Для получения подробной информации см. Managing Program Packages of Jar Jobs.
Для Spark 3.3.1 и более новых версий, а также Flink 1.15 и более новых, при создании Jar‑задачи можно напрямую указать пакет программ в OBS. Пакеты программ не могут быть прочитаны из DLI.
Вы можете запрашивать метрики мониторинга DLI и сигналы тревоги через консоль управления Cloud Eye или API.
Например, вы можете отслеживать использование ресурсов и статус задач в очереди DLI. Для получения подробной информации о метриках DLI см. Monitoring DLI Using Cloud Eye.
С помощью CTS вы можете регистрировать операции, связанные с DLI, что упрощает поиск, аудит и отслеживание в будущем. Для списка поддерживаемых операций см. Using CTS to Audit DLI.