Облачная платформаAdvanced

Функции

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

В этом разделе изложены ключевые функции, поддерживаемые DLI. Для получения подробной информации о региональной доступности каждой функции вы можете обратиться к консоли.

Эластичные пулы ресурсов и очереди

Прежде чем отправлять задания с помощью DLI, необходимо подготовить требуемые вычислительные ресурсы.

  • Эластичный пул ресурсов

    Эластичный пул ресурсов предоставляет необходимые вычислительные ресурсы (CPU и память) для выполнения заданий DLI. Он обеспечивает мощные вычислительные возможности, высокую доступность и гибкие возможности управления ресурсами. Это делает его идеальным для масштабных вычислительных задач и бизнес‑случаев, требующих долгосрочного планирования ресурсов. Кроме того, он может динамически адаптироваться к изменяющимся требованиям к вычислительным ресурсам.

  • Очередь

    После создания эластичного пула ресурсов вы можете создать в нём несколько очередей. Каждая очередь связана с конкретными заданиями и задачами обработки данных, выступая в качестве базовой единицы для распределения и использования ресурсов в пуле. Другими словами, очередь представляет собой фактические вычислительные ресурсы, необходимые для выполнения задания.

    В рамках одного эластичного пула ресурсов вычислительные ресурсы распределяются между очередями. Настраивая соответствующие политики распределения для этих очередей, вы можете оптимизировать использование вычислительных ресурсов.

  • default Queue

    DLI поставляется с предустановленной очередью по умолчанию с именем default, где ресурсы выделяются по запросу. Если вы не уверены в требуемой емкости очереди или у вас нет доступного места для создания очередей, вы можете использовать эту default очередь для выполнения ваших заданий. Однако, поскольку очередь default общая для всех пользователей, могут возникать случаи конкуренции за ресурсы. В результате доступ к ресурсам не всегда может быть гарантирован для каждой операции.

Управление метаданными DLI

Метаданные DLI служат основой для разработки заданий SQL и Spark. Перед выполнением задания необходимо определить базы данных и таблицы в соответствии с вашими бизнес‑требованиями.

Помимо управления собственными метаданными, DLI поддерживает интеграцию с LakeFormation для унифицированного управления метаданными. Это обеспечивает прозрачную связанность с различными вычислительными движками и облачными сервисами больших данных, делая процесс построения озёр данных и управления связанными бизнес‑процессами эффективным и удобным.

  • Метаданные DLI

    Метаданные DLI служат основой для разработки SQL‑джоб и Spark‑джоб. Перед запуском джобы необходимо определить базы данных и таблицы в соответствии с вашим конкретным сценарием использования. Каталог данных: каталог данных — это объект управления метаданными, который может содержать несколько баз данных. В DLI вы можете создавать и управлять несколькими каталогами, чтобы изолировать разные наборы метаданных.

    • База данных

      База данных — это структурированное хранилище, построенное на устройствах компьютерного хранения, используемое для организации, хранения и управления данными. Она обычно хранит, извлекает и управляет структурированными данными, состоящими из нескольких взаимосвязанных таблиц данных, соединённых с помощью ключей и индексов.

    • Таблица

      Таблицы являются одними из самых критических компонентов базы данных, состоящими из строк и столбцов. Каждая строка представляет запись данных, а каждый столбец определяет атрибут или характеристику данных. Таблицы используются для организации и хранения конкретных типов данных, обеспечивая эффективный запрос и анализ. В то время как база данных предоставляет структуру, таблицы составляют её фактическое содержимое — одна база данных может включать одну или несколько таблиц.

    • Метаданные

      Метаданные — это данные, описывающие другие данные. Они в основном включают информацию об источнике, размере, формате или других характеристиках самих данных. В контексте полей базы данных метаданные помогают интерпретировать содержимое хранилища данных. При создании таблицы метаданные определяются указанием трёх элементов: имён столбцов, типов данных и описаний столбцов.

  • Подключение DLI к LakeFormation для управления метаданными

    После создания elastic resource pool вы можете создать в нём несколько очередей. Каждая очередь связана с конкретными джобами и задачами обработки данных, выступая в качестве базовой единицы для распределения и использования ресурсов в пуле. Другими словами, очередь представляет фактические вычислительные ресурсы, необходимые для выполнения джобы. В рамках одного elastic resource pool вычислительные ресурсы совместно используются между очередями. Настраивая соответствующие политики распределения для этих очередей, вы можете оптимизировать использование вычислительных ресурсов.

DLI SQL Job

DLI SQL‑джобы, также известные как DLI Spark SQL‑джобы, позволяют выполнять запросы к данным и другие операции, исполняя SQL‑операторы в SQL‑редакторе. Они поддерживают SQL:2003 и полностью совместимы со Spark SQL.

DLI Spark Job

Spark — это единый аналитический движок, предназначенный для масштабной обработки данных, ориентированный на запросы, вычисления и анализ. DLI прошёл обширную оптимизацию производительности и сервисно‑ориентированные улучшения по сравнению с открытым Spark, сохраняя совместимость с экосистемой Apache Spark и API, при этом повышая производительность в 2,5 раза, что позволяет выполнять запросы и анализ данных масштаба эксабайтов за часы.

DLI Flink Job

DLI Flink‑джобы специально разработаны для обработки потоков данных в реальном времени, что делает их идеальными для сценариев, требующих низкой задержки и быстрой реакции. Они поддерживают кросс‑источниковое подключение к различным облачным сервисам, формируя надёжную потоковую экосистему. Эти джобы подходят для приложений, таких как мониторинг в реальном времени и онлайн‑аналитика.

  • Flink OpenSource Job

    DLI предоставляет стандартные коннекторы и обширный набор API, обеспечивая бесшовную интеграцию с другими системами данных.

  • Flink Jar Job

    Вы можете отправлять Flink‑задачи, скомпилированные в JAR‑файлы, что обеспечивает большую гибкость и возможности настройки. Этот вариант хорошо подходит для сложных сценариев обработки данных, требующих пользовательских функций, определяемых пользователем функций (UDF) или специфических интеграций библиотек. Используя экосистему Flink, можно реализовать продвинутую логику потоковой обработки и управление состоянием.

  • Flink Python Job

    Начиная с Flink 1.17, DLI вводит поддержку PyFlink‑задач, предоставляя более гибкие и мощные инструменты обработки данных. Вы можете напрямую отправлять PyFlink‑задачи через страницу управления задачами DLI. Кроме того, это позволяет указывать сторонние зависимости Python и Java, настраивать виртуальные окружения Python и загружать сжатые файлы данных, что значительно повышает удобство отправки задач и гибкость их выполнения.

    Кроме того, образ DLI Flink поставляется с предустановленными стандартными средами выполнения Python, поддерживающими версии 3.7, 3.8, 3.9 и 3.10, что удовлетворяет разнообразные потребности разработки. Это позволяет разработчикам Python эффективно использовать DLI для задач обработки и анализа данных.

    Flink‑задачи Python особенно подходят для сценариев, включающих пользовательскую логику потоковой обработки, сложное управление состоянием или специфические интеграции библиотек. Требуется самостоятельно писать и собирать пакеты Python‑задач. Перед отправкой Flink‑задачи Python загрузите пакет Jar‑задачи в OBS и отправьте его вместе с данными и параметрами задачи для выполнения.

Datasource Connection

Перед выполнением кросс‑источникового анализа с помощью DLI необходимо установить соединение с источником данных, чтобы обеспечить сетевое взаимодействие между источниками данных.

Улучшенные соединения источников данных DLI используют VPC‑peering‑соединения для прямого подключения сетей VPC очередей DLI и целевых источников данных. Такой точка‑в‑точку подход обеспечивает бесшовный обмен данными, предоставляя более гибкие сценарии использования и более высокую производительность по сравнению с базовыми соединениями источников данных.

Примечание: Система default очередь не поддерживает создание соединений с источниками данных. Для создания таких соединений требуются такие функции, как VPC, подсети, маршрутизация и VPC‑peering‑соединения. Поэтому вам необходимо иметь разрешение VPC Administrator для VPC. Вы можете задать эти разрешения, обратившись к «Service Authorization».

Permission Management

DLI оснащён надёжным механизмом контроля доступа. Кроме того, DLI поддерживает детализированную аутентификацию через Identity and Access Management (IAM). Вы можете создавать IAM‑политики для управления контролем доступа в DLI. Оба механизма контроля доступа могут работать одновременно без конфликтов.

Custom DLI Agency

Для выполнения кросс-источникового анализа DLI требует разрешения агентства для доступа к другим облачным сервисам. Это позволяет DLI действовать от имени пользователей или сервисов в других облачных сервисах, обеспечивая чтение/запись данных и выполнение конкретных операций во время выполнения задачи. Пользовательское агентство DLI обеспечивает безопасный и эффективный доступ к другим облачным сервисам во время кросс-источникового анализа.

Custom Image

DLI поддерживает развертывание кластеров в контейнерах. В этих кластерах компоненты, связанные с задачами Spark и Flink, работают внутри контейнеров. Скачивая пользовательские образы, предоставленные DLI, вы можете изменить среду выполнения контейнеров Spark и Flink. Например, добавление пакетов Python или библиотек C для машинного обучения в пользовательский образ позволяет легко расширять функциональность в соответствии с вашими потребностями.