Облачная платформаAdvanced

Что такое Data Lake Insight

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

Введение в DLI

Data Lake Insight (DLI) — это сервис безсерверной обработки и анализа данных, полностью совместимый с Apache Spark и Apache Flink экосистемами. Он освобождает вас от управления серверами.

DLI поддерживает несколько методов запросов, включая стандартный SQL, Spark SQL и Flink SQL, с совместимостью с основными форматами данных. Вы можете использовать стандартный SQL или приложения Spark и Flink для запросов к основным форматам данных без ETL. DLI поддерживает SQL‑запросы и приложения Spark для разнородных источников данных, включая CloudTable, RDS, DWS, CSS, OBS, пользовательские базы данных на ECS, а также офлайн‑базы данных.

Основные функции

Подробную информацию о функциях DLI см. в Features.

Table 1 основные функции DLI

Function

Description

DLI — это сервис обработки и аналитики данных, построенный на безсерверной архитектуре.

DLI — это безсерверный сервис запросов и аналитики больших данных. С DLI вы платите только за фактически использованные вычислительные ресурсы, без необходимости поддерживать или управлять облачными серверами.

  • Auto scaling: DLI гарантирует, что у вас всегда будет достаточная емкость для обработки любых всплесков трафика.

DLI поддерживает несколько вычислительных движков.

DLI полностью совместим с экосистемами, такими как Apache Spark и Apache Flink, и поддерживает стандартный SQL, Spark SQL и Flink SQL. Он совместим с основными форматами данных, такими как CSV, JSON, Parquet и ORC.

  • Spark — это единый аналитический движок, предназначенный для масштабной обработки данных, ориентированный на запросы, вычисления и анализ. DLI прошёл обширную оптимизацию производительности и сервисно‑ориентированные улучшения по сравнению с открытым Spark, сохраняя совместимость с экосистемой Apache Spark и API, при этом повышая производительность в 2,5 раза, позволяя выполнять запросы и анализ данных масштаба эксабайт за часы.
  • Flink — распределённый вычислительный движок, который может использоваться для пакетной обработки, включающей работу со статическими и историческими наборами данных. Он также может использоваться для потоковой обработки, обеспечивая обработку потоков живых данных в реальном времени и немедленную генерацию результатов данных. DLI имеет расширенные функции и безопасность на основе открытого Flink и предлагает функцию Stream SQL, необходимую для обработки данных.

DLI поддерживает несколько методов подключения.

DLI предоставляет несколько методов подключения для удовлетворения разнообразных потребностей и сценариев пользователей.

Методы подключения:

  • Web-based console
  • APIs
  • SDKs
  • Client tools
  • Отправка заданий DLI с помощью DataArts Studio
  • Подключение к BI tools для визуального анализа

DLI может подключаться к нескольким источникам данных для кросс‑источечного анализа данных.

  • Spark datasource connection: Источники данных, такие как DWS, RDS и CSS, могут быть доступны через DLI.
  • Flink поддерживает кросс‑источечную связность с различными облачными сервисами, формируя богатую потоковую экосистему. Потоковая экосистема DLI делится на облачные сервисные экосистемы и экосистемы с открытым исходным кодом:
    • Cloud service ecosystem: DLI поддерживает связность с другими сервисами в Flink SQL. Вы можете напрямую использовать SQL для чтения и записи данных из этих облачных сервисов.
    • Open-source ecosystem: Установив сетевые соединения с другими VPC через расширенные подключения к источникам данных, вы можете получить доступ ко всем поддерживаемым Flink и Spark источникам и целевым источникам, таким как Kafka, Hbase, Elasticsearch, в очередях DLI, авторизованных тенантом.

Три базовых типа задач, поддерживаемых DLI

  • SQL jobs позволяют выполнять запросы к данным, используя стандартные SQL statements.
  • Flink jobs поддерживают возможности онлайн‑анализа Flink SQL: поддержка агрегатных функций, таких как Window и Join, использование SQL для выражения логики сервиса и быстрое и удобное внедрение сервиса.
  • Spark jobs предоставляют полностью управляемые функции вычислений Spark: вы можете отправлять вычислительные задачи через интерактивные сеансы и пакетную обработку, а также выполнять анализ данных в полностью управляемых Spark‑очередях.

DLI поддерживает раздельное хранение и вычисления.

После сохранения данных в OBS вы можете подключить DLI к OBS для анализа данных. В архитектуре раздельного хранения и вычислений ресурсы хранения и вычисления можно запрашивать и оплачивать отдельно, что снижает затраты и повышает эффективность использования ресурсов.

При создании OBS bucket для хранения избыточных данных в консоли DLI вы можете выбрать хранение single‑AZ или multi‑AZ. Различия между двумя политиками хранения следующие:

  • Хранение multi‑AZ означает, что данные будут избыточно сохраняться в нескольких AZ, обеспечивая более высокую надёжность. Buckets с хранением multi‑AZ будут сохранять данные в нескольких разных AZ в пределах одного региона. Если один AZ станет недоступен, данные всё равно можно будет получить из других AZ, что делает эту политику подходящей для сценариев хранения данных, требующих высокой надёжности. Рекомендуется использовать эту политику.
  • Хранение single‑AZ означает, что данные сохраняются только в одном AZ, но при этом более экономично по сравнению с хранением multi‑AZ.

DLI управляет и планирует ресурсы единообразно, используя эластичные пулы ресурсов.

Бэкенд эластичных пулов ресурсов использует архитектуру кластера CCE, поддерживая гетерогенные ресурсы, что позволяет управлять и планировать ресурсы единообразно.

Для получения подробной информации см. Creating an Elastic Resource Pool and Creating Queues Within It.

Архитектура продукта DLI

DLI включает следующие основные модули:

Table 2 DLI core modules

Модуль

Описание

Инструменты экосистемы

DLI использует свою надёжную безсерверную архитектуру и поддержку многомодального движка, чтобы удовлетворять разнообразные потребности различных отраслей, способствуя их цифровой трансформации и стимулируя инновации.

Вычислительный движок

  • Spark: поддерживает пакетную обработку и интерактивный анализ данных крупного масштаба, а также обеспечивает высокопроизводительные возможности распределённых вычислений.
  • Flink: поддерживает обработку потоков в реальном времени, способен обрабатывать крупномасштабные потоки данных в реальном времени, с поддержкой обработки событийного времени и управления состоянием.
  • HetuEngine: поддерживает интерактивный анализ данных, быстро обрабатывает сложные SQL‑запросы и упрощает подключение и запросы к различным источникам данных.

Единое управление ресурсами

  • Разделение ресурсов: DLI использует раздельную архитектуру вычислений и хранения, отделяя вычислительные ресурсы от ресурсов хранения. Это позволяет гибко регулировать соотношение между вычислительными и хранительными ресурсами в зависимости от реальных потребностей, повышая эффективность использования ресурсов и снижая затраты.
  • Эластичное масштабирование: вычислительные ресурсы DLI построены на контейнеризованном Kubernetes и обладают возможностями эластичного масштабирования. Ресурсы могут автоматически регулироваться в зависимости от требований задачи.
  • Поддержка многотенантности: вычислительные ресурсы могут быть изолированы по тенанту, обеспечивая независимость разных тенантов. Каждый тенант может самостоятельно управлять своими вычислительными ресурсами, что позволяет осуществлять детальное управление ресурсами и облегчает межотделовое совместное использование данных и управление разрешениями в рамках предприятий.
  • Вычислительные ресурсы по модели pay‑per‑use: вы платите только за те вычислительные ресурсы, которые действительно используете, без необходимости предварительной покупки или управления серверами, повышая эффективность использования.

Единое управление метаданными

  • Интеграция метаданных из нескольких источников: DLI поддерживает централизованное управление метаданными из различных источников данных, включая облачные источники (например, OBS, RDS, DWS и CSS) и локальные источники (например, собственные базы данных и Redis). Вы можете управлять и анализировать метаданные из разных источников без необходимости перемещения данных в единый озеро данных.
  • Синхронизация метаданных: DLI предоставляет управление метаданными для обеспечения их актуальности и согласованности.
  • Запрос и управление метаданными: DLI предлагает стандартные SQL API, позволяющие выполнять запросы и управлять метаданными с помощью SQL‑операторов. Вы можете добавлять, удалять, изменять и запрашивать метаданные для облегчения управления данными и анализа.
  • Безопасность данных и управление разрешениями: Разрешения для каталогов данных, баз данных и таблиц могут управляться. Вы можете назначать разные разрешения различным тенантам и группам пользователей для обеспечения безопасности данных и соответствия требованиям.

Сервис хранения

OBS и базы данных используются для хранения структурированных или неструктурированных данных для анализа, предоставляя услуги постоянного хранения данных.

Подключение источника данных

  • Можно подключать облачные источники данных. Например, OBS может использоваться для хранения и управления неструктурированными данными. Relational database service (RDS) может использоваться для хранения и управления структурированными данными. DWS может использоваться для эффективного выполнения запросов и анализа данных.
  • Можно подключать локальные источники данных, такие как самостоятельно развернутые базы данных (MySQL, PostgreSQL и HDFS).

Приложения данных

DLI может подключаться к основным BI‑инструментам в отрасли, гибко удовлетворяя потребности в представлении данных.

Доступ к DLI

Предоставляется веб‑ориентированная платформа управления сервисом. Вы можете получать доступ к DLI через management console или HTTPS‑API, либо подключиться к серверу DLI с помощью клиента JDBC.

  • Использование management console

    Вы можете отправлять задания SQL, Spark или Flink в DLI management console.

  • Использование API

    Если вам необходимо интегрировать DLI в стороннюю систему для вторичной разработки, вы можете вызывать DLI APIs для использования сервиса.

    Для получения подробной информации см. Data Lake Insight API Reference.

  • DataArts Studio

    DataArts Studio — это универсальная платформа для работы с данными, предоставляющая интеллектуальное управление жизненным циклом данных. Она поддерживает интеллектуальное построение промышленных библиотек знаний и включает в себя основы данных, такие как хранилище больших данных, вычисления и аналитические движки. С помощью DataArts Studio ваша компания может легко создавать сквозные интеллектуальные системы данных. Эти системы помогают устранить силосы данных, унифицировать стандарты данных, ускорить монетизацию данных и способствовать цифровой трансформации.

    Создайте подключение к данным в DataArts Studio management console для доступа к DLI для анализа данных.