HetuEngine — это внутренний высокопроизводительный интерактивный движок анализа SQL и виртуализации данных. Он бесшовно интегрируется с экосистемой больших данных для реализации интерактивного запроса огромных объёмов данных за секунды и поддерживает кросс‑источниковый и кросс‑доменно единый доступ к данным, позволяя выполнять одношаговый SQL‑анализ слияния в озере данных, между озёрами и между lakehouse.
HetuEngine состоит из различных модулей. Figure 1 показывает архитектуру.
Figure 1 HetuEngine архитектура

Модуль | Концепция | Описание |
|---|---|---|
Слой облачных сервисов | HetuEngine CLI/JDBC | HetuEngine клиент, через который отправляется запрос и возвращаются и отображаются результаты. |
HSBroker | Компонент управления сервисом HetuEngine. Он управляет и проверяет compute instances, контролирует состояние здоровья и выполняет автоматическое обслуживание. | |
HSConsole | Предоставляет визуализированные графические интерфейсы операций и RESTful API для управления информацией о источниках данных, управления вычислительными инстансами и автоматического запроса задач. | |
HSFabric | Обеспечивает высокопроизводительную и безопасную передачу данных между доменами (центрами обработки данных). | |
Слой движка | Координатор | Управляющий узел вычислительных инстансов HetuEngine. Он принимает и разбирает SQL‑запросы, генерирует и оптимизирует планы выполнения, назначает задачи и планирует ресурсы. |
Рабочий | Рабочий узел вычислительных инстансов HetuEngine. Он предоставляет возможности, такие как параллельное извлечение данных из источников и распределённые вычисления SQL. |
HetuEngine поддерживает кросс‑источниковый (множество источников данных, таких как Hive, HBase, GaussDB(DWS) и ClickHouse) и кросс‑доменно́й (множество регионов или центров обработки данных) быстрый совместный запрос, особенно интерактивный быстрый запрос данных Hive и Hudi в кластере Hadoop (MRS).
Предприятия обычно хранят огромные объёмы данных, полученных из различных баз данных и хранилищ, для управления и сбора информации. Однако разнообразие источников данных, гибридные структуры наборов данных и распределённое хранение данных увеличивают затраты на разработку кросс‑источниковых запросов и удлиняют их выполнение.
HetuEngine предоставляет единые стандартные SQL‑запросы для реализации кросс‑источникового совместного анализа, упрощая операции кросс‑источникового анализа. Рисунок 2 HetuEngine функция кросс‑источника
HetuEngine предоставляет единый стандартный SQL для реализации эффективного доступа к нескольким источникам данных, распределённым в разных регионах (или дата‑центрах), скрывает различия данных в структуре, хранении и регионе и разъединяет данные и приложения. Figure 3 HetuEngine межрегиональные функции