Каждая версия базы знаний состоит из источников данных и чанков, образованных из этих данных.
Managed RAG поддерживает три вида источников данных:
Object Storage — объектное хранилище S3.
Используется для получения документов при создании версии и для хранения ее чанков и эмбеддингов после создания.
Confluence — содержимое базы знаний.
Поддерживается работа с Confluence Data Center. Вы можете добавить до 100 страниц из источника одновременно.
Custom — инструмент для добавления текстовых документов напрямую в версию с помощью Public API. Такой способ быстрее загрузки документов из других источников.
Обработка содержимого из источников делится на 4 этапа:
Сканирование.
Извлечение.
Обработка.
Загрузка.
При успешной обработке содержимое переходит в статус «Активный».
При добавлении или удалении документов в бакете Object Storage содержимое версии базы знаний не изменяется. Чтобы актуализировать версию, выполните синхронизацию:
вручную — если документы добавляются или удаляются редко;
автоматически по расписанию — если документы добавляются или удаляются постоянно.
Чанк — небольшая, логически цельная часть исходного документа, загруженного в базу знаний. Используются для превращения большого объема информации в небольшие фрагменты, что облегчает их индексацию и поиск. Чанки создаются при помощи экстракторов.
Преимущества использования чанков:
Ограничение контекста — размер чанков состоит из меньшего числа токенов, чем доступно в ответе LLM-модели, что позволяет получать полный ответ без необходимости дополнительных запросов.
Релевантность — документы делятся на чанки согласно общему контексту, что позволяет возвращать пользователю только релевантный текст.
Скорость поиска — из-за небольшого количества токенов в каждом чанке поиск по ним быстрее.