Для некоторых типов документов доступны расширенные параметры экстракторов. Вы можете настроить экстракторы для документов форматов:
Выберите Тип сплиттера — способ разбиения текста на чанки:
Markdown сплиттер.
Markdown Smart сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
(Опционально) Введите Уровни заголовков для разделения на чанки.
Если оставить поле пустым, разделение применится к заголовкам любого уровня.
(Опционально) Активируйте опцию Разрешить превышение размера чанка.
В поле HTML-тег введите тег, текст из которого будет извлечен. При указании * будет извлечен весь текст файла.
Выберите Тип сплиттера — способ разбиения текста на чанки:
HTML сплиттер.
Рекурсивный символьный сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
(Опционально) Введите Уровни заголовков для разделения на чанки.
Если оставить поле пустым, разделение применится к заголовкам любого уровня.
(Опционально) Активируйте опцию Разрешить превышение размера чанка.
Обработчик простых текстовых файлов с большим перечнем расширений.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Рекурсивный символьный сплиттер.
Символьный сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
Введите Разделители — список разделителей, по которому чанки отделяются друг от друга.
Разделители применяются только к документам, которые состоят из большего числа токенов, чем указано в параметре Размер чанка. Вы можете искать по языкам программирования, например, ввести «Go» и получить пресет разделителей для него.
(Опционально) Активируйте опцию Разделители являются регулярным выражением.
В поле Добавление разделителей выберите один из вариантов:
Добавить к началу чанка — разделители сохранятся в начале каждого чанка;
Добавить в конец чанка — разделители сохранятся в конце каждого чанка;
Не добавлять к чанку — разделители не сохранятся.
Для PDF-файлов рекомендуется не переносить логические части информации с одной страницы на другую. Начинайте каждый логический блок с новой страницы.
Выберите Метод извлечения содержимого:
Текстовый — подходит для PDF с простой структурой.
Структурный — сохраняет структурные элементы, например схемы или таблицы.
OCR полный — используется для сканированных PDF.
OCR гибридный — подходит для PDF, в которых есть как текст, так и изображения.
Выберите Режим передачи документов в сплиттер:
Полный — каждый документ передается в виде одной страницы.
Постраничный — каждая страница документа передается по отдельности.
Если в качестве метода был выбран OCR полный или OCR гибридный — выберите Режим вывода извлеченного содержимого:
Текст — файлы выводятся как текст.
С форматированием — к содержимому применяется markdown-разметка. Это позволяет сохранить структурные элементы, например схемы или таблицы.
Выберите Максимальный размер ответа OCR. От значения зависит объем текста, который возвращает OCR-модель за один вызов. Чем больше значение, тем ниже риск обрезки текста в больших файлах.
(Опционально) Выберите, использовать ли постобработку изображений с помощью VLM для повышения качества распознавания текста на изображениях:
Не использовать.
Использовать — постобработка применится ко всем изображениям в документе. Использование VLM тарифицируется отдельно.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Markdown Smart сплиттер.
Рекурсивный символьный сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
(Опционально) Введите Уровни заголовков для разделения на чанки.
Если оставить поле пустым, разделение применится к заголовкам любого уровня.
(Опционально) Активируйте опцию Разрешить превышение размера чанка.
Рекомендуется всегда вручную настраивать параметры обработки данных для JSON-файлов, а также проверять их корректность, например с помощью сервиса JSONLint.
Настройте парсер:
Заполните поле JQ-схема. Она используется утилитой jq для извлечения данных или текста из JSON.
Для тестирования jq-схемы рекомендуется использовать сайт https://play.jqlang.org.
(Опционально) Введите Ключ JSON-объекта — ключ для извлечения содержимого.
Используется, если jq-схема возвращает словарь.
(Опционально) Активируйте опцию Ключ объекта доступен для парсинга, если необходимо извлечь ключ словаря.
(Опционально) Заполните поле JQ-схема для метаданных.
JQ-схема применяется к данным, полученным на шаге a.
Выберите Формат результата парсера:
Текст — если результат jq-обработки элемента в JSON возвращает текст.
JSON-структура — если результат jq-обработки элемента в JSON возвращает JSON-объекты.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Рекурсивный JSON сплиттер. Доступен, если в поле Формат результата парсера выбрана JSON-структура.
Рекурсивный символьный сплиттер. Доступен, если в поле Формат результата парсера выбран Текст.
Символьный сплиттер. Доступен, если в поле Формат результата парсера выбран Текст.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
Введите Минимальный размер чанка. Измеряется в токенах.
Выберите Метод:
Текстовый — содержимое будет извлечено в виде текста.
Структурный — содержимое будет извлечено с сохранением структурных элементов, например схем или таблиц.
OCR гибридный — подходит для файлов, в которых есть как текст, так и изображения.
Если был выбран Метод OCR гибридный — выберите Режим вывода извлеченного содержимого: - Текст — файлы выводятся как текст.
С форматированием — к содержимому применяется markdown-разметка. Это позволяет сохранить структурные элементы, например схемы или таблицы.
Выберите Максимальный размер ответа OCR. От значения зависит объем текста, который возвращает OCR-модель за один вызов. Чем больше значение, тем ниже риск обрезки текста в больших файлах.
(Опционально) Выберите, использовать ли постобработку изображений с помощью VLM для повышения качества распознавания текста на изображениях:
Не использовать.
Использовать — постобработка применится ко всем изображениям в документе. Использование VLM тарифицируется отдельно.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Word сплиттер.
Рекурсивный символьный сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
(Опционально) В поле Столбцы с метаданными выберите столбцы CSV-файла, которые будут добавлены в метаданные документа после извлечения.
(Опционально) В поле Столбцы с контентом выберите столбцы CSV-файла, которые будут включены в содержимое документа после извлечения.
(Опционально) В поле Разделитель введите разделитель полей в CSV-файле.
(Опционально) В поле Названия столбцов вы можете задать новые названия столбцов внутри CSV-файла.
Выберите Тип сплиттера — способ разбиения текста на чанки:
CSV сплиттер.
Рекурсивный символьный сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
Выберите способ обработки формул:
Гибридный — в извлеченных таблицах отразятся результаты вычислений по формулам. Если результата нет, отобразится текст формулы.
Только значения — отразятся только результаты вычислений.
Только формулы — отразятся только тексты формул.
Выберите Формат вывода извлеченных таблиц:
Markdown — подойдет, если планируете использовать в LLM-моделях.
HTML — используется для сложных таблиц.
(Опционально) Активируйте опцию Первая строка таблицы является заголовком.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Excel сплиттер.
Без сплиттера.
Если вы выбрали сплиттер, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
Выберите Режим передачи документов в сплиттер:
Полный — каждый документ передается в виде одной страницы.
Постраничный — каждая страница документа передается по отдельности.
Выберите Режим вывода извлеченного содержимого:
Текст — файлы выводятся как текст.
С форматированием — к содержимому применяется markdown-разметка. Это позволяет сохранить структурные элементы, например схемы или таблицы.
Выберите Максимальный размер ответа OCR. От значения зависит объем текста, который возвращает OCR-модель за один вызов. Чем больше значение, тем ниже риск обрезки текста в больших файлах.
(Опционально) Выберите, использовать ли постобработку изображений с помощью VLM для повышения качества распознавания текста на изображениях:
Не использовать.
Использовать — постобработка применится ко всем изображениям в документе. Использование VLM тарифицируется отдельно.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Markdown Smart сплиттер.
Рекурсивный символьный сплиттер.
Без сплиттера.
Если вы выбрали один из сплиттеров, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.
(Опционально) Введите Уровни заголовков для разделения на чанки.
Если оставить поле пустым, разделение применится к заголовкам любого уровня.
(Опционально) Активируйте опцию Разрешить превышение размера чанка.
Настройте парсер:
Выберите Язык распознавания.
Выберите Режим обработки аудио:
Оптимальный — подходит для большинства записей, сохраняет баланс между качеством и скоростью.
Шумоподавление — для записей с шумом, эхом или низким качеством звука. Максимальная обработка.
Оригинал — для обработки записей высокого качества.
Выберите Тип сплиттера — способ разбиения текста на чанки:
Audio сплиттер.
Без сплиттера.
Если вы выбрали сплиттер, настройте его:
Введите Размер чанка. Измеряется в токенах.
Введите Размер перекрытия чанков. Измеряется в токенах.