Извлечение решает главную проблему глубоких исследований: объём скачанного материала в разы превышает контекст любой языковой модели. Research Agent разбивает текст на управляемые чанки и извлекает структурированные данные пакетами — сотни страниц превращаются в таблицы.
Chunk API
Скачанный Markdown разбивается на чанки с бюджетом токенов: каждый фрагмент гарантированно влезает в контекст модели. Чанки сохраняются как файлы с заголовками-источниками — видно, из каких скачанных страниц состоит каждый фрагмент.
Extract API
Извлечение идёт через LLM: каждый чанк обрабатывается отдельным вызовом, из него вытягиваются структурированные записи по заданной схеме. Форматы результатов — TSV (по умолчанию) и JSON. Обработка пакетная (batch): по таблице результатов на каждый чанк, агрегация — уже по всем чанкам сразу.
Для работы извлечения нужен хотя бы один включённый LLM-сервис в разделе Services — иначе операция завершится со статусом Failed и ошибкой сервисов. Это единственная восстанавливаемая ошибка конвейера: включите сервис и повторите.
Токены и стоимость
Каждое извлечение учитывается: токены, вызовы и стоимость. Раздел Completions показывает полную историю LLM-вызовов, так что экономика исследования — 10–30 центов на дешёвой модели — прозрачна до цента.
Дополнительные API
- Links — извлечение URL по паттерну из скачанных страниц (например, собрать Telegram-каналы ниши);
- Markdown Clean — нормализация Markdown: отчёты и документы приводятся к единому виду;
- Telegram Verify — проверка метаданных t.me-каналов: подписчики и активность по ссылке.