Извлечение данных

Извлечение решает главную проблему глубоких исследований: объём скачанного материала в разы превышает контекст любой языковой модели. Research Agent разбивает текст на управляемые чанки и извлекает структурированные данные пакетами — сотни страниц превращаются в таблицы.

Chunk API

Скачанный Markdown разбивается на чанки с бюджетом токенов: каждый фрагмент гарантированно влезает в контекст модели. Чанки сохраняются как файлы с заголовками-источниками — видно, из каких скачанных страниц состоит каждый фрагмент.

Extract API

Извлечение идёт через LLM: каждый чанк обрабатывается отдельным вызовом, из него вытягиваются структурированные записи по заданной схеме. Форматы результатов — TSV (по умолчанию) и JSON. Обработка пакетная (batch): по таблице результатов на каждый чанк, агрегация — уже по всем чанкам сразу.

Для работы извлечения нужен хотя бы один включённый LLM-сервис в разделе Services — иначе операция завершится со статусом Failed и ошибкой сервисов. Это единственная восстанавливаемая ошибка конвейера: включите сервис и повторите.

Токены и стоимость

Каждое извлечение учитывается: токены, вызовы и стоимость. Раздел Completions показывает полную историю LLM-вызовов, так что экономика исследования — 10–30 центов на дешёвой модели — прозрачна до цента.

Дополнительные API

  • Links — извлечение URL по паттерну из скачанных страниц (например, собрать Telegram-каналы ниши);
  • Markdown Clean — нормализация Markdown: отчёты и документы приводятся к единому виду;
  • Telegram Verify — проверка метаданных t.me-каналов: подписчики и активность по ссылке.

← Оглавление документации