FAQ Data Agent

Кто пишет скрипты?

Агент. Вы описываете в чате, какие данные нужны, — он создаёт и поддерживает скрипты: пишет новые, чинит ошибки, добавляет источники. В интерфейсе нет редактора кода: вся работа со скриптами ведётся через разговор с агентом, интерфейс нужен для запуска, расписания и просмотра результатов.

Чем Data Agent отличается от ручной выгрузки данных?

Ручная выгрузка — это разовые усилия каждый раз: кому-то нужно писать или править код, не забывать запускать его, следить за ошибками. Data Agent делает всё сам: скрипты уже написаны, запускаются вручную или по расписанию, история и логи каждого запуска сохраняются, а собранные данные сразу готовы для визуализации в Analytics Agent.

Как Data Agent связан с Analytics Agent?

Data Agent — источник данных для Analytics Agent. Сбор и подготовка — здесь: скрипты, запуски, расписание, хранилище. Визуализация — в Analytics Agent: отчёты, графики, панели по базам, которые подготовил Data Agent. Вместе они образуют один конвейер: собрал → подготовил → показал.

Доступ к данным у Analytics Agent только по чтению — базы можно смотреть, но не испортить. А когда отчёт нужно добавить, исправить или расширить, Analytics Agent передаёт Data Agent работу через его защищённое API (доступ по ключу, каждый вызов проверяется): кладёт или заменяет скрипт, запускает его, обновляет данные, при необходимости ставит расписание. Данные меняет только Data Agent — порядок в хранилище не нарушается.

Где хранятся данные?

В Lakehouse — папке /lakehouse на вашем сервере, организованной по проектам и источникам. В папке каждого источника: исходные файлы Parquet, база SQLite для визуализации, описание README и логи запусков. Данные ваши: переносятся простым копированием папки.

Как задаётся расписание?

Расписание — один файл schedule.yml в папке скриптов. Меняет его агент по вашей просьбе («запускай каждый день в 8 утра»). Изменения подхватываются на лету, без перезагрузки, а запуски, пропущенные из-за простоя, не теряются.

Нужно ли уметь программировать?

Нет. Скрипты, расписания и источники — всё создаёт агент по словесному описанию. Python нужен только агенту, а окружение для него уже встроено в Docker-образ.

Что нужно для запуска?

Docker-хост: один контейнер, папка скриптов, папка постоянных данных и корень Lakehouse. Чат с агентом включается адресом и API-ключом Pastukhov Agent.

Можно ли использовать без Pastukhov Agent?

Да: запуски, планировщик, Lakehouse, источники данных и просмотр результатов работают самостоятельно. Интеграция добавляет чат с агентом — именно агент пишет и поддерживает скрипты, поэтому без подключения к Pastukhov Agent собирать новые данные некому. Уже собранные данные можно смотреть и визуализировать в Analytics Agent.

Как собрать данные из сотен страниц?

Массовым сбором занимаются сборщики (харвестеры): сервисы поиска в интернете, загрузки страниц и обработки текста моделями. Настраиваются они один раз в разделе «Харвестеры», а запускает их агент по вашей просьбе — например, «сравни цены конкурентов на трёхстах страницах». Результат видно в разделе «Сборы»: сколько обработано, сколько потрачено и сколько ещё ждать. Нужны ли платные ключи — зависит от сервиса: поиск DuckDuckGo работает без ключа, а поисковые системы вроде Serper и модели требуют ключ и тратят деньги. Стоимость считается заранее: у каждого сборщика указывается цена за запрос, за загрузку или за токены, и в статистике видно, сколько уже потрачено. Подробнее — в статье Харвестеры.