Источники данных

Источник данных — это то, к чему можно обращаться с запросами: таблицы с полями, из которых Analytics Agent строит отчёты, а агент — проверяет результаты. В Data Agent источники не нужно настраивать руками: они появляются сами, как только в данных появляется готовая база.

Автоматическое обнаружение

Каждая папка Lakehouse, в корне которой есть файл базы SQLite, становится источником с именем {проект}_{источник} — например, market_prices. Источник указывает на самую свежую базу папки и открыт только для чтения: скрипты пишут данные, а запросы их не меняют. Если база удалена, источник исчезает при следующем пересканировании.

Свежесть данных

Пересканирование происходит после завершения каждого запуска скрипта в папке источника, а также при обращении к ещё неизвестному имени. Поэтому свежие данные, которые только что собрал скрипт, доступны для запросов сразу — ничего не нужно «обновлять» вручную.

Переопределения и внешние базы

Иногда нужно изменить обнаруженный источник: указать другую базу, поправить название или настройки — или подключить базу, которая лежит не в Lakehouse. Для этого служат JSON-файлы в папке переопределений (volume /data). Один битый файл не ломает реестр: он пропускается с предупреждением, остальные источники работают.

Запросы к данным

Сегодня запрашиваются SQLite-источники. Разрешены запросы только на чтение (SELECT): агент проверяет данные после загрузки, вы — используете их в своей аналитике. Схема таблиц доступна сразу — видно, какие поля и типы лежат в каждой таблице.

Интерфейс — дашборд только для чтения

Раздел «Источники данных» показывает список источников, детали каждого и счётчик таблиц. Регистрирует источники агент — в интерфейсе их нельзя создать или изменить, но и случайно сломать тоже нельзя.

Смысл простыми словами

Раньше подключение базы данных — это настройка соединений, прав доступа и форматов. Здесь — ничего этого: скрипт собрал базу в Lakehouse, и источник готов к использованию. Один принцип «положил базу — получил источник» покрывает и новые задачи.

Откуда берётся материал для источника

Источник появляется там, где лежит готовая база, а базу собирает скрипт. Материал для неё скрипт обычно берёт напрямую — из API, файлов или выгрузок. Но когда нужен массовый сбор — сотни страниц конкурентов, десятки поисковых запросов, тысячи коротких текстов, — в дело вступают сборщики (харвестеры): они ищут в интернете, скачивают страницы и обрабатывают тексты моделями. HTML-страницы при этом сохраняются как чистый текст Markdown, а исходная страница — рядом с ним.

Сборщики — это отдельные сервисы: они настраиваются один раз в разделе «Харвестеры», а запускает их агент. Так материал собирается быстро и в большом объёме, а скрипты превращают его в данные Lakehouse — и в итоге в источники, по которым строятся отчёты.

Читайте также: Харвестеры, Lakehouse, Запуски, Данные для Analytics Agent.

← Оглавление документации