Lakehouse

Lakehouse — файловый интерфейс к вашим данным: дерево папок в браузере, просмотр и запросы к файлам без настройки источников данных. Положили файл в папку — и уже строите по нему отчёт.

Структура

/lakehouse/
├── ProjectName/
│   ├── DataSource1/
│   │   ├── file.md
│   │   ├── data.parquet
│   │   ├── database.sqlite
│   │   └── subfolder/
│   └── DataSource2/
└── AnotherProject/

Структура: проект → источник → файлы и подпапки. В интерфейсе — путь вида /lakehouse/{проект}/{источник}, главная страница показывает все комбинации проекта и источника, отсортированные по свежести файлов. Корень задаётся переменной ANALYTICS_LAKEHOUSE_PATH.

Поддерживаемые форматы

  • Markdown — просмотр как готовой документации по данным: описания таблиц, глоссарии, методички;
  • Parquet — чтение через Apache Arrow: схема файла и запросы без настройки источников;
  • SQLite — запросы к файлам баз через общий query pipeline, как к обычному источнику;
  • Excel — таблицы .xls и .xlsx, в том числе сжатые: лист можно выбрать, данные листаются постранично;
  • PDF — документ открывается прямо в браузере, скачивать его не нужно;
  • Логи и сжатый текст — .log, .txt, .csv и другие текстовые файлы, в том числе архивы .gz: постраничный просмотр с начала файла.

API

  • содержимое папок и файлов;
  • схема Parquet- и SQLite-файлов;
  • запросы к файлам прямо из файлового браузера.

Сценарий

Экспортировали данные в Parquet, собрали SQLite-файл, написали документацию в Markdown — просто положите всё в папку Lakehouse. Файлы сразу видны в браузере, по ним работают запросы, а отчёты подключают их как данные. Особенно удобны SQLite-файлы: база из корня папки сразу становится готовым источником, его не нужно настраивать. Для Python-аналитики файлы читаются и из Jupyter-блоков — подробнее в разделе Jupyter Notebooks.

Данные в Lakehouse обычно наполняет Data Agent: его скрипты складывают сюда Parquet-файлы и собирают из них SQLite-базу. Как устроена эта связка — на странице Данные для Analytics Agent.

← Оглавление документации