Lakehouse

Lakehouse — файловый интерфейс к вашим данным: дерево папок в браузере, просмотр и запросы к файлам без настройки источников данных. Положили файл в папку — и уже строите по нему отчёт.

Структура

/lakehouse/
├── ProjectName/
│   ├── DataSource1/
│   │   ├── file.md
│   │   ├── data.parquet
│   │   ├── database.sqlite
│   │   └── subfolder/
│   └── DataSource2/
└── AnotherProject/

Структура: проект → источник → файлы и подпапки. В интерфейсе — путь вида /lakehouse/{проект}/{источник}, главная страница показывает все комбинации проекта и источника, отсортированные по свежести файлов. Корень задаётся переменной ANALYTICS_LAKEHOUSE_PATH.

Поддерживаемые форматы

  • Markdown — просмотр как готовой документации по данным: описания таблиц, глоссарии, методички;
  • Parquet — чтение через Apache Arrow: схема файла и запросы без настройки источников;
  • SQLite — запросы к файлам баз через общий query pipeline, как к обычному источнику.

API

  • содержимое папок и файлов;
  • схема Parquet- и SQLite-файлов;
  • запросы к файлам прямо из файлового браузера.

Сценарий

Экспортировали данные в Parquet, собрали SQLite-файл, написали документацию в Markdown — просто положите всё в папку Lakehouse. Файлы сразу видны в браузере, по ним работают запросы, а отчёты подключают их как данные. Для Python-аналитики файлы читаются и из Jupyter-блоков — подробнее в разделе Jupyter Notebooks.

← Оглавление документации