Lakehouse — файловый интерфейс к вашим данным: дерево папок в браузере, просмотр и запросы к файлам без настройки источников данных. Положили файл в папку — и уже строите по нему отчёт.
Структура
/lakehouse/
├── ProjectName/
│ ├── DataSource1/
│ │ ├── file.md
│ │ ├── data.parquet
│ │ ├── database.sqlite
│ │ └── subfolder/
│ └── DataSource2/
└── AnotherProject/
Структура: проект → источник → файлы и подпапки. В интерфейсе — путь вида /lakehouse/{проект}/{источник}, главная страница показывает все комбинации проекта и источника, отсортированные по свежести файлов. Корень задаётся переменной ANALYTICS_LAKEHOUSE_PATH.
Поддерживаемые форматы
- Markdown — просмотр как готовой документации по данным: описания таблиц, глоссарии, методички;
- Parquet — чтение через Apache Arrow: схема файла и запросы без настройки источников;
- SQLite — запросы к файлам баз через общий query pipeline, как к обычному источнику.
API
- содержимое папок и файлов;
- схема Parquet- и SQLite-файлов;
- запросы к файлам прямо из файлового браузера.
Сценарий
Экспортировали данные в Parquet, собрали SQLite-файл, написали документацию в Markdown — просто положите всё в папку Lakehouse. Файлы сразу видны в браузере, по ним работают запросы, а отчёты подключают их как данные. Для Python-аналитики файлы читаются и из Jupyter-блоков — подробнее в разделе Jupyter Notebooks.