Lakehouse — файловый интерфейс к вашим данным: дерево папок в браузере, просмотр и запросы к файлам без настройки источников данных. Положили файл в папку — и уже строите по нему отчёт.
Структура
/lakehouse/
├── ProjectName/
│ ├── DataSource1/
│ │ ├── file.md
│ │ ├── data.parquet
│ │ ├── database.sqlite
│ │ └── subfolder/
│ └── DataSource2/
└── AnotherProject/
Структура: проект → источник → файлы и подпапки. В интерфейсе — путь вида /lakehouse/{проект}/{источник}, главная страница показывает все комбинации проекта и источника, отсортированные по свежести файлов. Корень задаётся переменной ANALYTICS_LAKEHOUSE_PATH.
Поддерживаемые форматы
- Markdown — просмотр как готовой документации по данным: описания таблиц, глоссарии, методички;
- Parquet — чтение через Apache Arrow: схема файла и запросы без настройки источников;
- SQLite — запросы к файлам баз через общий query pipeline, как к обычному источнику;
- Excel — таблицы
.xlsи.xlsx, в том числе сжатые: лист можно выбрать, данные листаются постранично; - PDF — документ открывается прямо в браузере, скачивать его не нужно;
- Логи и сжатый текст —
.log,.txt,.csvи другие текстовые файлы, в том числе архивы.gz: постраничный просмотр с начала файла.
API
- содержимое папок и файлов;
- схема Parquet- и SQLite-файлов;
- запросы к файлам прямо из файлового браузера.
Сценарий
Экспортировали данные в Parquet, собрали SQLite-файл, написали документацию в Markdown — просто положите всё в папку Lakehouse. Файлы сразу видны в браузере, по ним работают запросы, а отчёты подключают их как данные. Особенно удобны SQLite-файлы: база из корня папки сразу становится готовым источником, его не нужно настраивать. Для Python-аналитики файлы читаются и из Jupyter-блоков — подробнее в разделе Jupyter Notebooks.
Данные в Lakehouse обычно наполняет Data Agent: его скрипты складывают сюда Parquet-файлы и собирают из них SQLite-базу. Как устроена эта связка — на странице Данные для Analytics Agent.