Три способа хранить аналитические данные: строгая схема, сырые файлы или гибрид с транзакциями поверх объектного хранилища.
Ключевые тезисы
- Warehouse (ClickHouse, BigQuery) — схема при записи, быстрые запросы, дороже хранение.
- Lake (S3 + Parquet) — схема при чтении, дёшево и гибко, но легко превращается в свалку.
- Lakehouse (Delta, Iceberg) добавляет к озеру транзакции, версии и time travel.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три архитектуры
Что выбрать под задачу.
| Warehouse | Lake | Lakehouse | |
|---|---|---|---|
| Схема | при записи | при чтении | при записи, гибко |
| Стоимость хранения | высокая | низкая | низкая |
| Транзакции | есть | нет | есть |
| Типы данных | структурированные | любые | любые |
| Типичный стек | ClickHouse, BigQuery | S3 + Parquet | Delta, Iceberg |
Для ML критична возможность получить срез данных на прошлую дату. Lakehouse даёт это из коробки (time travel), в озере это придётся организовывать партициями и снапшотами.
2Слои данных
Bronze, silver, gold — и зачем нужен каждый.
- Bronze: сырые данные как пришли, без изменений. Нужны для пересчёта после исправления логики.
- Silver: очищенные, типизированные, дедуплицированные таблицы.
- Gold: витрины под конкретные задачи — отчёты, признаки для моделей.
Модель обучается на gold-слое, но воспроизводимость обеспечивает bronze: если через полгода выяснится ошибка в трансформации, историю можно пересчитать.
Связанные темы
Платформа данных
File Formats80%
Форматы хранения · Инженерия данныхКолоночные форматы против строковых: почему Parquet почти всегда лучше CSV для аналитики.
Partitioning80%
Партиционирование · Инженерия данныхРазделение данных по ключу (обычно по дате), чтобы запрос читал минимум файлов.
Analytical SQL80%
Аналитический SQL · Инженерия данныхОконные функции, агрегации и CTE — основной инструмент подготовки признаков на больших данных.
ETL vs ELT80%
ETL и ELT · Инженерия данныхПреобразовывать данные до загрузки или уже внутри хранилища — и почему индустрия сместилась ко второму.
Batch and Streaming80%
Батч и стриминг · Инженерия данныхОбработка по расписанию против непрерывной обработки событий. Разные задержки, разные гарантии, разная стоимость.
Orchestration80%
Оркестрация пайплайнов · Инженерия данныхПланировщик, который знает зависимости между задачами, повторяет упавшие и не даёт запускать одно и то же дважды.
Spark80%
Spark · Инженерия данныхРаспределённая обработка больших объёмов данных: тот случай, когда данные не помещаются на одну машину.
Kafka80%
Kafka · Инженерия данныхРаспределённый журнал событий: основа потоковой архитектуры и источник данных для онлайн-признаков.
ML Pipelines80%
ML-пайплайны · MLOpsОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.
Data Versioning80%
Версионирование данных · MLOpsДанные меняются чаще кода — без их версий эксперимент не воспроизвести.