Раздел 23

Data Engineering

Инженерия данных

Хранилища, пайплайны, форматы и качество данных. Инженерная глава: без надёжного слоя данных любая модель живёт ровно до первого изменения в источнике.

1 новинок12 актуальныхИнженерное направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Warehouse, Lake, Lakehouseактуально

Хранилище, озеро, lakehouse

Три способа хранить аналитические данные: строгая схема, сырые файлы или гибрид с транзакциями поверх объектного хранилища.

File Formatsактуально

Форматы хранения

Колоночные форматы против строковых: почему Parquet почти всегда лучше CSV для аналитики.

Partitioningактуально

Партиционирование

Разделение данных по ключу (обычно по дате), чтобы запрос читал минимум файлов.

Analytical SQLактуально

Аналитический SQL

Оконные функции, агрегации и CTE — основной инструмент подготовки признаков на больших данных.

Data Versioningактуально

Версионирование данныхиз «MLOps»

Данные меняются чаще кода — без их версий эксперимент не воспроизвести.

ETL vs ELTактуально

ETL и ELT

Преобразовывать данные до загрузки или уже внутри хранилища — и почему индустрия сместилась ко второму.

Batch and Streamingактуально

Батч и стриминг

Обработка по расписанию против непрерывной обработки событий. Разные задержки, разные гарантии, разная стоимость.

Change Data Captureактуально

Захват изменений (CDC)

Чтение журнала изменений базы вместо периодических полных выгрузок.

Orchestrationактуально

Оркестрация пайплайнов

Планировщик, который знает зависимости между задачами, повторяет упавшие и не даёт запускать одно и то же дважды.

Sparkактуально

Spark

Распределённая обработка больших объёмов данных: тот случай, когда данные не помещаются на одну машину.

Kafkaактуально

Kafka

Распределённый журнал событий: основа потоковой архитектуры и источник данных для онлайн-признаков.

Feature Storesновинка

Хранилища признаковиз «MLOps»

Централизованное хранилище признаков, единое для обучения и онлайн-инференса.

Online and Offline Featuresактуально

Онлайн- и офлайн-признакииз «Системный дизайн ML-сервисов»

Часть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.

Data Contractsновинка

Контракты данных

Явная договорённость между источником и потребителем: какие поля, каких типов и с какими гарантиями.

Data Qualityактуально

Качество данных

Автоматические проверки, которые ловят поломку источника раньше, чем она попадёт в модель.

Idempotency & Exactly-onceактуально

Идемпотентность и гарантии доставки

Что происходит при повторной обработке события и как не задвоить данные.

Data preprocessingактуально

Предобработка данныхиз «Данные»

Приведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.

4 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.