Data Engineering
Инженерия данных
Хранилища, пайплайны, форматы и качество данных. Инженерная глава: без надёжного слоя данных любая модель живёт ровно до первого изменения в источнике.
Warehouse, Lake, Lakehouseактуально
Хранилище, озеро, lakehouseТри способа хранить аналитические данные: строгая схема, сырые файлы или гибрид с транзакциями поверх объектного хранилища.
File Formatsактуально
Форматы храненияКолоночные форматы против строковых: почему Parquet почти всегда лучше CSV для аналитики.
Partitioningактуально
ПартиционированиеРазделение данных по ключу (обычно по дате), чтобы запрос читал минимум файлов.
Analytical SQLактуально
Аналитический SQLОконные функции, агрегации и CTE — основной инструмент подготовки признаков на больших данных.
Data Versioningактуально
Версионирование данныхиз «MLOps»Данные меняются чаще кода — без их версий эксперимент не воспроизвести.
ETL vs ELTактуально
ETL и ELTПреобразовывать данные до загрузки или уже внутри хранилища — и почему индустрия сместилась ко второму.
Batch and Streamingактуально
Батч и стримингОбработка по расписанию против непрерывной обработки событий. Разные задержки, разные гарантии, разная стоимость.
Change Data Captureактуально
Захват изменений (CDC)Чтение журнала изменений базы вместо периодических полных выгрузок.
Orchestrationактуально
Оркестрация пайплайновПланировщик, который знает зависимости между задачами, повторяет упавшие и не даёт запускать одно и то же дважды.
Sparkактуально
SparkРаспределённая обработка больших объёмов данных: тот случай, когда данные не помещаются на одну машину.
Kafkaактуально
KafkaРаспределённый журнал событий: основа потоковой архитектуры и источник данных для онлайн-признаков.
Feature Storesновинка
Хранилища признаковиз «MLOps»Централизованное хранилище признаков, единое для обучения и онлайн-инференса.
Online and Offline Featuresактуально
Онлайн- и офлайн-признакииз «Системный дизайн ML-сервисов»Часть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.
Data Contractsновинка
Контракты данныхЯвная договорённость между источником и потребителем: какие поля, каких типов и с какими гарантиями.
Data Qualityактуально
Качество данныхАвтоматические проверки, которые ловят поломку источника раньше, чем она попадёт в модель.
Idempotency & Exactly-onceактуально
Идемпотентность и гарантии доставкиЧто происходит при повторной обработке события и как не задвоить данные.
Data preprocessingактуально
Предобработка данныхиз «Данные»Приведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.
4 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.