EXPLAIN | Магомед Мурадалиев
Слои обработки данных от сырых к аналитическим
Прежде чем данные достигнут конечных пользователей, они проходят несколько уровней обработки. Такой многослойный подход значительно повышает стабильность ETL-процессов, позволяя настраивать требования к нормализации данных, прорабатывать подготовку и обновление информации, распределять задачи между уровнями обработки, выявлять ошибки в процессах
Полный цикл обработки включает следующие слои:
БД → RAW → ODS → DDS → DM→ BI
Давай детально разберём каждый этап.
1. Слой RAW/STG — "сырые" данные
Это первоначальный уровень хранения, куда попадают данные непосредственно из систем-источников. Его ключевые особенности:
- Сохраняет данные в практически неизменном виде, максимально близком к источнику
- Служит резервной копией для возможных повторных ETL-процессов
- Единственное допустимое преобразование — изменение типов данных для совместимости систем (например, при переходе с Oracle на Postgres)
Иногда сам слой стейджинга разделяют на слои. Первый Инкрементальный стейджинг, содержит только последние изменения, например, данные за текущий день или или другой установленный период. Второй Исторический стейджинг (corporate memory) накапливает все данные из источника, полученные за время работы хранилища.
Также в стейджинге могут выделяться вспомогательные слои для хранения данных, прошедших или не прошедших контроль качества. Ещё там хранятся вспомогательные объекты, которые нужны для поддержания процессов загрузки и обработки данных: таблицы соответствия натуральных ключей суррогатным, таблицы кодировок.
2. Слой ODS (Operational Data Store) — операционные данные
В данном слое данные очищаются от технической информации (метаданные, служебные поля), сохранение детализации близкой к исходной системе, а также приводятся к единой модели данных, унифицированы, очищены и связаны.
После ODS-слоя данные уже пригодны для работы аналитиков, но ещё не интегрированы между разными источниками.
3. Слой DDS (Detail Data Store) — детал
8 · 403 ·