Веб-версияОткрыть в Telegram

Пост✨ Наталья Журавлева — Как быстро запустить каталог данных на примере DataHub

30 марта 2025
D
Data Engineering Digest
Ссылка
нажмите — покажем
✨ Наталья Журавлева — Как быстро запустить каталог данных на примере DataHub Ссылка на выступление: https://youtu.be/nCt4gYVQdqc?si=Fbwab0cQxgMl4g3a или https://vkvideo.ru/video-147464741_456239425 Сложность: 2/3 (Техники очень мало, но теория и концептуальное погружение в доклад требуется. В фоне смотреть тяжело, нужно погружаться) Кому будет интересно: Аналитикам и архитекторам. Если Вам интересна только техника - пропускайте доклад, примеров по технике и коду в нём нет. Но я очень рекомендую доклад посмотреть, так как Наталья очень интересно рассказывает про проблемы всех хранилищ и как облегчить боль непосредственных пользователей от работы с ними. И не могу не отметить, что Наталья очень захватывающе рассказывает, одно удовольствие её слушать :) --- Наталья поделилась опытом внедрения каталога данных в компании, сделав акцент на важности логической модели и автоматизации процессов. --- 🔍 Ключевые идеи доклада: 1️⃣ Проблемы без каталога данных: - Дублирование данных и непонимание структуры - Зависимость от экспертов и "устных традиций" - Документация в Confluence быстро устаревает 2️⃣ Логическая модель — фундамент каталога: - Три уровня моделирования: • Концептуальный (бизнес-сущности) • Логический (атрибуты и связи) • Физический (реализация в БД) - В якорной модели логическую схему можно сгенерировать в полу автоматическом режиме - Хранится в YAML-файлах с версионностью через merge-реквесты 3️⃣ Процесс работы с моделью: 1. Аналитик описывает сущность в YAML 2. Разработчик реализует маппинг на физическую модель 3. Каталог автоматически подхватывает изменения 4️⃣ Выбор технологий: - Отказ от Confluence в пользу специализированного решения - Выбор DataHub вместо OpenMetadata - Интеграция проверок качества данных (DQ) --- 💡 Преимущества подхода: ✅ Сокращение времени на документирование на 60% ✅ Автоматическое обновление каталога ✅ Обнаружение ошибок в существующей логике хранилища ✅ Единый источник правды для всех команд --- ⚠️ Сложности и ограничения: - Создание логической модели требует времени - Трудности единой модели для всех хранилищ - Необходимость дополнительных инструментов моделирования --- 📌 Практические советы: 1. Начинайте с логической модели, пишите документацию всегда и сразу. 2. Автоматизируйте процесс наполнения каталога 3. Для разных хранилищ используйте разные модели 4. Внедряйте DQ-проверки прямо в каталог --- 🤔 Ответы на вопросы из зала: Q: Как бизнес-пользователи работают с каталогом? A: Через концептуальный уровень, который описывает данные в бизнес-терминах Q: Почему выбрали DataHub? A: Сравнивали с OpenMetadata — DataHub показался более зрелым решением Q: Сколько ресурсов потребовалось? A: Команда из 6 аналитиков, 1 разработчика и 1 DevOps за 6 месяцев --- 📌 Выводы: Внедрение каталога данных через логическую модель и DataHub значительно упростило работу с данными в компании.
67 · 3.4K ·

Рядом в ленте

DData Engineering Digest✨ Иван Клименко (Arenadata) — CDC в банке от источника до хранилища с применением продуктов Arenadata Ссылка на выступление: https://youtu.be/nfZdDzr_Y_Y?si=l69DData Engineering DigestСкрин архитектуры Data Platform банка из последнего поста. Пожалуйста, делитесь нашими постами с коллегами)
это сообщение
DData Engineering DigestСамые интересные слайды из доклада про каталог данных)DData Engineering DigestСледующий Digest доклада будет в выходные про шикарный EL инструмент - airbyte. Пока рекомендую фоном посмотреть дискуссию про будущее Greenpum на T-Meetup: htt
DData Engineering DigestData Engineering Digest@DataEngineeringDigest · канал · Новости
1 175подписчиков474средний охват поста
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем