Веб-версияОткрыть в Telegram

Пост✨ Андрей Бородин — Compute/Storage separation в Greenplum

7 марта 2025
D
Data Engineering Digest
Ссылка
нажмите — покажем
✨ Андрей Бородин — Compute/Storage separation в Greenplum Сложность: 1.5/3 Кому будет интересно: Специалистам, работающим с Greenplum. Или тем, кто топит за то, что GP не универсальный и дорогой. --- Ссылка на выступление: https://youtu.be/D22bZCLZOjQ?si=z7wGmhZmKH0bsJQD Андрей Бородин рассказал о разделении вычислений и хранения данных в Greenplum, что позволяет снизить затраты на хранение данных, используя облачные решения, такие как S3. Основной фокус был на проекте Yezzey, который интегрирует Greenplum с облачным хранилищем. --- 🔍 Основные моменты: 1️⃣ Проблемы и решения: - Хранение данных в облаке (например, S3) в 10 раз дешевле, чем на локальных дисках. - Yezzey — расширение для Greenplum, которое позволяет отправлять данные в S3, сохраняя при этом производительность. 2️⃣ Автоматическое охлаждение данных: - Проект "Автоматическое охлаждение" был разработан для перемещения данных в облачное хранилище. 3️⃣ Производительность: - На "обычных" запросах разница в времени выполнения между данными в S3 и локальными данными составляет всего 25%, при этом стоимость хранения в S3 в 10 раз ниже. - На сложных запросах разницы в производительности практически нет. - Оптимизатор Greenplum не видит разницы между данными в S3 и на локальных дисках. 4️⃣ Проблемы с восстановлением и шифрованием: - При восстановлении кластера с данными в S3 данные необходимо скачивать и шифровать заново, но это происходит автоматически. 5️⃣ Автоматическое масштабирование: - Автоматическое масштабирование пока находится на стадии проектирования. - Планируется возможность сжатия кластера для удобства пользователей. 6️⃣ Требования к инфраструктуре: - Для эффективной работы Greenplum с S3 требуется мощная сеть, так как производительность ограничивается именно сетью. - Технология Yezzey недавно выпущена, и есть много планов на будущее, включая улучшение производительности и оптимизацию запросов. --- 💡 Плюсы подхода: - Экономия на хранении: Использование S3 снижает затраты в 10 раз. - Масштабируемость: Данные в облаке позволяют избежать проблемы data gravity. - Производительность: На сложных запросах разницы в производительности практически нет. --- ⚠️ Минусы и ограничения: - Сеть: Производительность ограничена пропускной способностью сети. - Автоматическое охлаждение: Подход оказался неэффективным и больше не используется. - Локальное кэширование: Пока не реализовано. --- 📌 Выводы: Разделение вычислений и хранения данных в Greenplum с использованием S3 — это мощный подход для снижения затрат на хранение. Проект Yezzey уже показывает хорошие результаты, но требует дальнейшего улучшения, особенно в области локального кэширования и оптимизации сетевого обмена.
16 · 1.5K ·

Рядом в ленте

DData Engineering DigestОпросDData Engineering DigestПока готовлю новый пост, буду делиться каналами, которые я сам читаю. Не реклама, личная рекомендация. https://t.me/mpp_secrets - один из лучших каналов по Gree
это сообщение
DData Engineering DigestДобавлю комментарий от себя: кажется, что технология безумно крутая, но пока сырая. Документация очень скудная. https://yandex.cloud/ru/docs/managed-greenplum/oDData Engineering Digest✨ Кузьма Лешаков — Разгоним запросы: как быстро готовить ClickHouse Сложность: 1/3 (для тех, кто знаком с Clickhouse) Кому будет интересно: В докладе рассказыва
DData Engineering DigestData Engineering Digest@DataEngineeringDigest · канал · Новости
1 175подписчиков474средний охват поста
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем