Веб-версияОткрыть в Telegram

Пост✨ Станислав Лысиков — StarRocks как ядро современной платформы данных

8 февраля 2026
D
Data Engineering Digest
Ссылка
нажмите — покажем
✨ Станислав Лысиков — StarRocks как ядро современной платформы данных Станислав Лысиков рассказал о внедрении StarRocks в продуктовом финтехе с данными до петабайта. Доклад — это честный разбор опыта перехода на новую аналитическую СУБД. Дисклеймер: Рекомендую не читать этот пост, а посмотреть доклад самим) Смотрится легко и очень интересно) YouTube: https://www.youtube.com/watch?v=oiPXIbX-cTw VK Видео: https://vkvideo.ru/video-147464741_456239483 Сложность: 2/3 (Технически насыщенный доклад, требует понимания архитектуры аналитических баз данных) Кому будет интересно: • Дата-архитекторам и инженерам • Всем, кто выбирает аналитическую СУБД для высокой нагрузки 🔍 Проблемы, которые привели к StarRocks • Старый стек: Микросервисы на MySQL + Go, но аналитика не масштабировалась • Требования к новой БД: ✔️ Дешевое внедрение и масштабируемость ✔️ Высокая скорость на потоковых данных ✔️ Open Source с активным сообществом 🏗 Архитектура и установка Два режима работы: 1 Share Nothing (данные + вычисления на одних нодах) 2 Share Data (отдельное хранилище) Минимальные требования: • 3 ноды для продакшна (рекомендуется 5) • NVMe диски, RAID не требуется • Репликация на уровне серверов Управление: • Готовность к Kubernetes (есть операторы) • Простое ручное развертывание через Helm ⚡️ Ключевые особенности StarRocks Производительность: • Разработан для лямбда-архитектуры • Высокая скорость запросов (сравнима с ClickHouse, быстрее Vertica/Spark) Поддержка форматов: • Нативные коннекторы к HDFS, Iceberg, JSON • Работа с Hive Metastore Уникальные фичи: • Data Recovery — восстановление случайно удаленных данных • Частичные UPDATE по условию • Хранение Kafka-оффсетов в БД (независимость от consumer groups) 🔄 Интеграция с данными Потоковая загрузка: • Нативная поддержка Kafka • Проблема с порядком сообщений решена через таймштампы Работа с Go: • Прямая работа с Go-структурами (команда без Java/.NET специалистов) 🛠 Проблемы и решения 1️⃣ Шардирование данных: • Двухуровневое (партиции + бакеты) • Автоматическое распределение при добавлении нод 2️⃣ Совместимость: • Драйвер через MySQL-протокол • Проблемы с некоторыми системами (например, Vertica) 3️⃣ Decimal типы: • Пришлось реализовывать кастомное решение 📊 Сравнение с аналогами StarRocks vs ClickHouse/Trino: • Выше скорость на аналитических запросах • Лучшая поддержка потоковой загрузки StarRocks vs Doris: • Разная кодовая база • Активное развитие отдельного сообщества 🤝 Сообщество и поддержка • Open Source: Активное развитие, быстрое исправление регрессий • В РФ: Доступна платная поддержка (решение Selena) • Коммерческие внедрения: Успешные кейсы в банках и телекоме 💡 Практические выводы ✅ Плюсы: • Простое развертывание и масштабирование • Высокая скорость работы с потоковыми данными • Активное сообщество ⚠️ Минусы: • Молодая экосистема (проблемы с некоторыми драйверами) • Требует адаптации под специфичные типы данных Итог: StarRocks — мощный вариант для построение DWH и для аналитики в реальном времени. Подходит для компаний, которые хотят быстро развернуть производительное решение без огромных затрат.
47 · 3K ·

Рядом в ленте

DData Engineering DigestБронислав Житников — NiFi. Пишем код для codeless-системы Сложность: 2/3 (Если NiFi не трогали - пропускайте данный доклад. Это отличное подспорье для углубленнDData Engineering DigestПродолжение предыдущего поста. Выводы и ответы на вопросы не влезли) 📝 Чего избегать: 1️⃣ С осторожностью соединять процессоры 2️⃣ Не усложнять процессор в пого
это сообщение
DData Engineering DigestМне очень нравится вопрос: Чем Parquet отличается от Iceberg? Если очень-очень грубо усреднить ответы, то получится что-то типа: Parquet - это файл с данными, аDData Engineering DigestФотография
DData Engineering DigestData Engineering Digest@DataEngineeringDigest · канал · Новости
1 175подписчиков474средний охват поста
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем