Веб-версияОткрыть в Telegram
DDatabase Internals Chat

Database Internals Chat

@databaseinternalschat · группа · Технологии · в индексе с 2026-05-28
990участников+4 за неделю
3 951сообщений в индексе
  1. A
    Ссылка
    нажмите — покажем
    Да вы правы в lucene есть отдельное сжатие для чисел https://github.com/apache/lucene/blob/main/lucene/core/src/java/org/apache/lucene/codecs/lucene90/Lucene90DocValuesFormat.java#L74 Но в целом если посмотреть на код lucene, видно что это что сжатие что расжатие делается скалярно и медленно, а написано еще в lucene 5.0 и например не различает на этом уровне double/float/разные-integer (потому что 15 лет назад когда это писалось, нужных алгоритмов толком и не было, а какой нибудь alp это вообще 2024) В целом ощущение что вы отрицаете прогресс последних лет 15 в области колончных движков: как storage части так и execution
    1. А
      Я ничего не отрицаю. Я просто поправил неточность. Разумеется можно сейчас лучше делать, я с этим не спорю и не спорил. Но simd инструкции в java пока толком не стабилизировали кстати.
      1. A
        Ок, извините, мне так показалось просто
Вся ветка · 3 ответа →
В
В общем вы меня заинтересовали, я посмотрю что и как у вас там работает в SereneDB))) Я правильно понимаю что в общих чертах с ваших слов "DuckDB лучше Tantivy" как поисковый движок? Как column storage? Как правильно интерпретировать ваши выводы?)
  1. A
    Конечно же нет, "compression methods для колонок и execution для колонок в DuckDB лучше чем в Tantivy", поиск же сделан по другому, в нашем движке IResearch поиск в целом сделан похоже на Lucene, а columnstore на основе DuckDB compression methods, в том числе потому что мы юзаем DuckDB как зависимость для execution/optimizer SQL части запроса. По поводу качества поисковой функциональности это вопрос именно к нашему IResearch движку, я считаю что он во многом лучше Tantivy и позволяет больше (куда ближе к Lucene по широте возможностей), но если хочется конкретики можно посмотреть на бенчмарки на сайте tantivy/у нас, ссылку на которые давали выше.
Вся ветка · 1 ответ →
I
  1. K
    Я вот как раз на С++ Russia об этом рассказывал . Надеюсь видео будет доступно
Вся ветка · 1 ответ →
S
Вторая тривиальная мысль это разбить уровень на N отдельных последовательностей, вычисляя N, исходя из формулы "размер_уровня = F(N)*размер_блока." "Размер_блока" это объём чтения, что насыщает пропускную способность. F(N) можно брать любой, что хочется. Отдельные последовательности в уровне позволяют уменьшать задержку слияния, и ещё кое-что приятное дают (например, лучшее сжатие). Я про это год назад документ внутренний написал. Теперь мне интересно, не работал ли какой спец в MariaDB в то время. ;)
T
Фотография
нажмите — покажем
Станьте частью технологического прорыва! Сбер и Database Internals открывают регистрацию на флагманский Data.Митап! Встретимся большим сообществом – внешним и внутренним, чтобы вместе обсудить СУБД в эпоху AI-трансформации. 1000+ участников, 3 доклада от ведущих лидеров отрасли, PostgreOnRocks, Multi-DC кластер DataGrid, новый алгоритм для оптимизации запросов в реляционных СУБД. 23 июня в 17:30 в офисе Сбера, Кутузовский пр., 32. Регистрация обязательна!
  1. D
    А трансляция будет? А то я забыл зарегистрироваться, а посмотреть было бы интересно
  2. E
    Кажется объявление не добралось до канала😢
Вся ветка · 4 ответа →
T
Ждем вас завтра на митап! Дата: 23 июня Время: 17:00 - сбор гостей, приветственный кофе-брейк 17:30 - начало митапа Адрес: Кутузовский пр., 32 (Ближайший к проспекту корпус) ❗️Прошу взять с собой паспорт РФ для прохода в здание. Схему проезда и программу митапа прилагаю.
T
Файл
23.06.2026 Программа Data.Meetup СУБД (1).docx · 27 КБ · нажмите — покажем
  1. D
    Хорошая штука. Чем-то напомнил https://seastar.io/. С внедрением cooperative multitasking очень важным становится подход к единице исполнения - неверно вставил yield и перф "ушёл".
Вся ветка · 1 ответ →
T
C++Russia начал постепенно публиковать записи докладов недавней конференции. Идним из первых идет рассказ Кости @kostja_osipov
T
Ссылка
нажмите — покажем
#видеозаписи #плюсочетверг Разбираемся с проблемой, для которой не существует доказанного оптимального решения — на какие компромиссы идут разработчики движков хранения данных? Узнайте из доклада: Константин Осипов — Стратегии слияния (compaction strategies) в LSM-деревьях 😉 YouTube | 📺 VK Видео
32 · 1.8K ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем