Архитектор Данных
ОтветОпросМоя топовая история починки чего-либо тянулась нон-стоп 32 часа.
Это был Greenplum заказчика, который несколькими последовательными командами gprecoverseg вывели в «нештатный» режим. Ночная смена под жестким sla плюс неудачное стечение обстоятельств.
Через примерно час я сказал что кластеру хана и данным хана, и пошел восстанавливать из бекапа. Пока команда инцидента из 6 или 8 человек проходила стадии Отрицание-Гнев-Торг-Принятие, терабайты уже поднимались в резерв кластер.
Потом звали вендора, искали причину, писали бумажки, клялись-божились что больше никогда-никогда. Нагоняли с заказчиком дельту из источников, крепились под нагрузку х4 от обычной. Перенастраивали DNS и все виды коннектов-фаерволлов на резервный кластер.
Были веселые выходные. Бизнес-заказчик в понедельник увидел отчеты как ни в чем ни бывало.
Записали как учения по отказоустойчивости 🤪
2 · 988 ·