Веб-версияОткрыть в Telegram

ПостУ многих, зачастую, создается ощущение, что их имеющиеся знания и опыт очевидны всем. На самом деле, это не так.

22 января 2026
К
Культура Надёжности
Фотография
нажмите — покажем
У многих, зачастую, создается ощущение, что их имеющиеся знания и опыт очевидны всем. На самом деле, это не так. Люди не связанные с ИТ, в большинстве случаев, имеют очень поверхностные знания по тому как устроена надежности в ИТ. Если вам нужно их быстро погрузить в тему надежности, а главное, дать понять, что они играют не последнюю роль в ее обеспечении, можете для начала дать им почитать эту памятку. Памятка для руководителя: как управлять надёжностью IT-систем Главный принцип: надёжность — ваша общая с IT ответственность, а не только их проблема. 1. Заложите надёжность в разработку — 40–60% инцидентов случаются после выпуска новой фичи. — Внедряйте CI/CD, постепенный rollout и адекватные тестовые среды. — Выделяйте 20–30% бэклога на техдолг и задачи надёжности — это страховка от будущих аварий. 2. Переходите на end-to-end команды — Команда, которая разрабатывает и сопровождает сервис, выводит продукты на рынок быстрее и создаёт более устойчивые решения. 3. Требуйте настоящей наблюдаемости (Observability) — Панель мониторинга должна за 30 сек. давать ответ: что сломалось, на кого влияет, какая бизнес-метрика падает. — Фиксируйте целевые показатели доступности (SLO) ещё на этапе проектирования сервиса. 4. Управляйте технологическими рисками: — Риск = Вероятность сбоя × Стоимость минуты простоя. — Для критичных систем считайте классы критичности. Пример: «4 девятки» (99,99%) = десятки минут простоя в год. — Регулярно проводите учения по аварийному восстановлению (DRP). — Выстройте процесс управления мощностями 5. Ваша роль — расставлять приоритеты и давать команде время на улучшение фундамента. — Защищайте команду от перегрузки. В спринте держите баланс: фичи, задачи на надёжность (20–30%), буфер на срочные правки (15–20%). 6. Задавайте правильные вопросы при выборе решений 1. Оценили ли риски? 2. Сколько стоит минута простоя? 3. Какое время восстановления (RTO) и потери данных (RPO)? 4. Что будет, если эта новая технология (например, AI-агент) перестанет работать? 5. Какие метрики выводятся на панель дежурным? 6. Когда пройдут первые аварийные учения? 7. Кто в команде отвечает за надёжность? Итог: Управляйте надёжностью проактивно, говорите с IT на одном языке. Это не технические детали, а управленческие решения, которые напрямую влияют на лояльность клиентов и доход. @Simple_Reliability
4 · 174 ·

Рядом в ленте

ККультура НадёжностиРебята из DevCrowd опросили 273 инженера, которые занимаются вопросами надёжности в своих компаниях и составили портрет инженера по надёжности SRE - молодая ролККультура НадёжностиВ ночь на 20 декабря масштабное отключение электроэнергии в Сан-Франциско парализовало весь флот роботакси Waymo. Более 130 000 потребителей остались без света,
это сообщение
ККультура НадёжностиМетафор про принципы надёжности в обычной жизни очень много. Если присмотреться. Накануне оставил машину с «жёлтой лампочкой» - стрелка топлива упёрлась в ноль.ККультура НадёжностиВ одном из сценариев будущего, самый большой риск связанный с ИТ - не кибермошенничество, а дискриминация алгоритмов (в большинстве случаев конечно же недетерми
ККультура НадёжностиКультура Надёжности@Simple_Reliability · канал · Технологии
182подписчиков79средний охват поста
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем