Отчет о сбое почтового кластера от 29 мая 2024 года
Кластер состоит из 3 серверов в разных дата-центрах, в рамках текущего ядра хранятся данные всех пользователей и работает панель управления, почтовый клиент. К данному кластеру подключаются почтовые серверы, которые также дублируются в 2 дата-центрах. Система продолжает работать даже при полном отключении одного из дата-центров, но сегодня в следствии программного сбоя в 10:18 система отработала некорректно.
Will never receive state. Need to abort, вместе с этими в журнале операционной системы зафиксирована ошибка kernel: [2917579.023870] traps: mysqld[1011] general protection fault ip:7f3f61d20602 sp:7f3f5d110b00 error:0 in libc-2.31.so[7f3f61d20000+159000] после чего все 3 сервера базы данных перестали принимать запросы (это нештатная ситуация в следствии программного сбоя), с этого момента перестала работать отправка и прием почты, почтовый клиент и панель управления выдавали ошибкиПосле 13:45 все системы почтового кластера работают в штатном режиме. Исходя из проведенного расследования, мы добавим внутренний мониторинг служб внутри системы (такое должно работать лучше и позволит оперативнее реагировать на подобные сбои), также на тестовом сервере отработаем процесс восстановления, чтобы иметь возможность более оперативно восстанавливать работу услуги при сбое.
Мы понимаем, как важна работа почты для любой компании и приносим извинения за доставленные неудобства.