Сбой в работе почтового кластера 29 мая 2024 в 10:18:00


Отчет о сбое почтового кластера от 29 мая 2024 года

Кластер состоит из 3 серверов в разных дата-центрах, в рамках текущего ядра хранятся данные всех пользователей и работает панель управления, почтовый клиент. К данному кластеру подключаются почтовые серверы, которые также дублируются в 2 дата-центрах. Система продолжает работать даже при полном отключении одного из дата-центров, но сегодня в следствии программного сбоя в 10:18 система отработала некорректно.

  1. На одном из серверов кластера в 10:18 со стороны базы данных возникла ошибка Will never receive state. Need to abort, вместе с этими в журнале операционной системы зафиксирована ошибка kernel: [2917579.023870] traps: mysqld[1011] general protection fault ip:7f3f61d20602 sp:7f3f5d110b00 error:0 in libc-2.31.so[7f3f61d20000+159000] после чего все 3 сервера базы данных перестали принимать запросы (это нештатная ситуация в следствии программного сбоя), с этого момента перестала работать отправка и прием почты, почтовый клиент и панель управления выдавали ошибки
  2. Каждая служба (панель управления, почтовый клиент, почтовые серверы) находятся под мониторингом со стороны сервиса monitorus.ru, однако по каким-то причинам он отправил первое уведомление о проблемах только в 12:06, скриншот
  3. Первостепенно мы пытались восстановить кластер базы данных, но стандартные рекомендации разработчиков базы данных не давали результат и мы приняли решение о разворачивании кластера базы данных с нуля и восстановления данных из резервной копии. Если в период с 10:00 до 10:18 производили настройки через панель управления https://mail.lite-host.in (создание или удаление почтовых ящиков, изменение паролей пользователей), то они были утеряны. Обращаю внимание, все письма за период с 10:00 до 10:18 в сохранности.
  4. Работа почтового клиента (настройки не были восстановлены), панели управления, прием и отправка сообщений были восстановлены в 12:15. Входящие письма за период с 10:18 до 12:15 должны прийти в течение дня (почтовые серверы должны предпринять повторные попытки доставки сообщений, так как в указанный период прием почты не работал).
  5. В период с 13:35 до 13:45 мы производили восстановление пользовательских настроек и базы контактов в почтовом клиенте, по этой причине он был недоступен.

После 13:45 все системы почтового кластера работают в штатном режиме. Исходя из проведенного расследования, мы добавим внутренний мониторинг служб внутри системы (такое должно работать лучше и позволит оперативнее реагировать на подобные сбои), также на тестовом сервере отработаем процесс восстановления, чтобы иметь возможность более оперативно восстанавливать работу услуги при сбое.

Мы понимаем, как важна работа почты для любой компании и приносим извинения за доставленные неудобства.