С 20:20 фиксируем проблемы в работе части виртуальных серверов, проводим анализ проблемы.
Работа восстановлена в 21:15, проводим дополнительный анализ и наблюдаем за работой.
Итоги анализа: первостепенно на сервере возникли ошибки вида task jdb2/md0 blocked for more than 120 seconds, которые обычно означают проблемы с дисковой подсистемой. Вместе с указанными ошибками сервер перестал отвечать (вход по SSH стал недоступен, виртуальные машины перестали работать), однако пинг до сервера проходил. Так как мониторинг сервера был настроен на успешный обмен ICMP пакетами, то это привело к тому, что он не обнаружил зависание сервера.
В текущий момент мы проверили состояние RAID массива, выполнили short и long тестирование SMART, какие-либо ошибки дисковой подсистемы это не выявило. Для более корректного мониторинга, на каждом физическом сервере мы завели виртуальную машину и теперь проверяем ответ PHP скрипта. В случае повторения проблем, подобный тестовый сервер зависнет вместе с остальными, что приведет к срабатыванию мониторинга.
Данный инцидент считаем завершенным.