Linux: проблема с дисками

Последние две недели на виртуальном сервере информационной системы регионального масштаба появляются такие ошибки.

 Feb 6 13:27:21 Eservice kernel: sd 2:0:0:0: [sda] SCSI device reset on scsi2:0
 Feb 6 13:27:21 Eservice kernel: sd 2:0:2:0: [sdс] SCSI device reset on scsi2:2

Иногда файловая система "ложится" и перестаёт реагировать на какие-либо команды.

Думал, что проблема в загруженности дискового хранилища (большое потребление IOps), но миграция на другое менее загруженное хранилище не помогло. В перфомансе VMware показывает большой highest latency (651 миллисекунд) и скачки операций read (read rate - 125 KBps) на диске этого виртуального сервера.


Ответы (1 шт):

Автор решения: ThePinkLord

Проблема решилась (попробую приблизительно, как я понял, объяснить как решилась).

После миграции по различным дисковым хранилищам с различной нагрузкой (и потреблением IOps) highest latency не изменялся, а ошибки продолжали сыпаться в логи. Также отваливалась файловая система.

Методом исключения обратили внимание на кластер, а конкретно на один из хостов на котором был размещён данный проблемный сервер. Хоть по графикам хост не использовал и половину имеющегося у него ОЗУ и ядер ЦПУ решили мигрировать проблемный сервер оттуда на другой хост на этом кластере. После миграции в логи перестали ссыпаться ошибки, а highest latency упало с 651 миллисекунд до 20 миллисекунд. Сервер стабильно работает уже 6 часов.

Соответственно, проблема была в хосте, хоть он и не перегружен. Другие сервера размещенные на нём функционируют пока нормально, хотя тоже имеют большой highest latency. В дальнейшем планируем провести детальную диагностику хоста.

Ресурсы хоста

→ Ссылка