Эксплуатация

Отказоустойчивость: что происходит после отказа компонента

Single point of failure, redundancy, quorum, failover и разница между HA и backup.

Отказоустойчивость — способность системы продолжать предоставлять сервис при отказе отдельных компонентов. Она строится не одним продуктом, а устранением критических single point of failure и понятным сценарием переключения.

Резервирование компонентов

Два блока питания не помогают, если оба подключены к одной PDU. Два сетевых интерфейса мало полезны, если идут в один коммутатор. Настоящая отказоустойчивость требует независимости путей отказа.

Failover

При отказе активного компонента нагрузка должна перейти на резервный. Failover может быть автоматическим или ручным. Чем автоматичнее переключение, тем важнее корректно определять состояние узлов.

Quorum

В распределённых системах нужно понимать, какая часть кластера имеет право продолжать работу при потере связи. Quorum предотвращает split-brain.

HA не равно backup

Кластер может пережить отказ сервера, но моментально распространить ошибочное удаление данных на все реплики. Backup решает другую задачу — возвращение состояния к прошлой точке времени.

Практический вывод

При проектировании HA полезно задавать вопрос не «сколько у нас резервных узлов», а «что именно произойдёт при отказе каждого компонента».

Материал предназначен для общего технического понимания. Конкретная конфигурация зависит от платформы, версии ПО и требований среды.