Катастрофоустойчивость ИТ: почему одной резервной площадки уже недостаточно
Аварии на кабельных трассах, перебои в электропитании и локальная недоступность отдельных зон облачных провайдеров наглядно показывают, что классическая схема с одной резервной площадкой больше не гарантирует непрерывность бизнеса. В традиционной модели «основной — пассивный резервный ЦОД» переключение при аварии требует ручных манипуляций и почти всегда приводит к технологической паузе, а при асинхронной репликации — и к невосполнимой потере последних транзакций. Как найти выход из ситуации рассказывает Иван Рыбин, директор департамента развития программных продуктов компании «Гравитон».
Сегодня непрерывность бизнес-процессов достигается только за счет полного устранения единых точек отказа (Single Point of Failure, SPOF). Причем этот принцип должен соблюдаться на всех уровнях: от архитектуры программно-определяемой СХД до логистики поставок самого оборудования.
Архитектурный уровень: от горячего резерва к геораспределенным СХД
Чтобы исключить технологические паузы при авариях, корпоративная ИТ-инфраструктура переходит на программно-определяемые системы хранения данных (Software-Defined Storage, SDS) с геораспределенной архитектурой. В такой модели объектные, блочные и файловые массивы объединяются в единый распределенный кластер, развернутый на нескольких независимых площадках.
Высокая доступность достигается за счет работы в режиме All Active, когда все узлы кластера на всех объектах активно и одновременно обрабатывают операции ввода-вывода, исключая простаивание мощностей. Запись информации подтверждается только после ее сохранения на нескольких независимых узлах в разных ЦОД. В результате при выходе из строя одного из дата-центров или магистрального канала связи оставшиеся площадки продолжают работу без остановки сервисов и без перекоммутации.
Практический опыт: геораспределенный кластер группы «НМТП»
Эффективность такого подхода подтверждает опыт модернизации ИТ-инфраструктуры группы «НМТП» (Новороссийский морской торговый порт). После ухода зарубежного вендора виртуализации перед предприятием встала задача заместить импортное ПО и аппаратную базу для обеспечения непрерывной работы портовых служб в режиме 24/7.
В качестве технологической основы был выбран программно-аппаратный комплекс Helius на серверах «Гравитон» С2122И с интегрированной распределенной СХД. Проект охватил два географически разнесенных ЦОД: основной дата-центр порта и удаленную резервную площадку. На каждом объекте развернули по 5 вычислительных узлов, которые затем объединили в единый геораспределенный кластер из 10 узлов.
Перевод первых критических ИТ-сервисов на новую платформу занял всего два месяца с момента старта работ. Сегодня комплекс обеспечивают бесперебойную работу технологических систем порта и поддерживает деятельность более 1800 сотрудников. При этом выбор гиперконвергентной архитектуры позволил исключить из инфраструктуры отдельные коммутаторы SAN и внешние СХД, что существенно снизило совокупную стоимость владения (TCO) при сохранении полной катастрофоустойчивости.
Производственный уровень: устранение узких мест в цепочке поставок
Архитектурная надежность внутри дата-центра потеряет смысл, если при выходе из строя оборудования или необходимости расширения кластера поставщик не сможет отгрузить замену. В этот момент единой точкой отказа становится сам вендор, завязанный на одну физическую фабрику.
Для решения этой проблемы применяется производственная фаблесс-модель (Fabless). Вендор фокусируется на инжиниринге, разработке материнских плат, микропрограммного обеспечения и интеграции ПО, а непосредственную сборку серверов и модулей размещает на независимых контрактных производствах.
Диверсификация площадок позволяет свободно перераспределять заказы между заводами-партнерами. Если один из заводов сталкивается с локальными ограничениями или загрузкой мощностей, объем выпуска оперативно переносится на альтернативные площадки. Это дает заказчикам уверенность в соблюдении сроков поставок оборудования как при плановом масштабировании, так и при аварийной замене узлов.
Современный стандарт катастрофоустойчивости крупного бизнеса строится на отказе от изолированных резервных систем. Настоящая непрерывность достигается сочетанием геораспределенной SDS-архитектуры в режиме All Active, устраняющей паузы при авариях ЦОД, и фаблесс-модели вендора, исключающей риски срыва поставок аппаратной базы.
■ Рекламаerid:2W5zFHXDrV7Рекламодатель: ООО «Ревотех»ИНН/ОГРН: 1207700403063/9731071780Сайт: https://graviton.ru



