Подумалось, сколько же тут в одной статье собрано менеджерского .. для клиентов.
Чтобы серверы не сгорели, стойки начали автоматически отключаться.
От перегрева серверы не горят уже много лет. Уходят в ступор, выключаются, но не горят.
Физически сами серверы гореть могут, и иногда это делают. Но не от перегрева.
Мы начали связываться с оператором. Оператор говорит: «Связываюсь с ЦОДом, ну, типа, там техработы».
Это обычное менеджерское ... Нормально сделанную (не из спичек и желудей) стойку закрывают на электронный и физический ключи. Открытие стойки дает алерт через независимую систему извещения, причем смонтированную внутри стойки. У чего-то серьезнее колхозинга в комплекте будет еще и независимое видеонаблюдение, и выделенный блок с отдельной дверью (клетка), и контрольные фразы классиков "у вас продается славянский шкаф". У чуть более серьезных людей и вьезд на террриторию через клетку, и вход через двойную бронедверь в сам корпус. И охрана проинструктирована - если что, жми сюда и садись пить чай, ключей разблокировки дверей у вас принципиально нет.
Железо, которое годами работает в стойке, не переносит таких приключений. При физической вибрации и тряске банально отходят контакты
Все штатные контакты в системе подпружинены. Никаких "отходят контакты" там нет. Бывает, что от тряски микросхемы памяти отлетают из слотов, но это надо очень хорошо трясти. Бывает плохая пайка, когда от вибрации контакты пайки отлетают. Растрясти сервер при транспортировке можно, но это не от "стояния годами в стойке". Что реально бывает от стояния в стойке, даже в кондиционируемой гермозоне, это окисление контактов между сокетом и контактными площадками модулей оперативной памяти. Примерно за 3-4 года может произойти в неудачных случаях. Может не произойти за 10 лет.
-хорошему, после каждого перемещения сервера нужно полностью редеплоить ноду: сносить операционку и накатывать всё заново.
Это еще зачем? Что за могучая магия при редеплое операционки, занимающей, в случае нормального ПО, целых 2 (два) гигабайта на флешке или SD карте ?
Когда ты резко выдёргиваешь шнур питания, RAID-контроллер, работающий с файловой системой, теряет информацию о структуре дисков.
1. Информация о структуре дисков в массиве хранится и на диске и на контроллере.
2. Ничего там не теряется уже много лет.
Батарейка на контроллере у серверов старше одного года часто недостаточна для записи остаточных транзакций
Батарейка на контроллере нужна не для записи остаточных транзакций, а чтобы сберечь то, что контроллер успел положить в свою оперативную память. И там не только оперативная память, а еще и SSD -
Контроллер LSI SAS2208 поддерживает следующие режимы защиты данных при сбое питания:
Интеллектуальный модуль резервного питания от аккумулятора (iBBU): при сбое питания системы iBBU обеспечивает питание кэш-памяти. После восстановления электропитания система записывает данные из кэша на накопители. Однако iBBU обеспечивает резервное питание лишь в течение ограниченного времени (12, 24, 48 или 72 часа). Если питание системы не будет восстановлено в течение этого периода, данные могут быть утеряны.
При сбое питания суперконденсатор обеспечивает энергию для сохранения данных из кэша в энергонезависимой флеш-памяти (NAND) модуля защиты. Поскольку флеш-память является энергонезависимым носителем, суперконденсатор позволяет обеспечить практически постоянную защиту данных кэша.
The LSI SAS2208 provides the following power failure protection modes:
Intelligent battery backup unit (iBBU): If a system power failure occurs, the iBBU provides power supply for the cache. After the system power supply recovers, the system writes the data in the cache to drives. The iBBU, however, provides a limited backup time for 12 hours, 24 hours, 48 hours, or 72 hours. If the system power is not recovered within the limited period, data may get lost.
If a power failure occurs, the supercapacitor supplies power to store cached data in the NAND flash of the supercapacitor protection module. The flash is a non-volatile storage medium. Therefore, the supercapacitor can provide approximately permanent protection for cache data.
При следующем запуске система может не подцепить старый массив дисков и выдаёт ошибку о критическом повреждении файловой системы либо уходит в цикличную перезагрузку.
Ни то, ни другое. Если в системе рассинхрон информации с дисков и памяти контроллера, контроллер выдает надпись "вы мне сунули диски с информаций о чужом массиве - Foreign Configuration"
У нас в одном сервере так полностью повредился диск и потерялась загрузочная запись. К счастью, ребилд
Если ребилд прошел, то избыточность существовала, и загрузочная запись потеряться не могла. Да и даже если потерялось, накатывание нормальной операционной системы на выделенные диски операционной системы, и восстановление настроек операционной системы из шаблона конфигурации занимает полчаса (с учетом 20 минут на кофе и чтение DRP).
В самый последний момент наш старший админ с настоящими танцами с бубнами смог достучаться до него через IBMC.
ibmc или работает, или нет. Это отдельная микросхема, с отдельным физическим сетевым портом.
Стратегия таких атак строится на том, что сервер коммутируется между физическим портом и виртуальными свитчами.
На русский язык перевести эту часть рассказа не удалось.
Физический сервер включается в физические порты физического коммутатора, и данные коммутируются между физическим портом физической сетевой карты и физическим портом физического коммутатора.
Выше по стеку со стороны сервера живет виртуальный коммутатор (со стороны физического коммутатора тоже может жить разного рода дрянь вроде vPC) . Обслуживанием его потока вводf вывода в нормально настроенной (в энтерпрайзе - из коробки) системе занимается отдельный поток на ядре 0. Называется Minroot у одних и vmx-чтото (не хочу нырять в дип дайв в пятницу ночью) у других. Но вот если у вас сеть на нейтроне, и нейтрон роутер живет своей жизнью, поверх давно не обновленных прошивок сетевых карт и кое как совместимых драйверов, особенно от intel, вот тут можно получить все радости.
Её нельзя перезагрузить программно, она уже не откликнется — помогает только хард-ребут по питанию.
Время каких-то удивительных историй. При нажатии reset питание с PCIe не снимается, насколько я помню. Не говоря уже про режимFunction-Level Reset (FLR) . И еще, если система "висит", то она ничего не пишет на диски, значит в кеше контроллера дисков уже давно ничего нет, значит ее можно как угодно выключать.
Исключения: случаи кроилова (и последующего попадалова) с развертыванием SDS совместно с виртуализацией, и случаи , когда жесткий диск или SSD уже умерли, но не успели про это рассказать.
Самое сложное — найти клиента, которого атакуют. Потому что пролезть на сервер за телеметрией тоже никак не выйдет при 100% загрузке процессоров и сети
На аппаратных коммутаторах неблокируемая матрица существует очень давно, и не понятно, зачем хвастаться отсутствем сбора статистики с сетевых портов через хотя бы SNMP Exporter.
но бесконечные циклы ребутов убивают массивы
Для SSD с Power loss protection (PLP) это не так. Для RAID тоже не так, разве что их по питанию постоянно включать и выключать. Механические диски на физических серверах в 2026 году нужны только в каких-то очень странных конструкциях, "из большой экономии", или потому что были из набора легаси, или в каких-то очень узких сегментах рынка.
Зачем вообще изображать попытку сделать копеечный гиперскейлер, и потом писать рекламу, совершенно не понятно.
Во всей этой статье, за ее техническими минусами, есть огромный плюс. Она размещена на Пикабу, за деньги, а не на почти официальном сайте Минцифры (ранее, до внедрения бездны минцифровой модерации - Хабр)