Klaster dwuwęzłowy serwerów

Klaster dwuwęzłowy to dwa serwery (węzły) ustawione tak, żeby obciążenie albo maszyny wirtualne mogły przejść z jednego na drugi przy awarii albo przy pracach serwisowych. To najczęstsza forma wysokiej dostępności w firmach, które nie budują trzech i więcej hostów. Na stronie Proxmox taki układ opisujemy jako realną alternatywę po zmianach licencyjnych VMware, a nie jako eksperyment laboratoryjny.

Dwa węzły wymagają quorum albo jasnej reguły, kto wygrywa przy rozłączeniu sieci między nimi (split brain). Bez tego oba mogą uznać się za aktywne i uszkodzić dane. Shared storage, replikacja dysków albo niezależny świadek (qdevice, trzeci głos) nie są detalami dla entuzjastów. Są warunkiem, żeby klaster nie stał się generatorem uszkodzeń. Przy doborze serwerów dla firm ten temat wychodzi wcześniej niż kolor obudowy.

Licencje VMware po przejęciu przez Broadcom to subskrypcja liczona od rdzeni fizycznych, z minimum szesnastu rdzeni na procesor. Dwuwęzłowy klaster z dwoma procesorami na host mnoży ten próg szybko. Dlatego porównanie z Proxmoxem jest rozmową o rachunku i o umiejętnościach zespołu, nie o modzie na logo.

Częsty błąd to dwa identyczne hosty i jedna macierz bez drugiej ścieżki. Drugi błąd to klaster bez przetestowanego failoveru. Trzeci błąd to dokładanie wszystkich maszyn „bo mamy klaster”, także tych, które spokojnie zniosą godzinę postoju i nie powinny zajmować zasobów HA.

Klaster skraca przestój sprzętowy. Nie zastępuje kopii poza klastrem. Ransomware na wspólnym storage albo skasowanie maszyny w panelu hypervisora dotyczy obu węzłów tak samo, jeśli nie ma osobnego repozytorium z historią. HA i backup nadal idą w parze.

Przed zakupem drugiego węzła spisujemy, które usługi naprawdę muszą przeżyć awarię hosta w ciągu minut. Reszta dostaje zwykły restart z kopii. Potem liczymy prąd, miejsce w szafie, licencje i czas na utrzymanie. Klaster, którego nikt nie umie zaktualizować bez tygodnia czytań, jest gorszy niż jeden dobrze skopiowany serwer. Po wdrożeniu zostawiamy krótką instrukcję przełączenia dla dyżuru: co kliknąć, czego nie klikać, kogo wołać. Ta kartka w nocy jest warta więcej niż folder z diagramami, którego nikt nie otwiera przy alercie.

Sieć między węzłami klastra powinna mieć osobne łącza heartbeat i osobną ścieżkę do storage, jeśli architektura tego wymaga. Oszczędność na jednym switchu wraca jako simultaneous failure obu ścieżek. Firmware i wersje hypervisora na obu węzłach trzymamy blisko siebie; duży rozjazd wersji blokuje migracje na żywo i wydłuża okno serwisowe. Po każdej większej zmianie powtarzamy krótki failover test, nie czekamy do kwartalnego przeglądu. Dokumentacja klastra zawiera też hasła i procedury do storage oraz do switchy, bo awaria rzadko dotyczy tylko jednego pudełka z logo hypervisora. Jeśli drugi węzeł stoi „na zapas wyłączony”, to nie jest klaster. To zimny zapas z dłuższym RTO. Nazwa ma znaczenie przy budżecie i przy oczekiwaniach zarządu.

Zacznij od bezpłatnego przeglądu wstępnego

30 minut rozmowy o tym, co masz i co przeszkadza w pracy. W ciągu 1 dnia roboczego dostajesz listę ryzyk na jednej stronie i zostaje ona u Ciebie, także jeśli nie pójdziemy dalej razem. Jeśli Twoja sprawa nie jest dla nas, powiemy to od razu i wskażemy kogoś innego.

Wielkopolska · Poznań · Kalisz · Konin · cała Polska