Cluster αξίζει όταν ο επιχειρησιακός αντίκτυπος της διακοπής δικαιολογεί την πρόσθετη υποδομή και όταν υπάρχει ομάδα που μπορεί να τη δοκιμάζει και να τη συντηρεί.
Ποιο πρόβλημα λύνει
Ένα σωστά σχεδιασμένο cluster μπορεί να μεταφέρει workloads σε άλλο node όταν ένας server αποτύχει ή χρειάζεται συντήρηση. Μπορεί επίσης να επιτρέπει κατανομή φορτίου και ελεγχόμενες αναβαθμίσεις.
Δεν προστατεύει αυτόματα από λανθασμένη διαγραφή, ransomware, αλλοίωση database ή αστοχία που επηρεάζει κοινό storage και κοινές εξαρτήσεις. Αυτά απαιτούν ξεχωριστά επίπεδα προστασίας.
- Αστοχία μεμονωμένου compute node.
- Προγραμματισμένη συντήρηση με μικρότερη διακοπή.
- Ελεγχόμενη μεταφορά virtual machines ή υπηρεσιών.
- Καλύτερη αξιοποίηση και παρακολούθηση διαθέσιμων πόρων.
Τα σημεία που πρέπει να σχεδιαστούν μαζί
Nodes, switches, storage, τροφοδοσία και management interfaces αποτελούν μία αλυσίδα. Αν όλα εξαρτώνται από ένα switch, ένα UPS ή ένα storage controller, το cluster μπορεί να διατηρεί κρυφό single point of failure.
Το quorum αποτρέπει αντικρουόμενες αποφάσεις όταν χάνεται η επικοινωνία μεταξύ nodes. Η ακριβής υλοποίηση εξαρτάται από την πλατφόρμα και τον αριθμό των μελών.
Η εφαρμογή πρέπει να αντέχει το failover
Η μετακίνηση μιας virtual machine δεν εγγυάται ότι οι χρήστες δεν θα αντιληφθούν διακοπή. Sessions, databases, DNS, licenses και εξωτερικές διασυνδέσεις μπορεί να απαιτούν ειδικό χειρισμό.
Για κάθε κρίσιμη υπηρεσία καταγράφονται οι εξαρτήσεις, η αναμενόμενη συμπεριφορά, ο χρόνος επαναφοράς και η διαδικασία ελέγχου μετά το failover.
- Χαρτογράφησε workloads και εξαρτήσεις.
- Εντόπισε κοινά σημεία αστοχίας.
- Όρισε επιθυμητό failover και αποδεκτή διακοπή.
- Δοκίμασε failure scenarios με εγκεκριμένο πλάνο επαναφοράς.
Πότε είναι σωστή επένδυση
Το cluster έχει νόημα όταν κρίσιμες υπηρεσίες δεν μπορούν να περιμένουν την επισκευή ή αντικατάσταση ενός server και όταν το κόστος της διακοπής είναι μετρήσιμο. Για λιγότερο κρίσιμα workloads, ένα καλό backup και γρήγορο recovery plan μπορεί να είναι αποδοτικότερο.
Η απόφαση βασίζεται σε RPO, RTO, διαθέσιμο budget, τεχνική πολυπλοκότητα και δυνατότητα συντήρησης. Η απλούστερη αρχιτεκτονική που καλύπτει τους στόχους είναι συνήθως η πιο αξιόπιστη.
