Comprendre les mécanismes de haute disponibilité (HA) : redondance, clustering, basculement automatique et calcul du taux de disponibilité.
Avancé — SISR 2ème année
⏱️ 25 min
📁 Réseau
🎯 Objectifs de la fiche
- Qu'est-ce que la haute disponibilité ? — Définition, distinction avec PCA/PRA
- Mesurer la disponibilité — le calcul des 9 — Pourcentages, temps d'arrêt tolérés
- Techniques de redondance — Matérielle, logicielle, géographique
- Le clustering — Actif/passif, actif/actif, quorum
- Basculement automatique (failover) — Détection de panne, bascule, retour à la normale
Prérequis
Connaître les bases du PCA/PRA (voir fiche Méthodes) et de la virtualisation. Cette fiche est au programme du Bloc 2 SISR 2ème année (B2.2/B2.3 — assurer la continuité des services).
1. Qu'est-ce que la haute disponibilité ?
La haute disponibilité (High Availability, HA) désigne la capacité d'un système à rester opérationnel et accessible, avec un minimum d'interruption, même en cas de défaillance d'un de ses composants. Elle se distingue du PCA/PRA par son caractère automatique et quasi-instantané.
| Notion | Caractéristique principale |
| Haute disponibilité (HA) | Bascule automatique et quasi-instantanée, transparente pour l'utilisateur |
| PCA (Plan de Continuité) | Stratégie organisationnelle plus large, peut inclure de l'intervention humaine |
| PRA (Plan de Reprise) | Reprise après interruption confirmée, délai de RTO généralement plus long |
ℹ️ La haute disponibilité est souvent un composant technique au service du PCA : elle permet de respecter un RTO très court (quelques secondes) pour les services les plus critiques, en complément des stratégies de sauvegarde et de reprise plus larges.
2. Mesurer la disponibilité — le calcul des 9
La disponibilité d'un service se mesure en pourcentage du temps de fonctionnement sur une période donnée, souvent exprimée en 'nombre de 9'.
| Disponibilité | Temps d'arrêt toléré par an | Qualification courante |
| 99% (deux 9) | ≈ 3,65 jours | Disponibilité standard |
| 99,9% (trois 9) | ≈ 8,76 heures | Haute disponibilité |
| 99,99% (quatre 9) | ≈ 52,6 minutes | Très haute disponibilité |
| 99,999% (cinq 9) | ≈ 5,26 minutes | Disponibilité critique (télécoms, finance) |
Calcul du temps d'arrêt toléré :
Temps d'arrêt = (1 - disponibilité) × durée de la période
Exemple pour 99,9% sur une année (8760 heures) :
Temps d'arrêt = (1 - 0,999) × 8760 = 0,001 × 8760 = 8,76 heures/an
💡 Chaque '9' supplémentaire dans l'engagement de disponibilité multiplie généralement le coût de l'infrastructure nécessaire par un facteur important. Le niveau de disponibilité doit toujours être calibré selon la criticité réelle du service, pas systématiquement viser le maximum.
3. Techniques de redondance
| Type de redondance | Description | Exemple |
| Redondance matérielle | Doublement des composants physiques critiques | Alimentations redondantes, RAID, double carte réseau |
| Redondance logicielle | Plusieurs instances d'un service prêtes à prendre le relais | Cluster de serveurs applicatifs |
| Redondance réseau | Chemins multiples entre les équipements | Double lien réseau avec protocole de redondance (Spanning Tree, VRRP) |
| Redondance géographique | Duplication sur plusieurs sites physiques distincts | Datacenter de secours dans une autre région |
4. Le clustering — principe et modes
Un cluster est un ensemble de serveurs (nœuds) qui travaillent ensemble pour fournir un service de façon continue, en se substituant les uns aux autres en cas de panne.
| Mode de cluster | Fonctionnement | Avantage | Inconvénient |
| Actif/Passif | Un nœud actif traite le trafic, l'autre est en attente (standby) | Simplicité, bascule prévisible | Ressource du nœud passif inutilisée en temps normal |
| Actif/Actif | Tous les nœuds traitent le trafic simultanément | Meilleure utilisation des ressources, répartition de charge | Configuration plus complexe, gestion de la cohérence des données |
| Concept clé du clustering | Définition |
| Nœud (node) | Un serveur membre du cluster |
| Heartbeat | Signal périodique entre les nœuds permettant de détecter une panne |
| Quorum | Nombre minimal de nœuds devant être disponibles pour que le cluster fonctionne (évite le split-brain) |
| Split-brain | Situation où deux nœuds se croient tous deux actifs simultanément, risquant une incohérence des données |
| Adresse IP virtuelle (VIP) | Adresse partagée par les nœuds, basculée automatiquement vers le nœud actif |
⛔ Le split-brain est l'un des risques majeurs du clustering : si les nœuds perdent la communication entre eux (heartbeat) sans qu'aucun ne soit réellement en panne, chacun peut croire devoir prendre le relais, entraînant des écritures concurrentes incohérentes. Le mécanisme de quorum est justement conçu pour prévenir ce scénario.
5. Basculement automatique (failover)
| Étape du failover | Action |
| 1. Détection | Le mécanisme de heartbeat détecte l'absence de réponse d'un nœud |
| 2. Décision | Le cluster détermine qu'une bascule est nécessaire (en tenant compte du quorum) |
| 3. Bascule | L'adresse IP virtuelle et les services basculent vers le nœud disponible |
| 4. Reprise du service | Les utilisateurs sont redirigés de façon transparente vers le nouveau nœud actif |
| 5. Failback (optionnel) | Retour automatique ou manuel vers le nœud d'origine une fois réparé |
Exemple de scénario de failover :
Nœud A (actif) ← VIP 192.168.1.100 ← Utilisateurs
Nœud B (passif) ← surveille A via heartbeat
Panne du nœud A détectée (absence de heartbeat pendant X secondes)
↓
Nœud B devient actif et prend en charge la VIP 192.168.1.100
↓
Les utilisateurs continuent d'accéder au service de façon transparente
- ☐ Différence HA / PCA / PRA clarifiée
- ☐ Calcul du temps d'arrêt toléré à partir d'un pourcentage de disponibilité maîtrisé
- ☐ 4 types de redondance distingués (matérielle, logicielle, réseau, géographique)
- ☐ Différence actif/passif et actif/actif comprise
- ☐ Notions de heartbeat, quorum et split-brain assimilées
- ☐ 5 étapes du failover mémorisées