← Retour au portail

Fiche 2 - Haute disponibilité — clustering et redondance

Comprendre les mécanismes de haute disponibilité (HA) : redondance, clustering, basculement automatique et calcul du taux de disponibilité.

Avancé — SISR 2ème année ⏱️ 25 min 📁 Réseau

🎯 Objectifs de la fiche

  1. Qu'est-ce que la haute disponibilité ? — Définition, distinction avec PCA/PRA
  2. Mesurer la disponibilité — le calcul des 9 — Pourcentages, temps d'arrêt tolérés
  3. Techniques de redondance — Matérielle, logicielle, géographique
  4. Le clustering — Actif/passif, actif/actif, quorum
  5. Basculement automatique (failover) — Détection de panne, bascule, retour à la normale

Prérequis

Connaître les bases du PCA/PRA (voir fiche Méthodes) et de la virtualisation. Cette fiche est au programme du Bloc 2 SISR 2ème année (B2.2/B2.3 — assurer la continuité des services).

1. Qu'est-ce que la haute disponibilité ?

La haute disponibilité (High Availability, HA) désigne la capacité d'un système à rester opérationnel et accessible, avec un minimum d'interruption, même en cas de défaillance d'un de ses composants. Elle se distingue du PCA/PRA par son caractère automatique et quasi-instantané.

NotionCaractéristique principale
Haute disponibilité (HA)Bascule automatique et quasi-instantanée, transparente pour l'utilisateur
PCA (Plan de Continuité)Stratégie organisationnelle plus large, peut inclure de l'intervention humaine
PRA (Plan de Reprise)Reprise après interruption confirmée, délai de RTO généralement plus long
ℹ️ La haute disponibilité est souvent un composant technique au service du PCA : elle permet de respecter un RTO très court (quelques secondes) pour les services les plus critiques, en complément des stratégies de sauvegarde et de reprise plus larges.

2. Mesurer la disponibilité — le calcul des 9

La disponibilité d'un service se mesure en pourcentage du temps de fonctionnement sur une période donnée, souvent exprimée en 'nombre de 9'.

DisponibilitéTemps d'arrêt toléré par anQualification courante
99% (deux 9)≈ 3,65 joursDisponibilité standard
99,9% (trois 9)≈ 8,76 heuresHaute disponibilité
99,99% (quatre 9)≈ 52,6 minutesTrès haute disponibilité
99,999% (cinq 9)≈ 5,26 minutesDisponibilité critique (télécoms, finance)
Calcul du temps d'arrêt toléré :

Temps d'arrêt = (1 - disponibilité) × durée de la période

Exemple pour 99,9% sur une année (8760 heures) :
Temps d'arrêt = (1 - 0,999) × 8760 = 0,001 × 8760 = 8,76 heures/an
💡 Chaque '9' supplémentaire dans l'engagement de disponibilité multiplie généralement le coût de l'infrastructure nécessaire par un facteur important. Le niveau de disponibilité doit toujours être calibré selon la criticité réelle du service, pas systématiquement viser le maximum.

3. Techniques de redondance

Type de redondanceDescriptionExemple
Redondance matérielleDoublement des composants physiques critiquesAlimentations redondantes, RAID, double carte réseau
Redondance logiciellePlusieurs instances d'un service prêtes à prendre le relaisCluster de serveurs applicatifs
Redondance réseauChemins multiples entre les équipementsDouble lien réseau avec protocole de redondance (Spanning Tree, VRRP)
Redondance géographiqueDuplication sur plusieurs sites physiques distinctsDatacenter de secours dans une autre région

4. Le clustering — principe et modes

Un cluster est un ensemble de serveurs (nœuds) qui travaillent ensemble pour fournir un service de façon continue, en se substituant les uns aux autres en cas de panne.

Mode de clusterFonctionnementAvantageInconvénient
Actif/PassifUn nœud actif traite le trafic, l'autre est en attente (standby)Simplicité, bascule prévisibleRessource du nœud passif inutilisée en temps normal
Actif/ActifTous les nœuds traitent le trafic simultanémentMeilleure utilisation des ressources, répartition de chargeConfiguration plus complexe, gestion de la cohérence des données
Concept clé du clusteringDéfinition
Nœud (node)Un serveur membre du cluster
HeartbeatSignal périodique entre les nœuds permettant de détecter une panne
QuorumNombre minimal de nœuds devant être disponibles pour que le cluster fonctionne (évite le split-brain)
Split-brainSituation où deux nœuds se croient tous deux actifs simultanément, risquant une incohérence des données
Adresse IP virtuelle (VIP)Adresse partagée par les nœuds, basculée automatiquement vers le nœud actif
⛔ Le split-brain est l'un des risques majeurs du clustering : si les nœuds perdent la communication entre eux (heartbeat) sans qu'aucun ne soit réellement en panne, chacun peut croire devoir prendre le relais, entraînant des écritures concurrentes incohérentes. Le mécanisme de quorum est justement conçu pour prévenir ce scénario.

5. Basculement automatique (failover)

Étape du failoverAction
1. DétectionLe mécanisme de heartbeat détecte l'absence de réponse d'un nœud
2. DécisionLe cluster détermine qu'une bascule est nécessaire (en tenant compte du quorum)
3. BasculeL'adresse IP virtuelle et les services basculent vers le nœud disponible
4. Reprise du serviceLes utilisateurs sont redirigés de façon transparente vers le nouveau nœud actif
5. Failback (optionnel)Retour automatique ou manuel vers le nœud d'origine une fois réparé
Exemple de scénario de failover :

Nœud A (actif)  ←  VIP 192.168.1.100  ←  Utilisateurs
Nœud B (passif) ←  surveille A via heartbeat

Panne du nœud A détectée (absence de heartbeat pendant X secondes)
      ↓
Nœud B devient actif et prend en charge la VIP 192.168.1.100
      ↓
Les utilisateurs continuent d'accéder au service de façon transparente
🎯 Passer l'évaluation de cette fiche