Découvrir les fondamentaux de la supervision : pourquoi superviser, les protocoles (SNMP, ICMP), les architectures (polling vs traps), les métriques clés (CPU, RAM, disque, réseau), et les outils du marché (Nagios, Zabbix, PRTG, Grafana).
Connaître les bases de l'administration système et réseau (adressage IP, services, ports, systèmes d'exploitation).
Superviser, c'est surveiller en continu l'état de santé d'un parc informatique (serveurs, équipements réseau, applications, bases de données) pour anticiper les pannes, garantir la disponibilité des services et optimiser les performances. Objectifs clés : - Disponibilité : s'assurer que les services sont accessibles (uptime). - Performance : détecter les ralentissements avant qu'ils n'impactent les utilisateurs. - Anticipation : repérer les tendances (ex: remplissage disque) pour agir avant la panne. - SLA (Service Level Agreement) : justifier et vérifier les engagements de niveau de service. - Sécurité : détecter des comportements anormaux (ex: pics de trafic suspects).
On distingue deux grands modes de fonctionnement : Mode actif (Polling) : - Principe : Le superviseur interroge régulièrement la cible (ex: toutes les 5 min). - Avantages : Contrôle total, suivi temporel, historique précis. - Inconvénients : Génère du trafic, peut saturer si trop fréquent. Mode passif (Traps / Événements) : - Principe : La cible envoie spontanément une alerte au superviseur lorsque quelque chose se produit (ex: panne, seuil dépassé). - Avantages : Réactif, ne consomme pas de bande passante en continu. - Inconvénients : Nécessite que la cible soit configurée pour envoyer les traps ; peut manquer des événements si l'agent est indisponible.
SNMP est le protocole standard de supervision réseau. Il fait partie de la suite TCP/IP et fonctionne sur le port UDP 161 (requêtes) et 162 (traps).
| Élément | Description | Exemple |
|---|---|---|
| Manager (superviseur) | Le poste ou serveur qui interroge les agents. | Zabbix server, Nagios server. |
| Agent | Un logiciel embarqué sur l'équipement surveillé (switch, routeur, serveur) qui répond aux requêtes. | snmpd sous Linux. |
| MIB (Management Information Base) | Base de données hiérarchique définissant les objets surveillables (OID). | RFC1213-MIB, IF-MIB. |
| OID (Object Identifier) | Identifiant numérique unique pour un paramètre spécifique. | .1.3.6.1.2.1.1.1.0 (sysDescr). |
| Communauté (Community String) | Mot de passe en clair pour l'authentification (v1/v2c). | public (lecture), private (écriture). |
Exemple de requête SNMP (commande snmpget) : snmpget -v 2c -c public 192.168.1.1 .1.3.6.1.2.1.1.1.0 → Réponse : SNMPv2-MIB::sysDescr.0 = STRING: Cisco IOS Software, Version 15.1
| Protocole / Méthode | Usage | Exemple |
|---|---|---|
| ICMP (ping) | Vérifier qu'une machine est joignable (réponse aux paquets echo). | Ping vers un serveur pour tester la connectivité réseau. |
| WMI (Windows) | Accès aux informations système sous Windows (performances, services, événements). | Script PowerShell ou agent WMI dans Zabbix. |
| API REST / HTTP | Interroger des applications web ou des services cloud (ex: AWS, Azure). | Vérifier le statut d'une API, récupérer des métriques Prometheus via HTTP. |
| Agents propriétaires | Logiciel installé sur la cible, communiquant avec le serveur de supervision (souvent chiffré). | Zabbix Agent, Nagios NRPE, Telegraf. |
Une supervision efficace repose sur le choix des bonnes métriques. Voici les plus courantes :
| Catégorie | Métrique | Seuil typique | Pourquoi c'est critique |
|---|---|---|---|
| CPU | Utilisation (%) | < 80 % sur 5 min | Un CPU saturé ralentit tous les services. |
| RAM | Mémoire utilisée (%) | < 90 % | Une mémoire pleine provoque des swaps, voire des crashes. |
| Disque | Occupation (%) | < 85 % | Un disque plein empêche l'écriture de logs et de données. |
| Réseau | Débit entrant / sortant (bps) | Variable selon la bande passante | Permet de détecter une saturation, une attaque DDoS ou une exfiltration. |
| Services | État d'un service (running/stopped) | Doit être 'running' | Un service critique arrêté = interruption de service. |
| Latence | Temps de réponse (ms) | Variable selon l'application | Les délais trop longs dégradent l'expérience utilisateur. |
Une solution de supervision se compose généralement de plusieurs briques : Architecture typique : - Agents (SNMP, WMI, API) -> Collecteur (Polling, Traps) -> Base de données (temps réel) | -> Moteur d'alertes (seuils) -> Interface (Web, Dashboards) - Collecteur : interroge les cibles, reçoit les traps. - Moteur d'alertes : compare les valeurs aux seuils et déclenche des notifications. - Base de données : stocke les historiques pour les graphiques et l'analyse. - Interface : visualisation (tableaux de bord, graphiques, listes d'alertes).
| Outil | Type | Points forts | Inconvénients |
|---|---|---|---|
| Nagios Core | Open source, plutôt orienté polling | Très stable, plugins nombreux, communauté active | Configuration complexe, interface vieillissante |
| Zabbix | Open source, agent + SNMP + polling | Tout-en-un, interface moderne, auto-discovery, très complet | Courbe d'apprentissage, lourd à maintenir |
| PRTG | Commercial (freemium jusqu'à 100 capteurs) | Interface intuitive, installation rapide, capteurs nombreux | Limité en version gratuite, coût élevé pour les grands parcs |
| Prometheus + Grafana | Open source, orienté métriques (pull) et stockage TSDB | Très performant, écosystème cloud-native, dashboards magnifiques | Nécessite des compétences, pas de gestion intégrée des traps SNMP |
| Checkmk | Open source / commercial | Évolution de Nagios, interface moderne, découverte automatique | Moins connu, versions payantes pour les fonctionnalités avancées |
Une alerte est déclenchée lorsqu'une métrique franchit un seuil prédéfini. Pour être efficace, il faut définir des seuils adaptés et éviter les faux positifs.
| Niveau | Seuil | Action typique | Exemple |
|---|---|---|---|
| INFO | Avertissement préventif | Log, tableau de bord | Occupation disque > 70 % |
| WARNING | Seuil d'attention | Email + Slack | Occupation disque > 80 % |
| CRITICAL | Incident immédiat | SMS, appel téléphonique, escalade | Occupation disque > 90 % |
| DOWN | Indisponibilité | Escalade vers le support de niveau supérieur | Ping perdu sur un serveur critique |
✅ Réponse : 161
✅ Réponse : Active interroge les cibles, passive attend des événements (traps)
✅ Réponse : Management Information Base
✅ Réponse : Zabbix
✅ Réponse : Le pourcentage d'occupation du disque et l'évolution de sa croissance
✅ Réponse : ICMP (ping)
✅ Réponse : WARNING est une alerte préventive, CRITICAL est une alerte d'incident immédiat
✅ Réponse : La communauté (mot de passe) circule en clair
✅ Réponse : Le superviseur interroge régulièrement les équipements pour collecter des données
✅ Réponse : Pour éviter que les équipes ne désensibilisent et négligent les vraies alertes