← Retour au portail

Fiche 1 - Introduction à la supervision – Concepts, outils et métriques

Découvrir les fondamentaux de la supervision : pourquoi superviser, les protocoles (SNMP, ICMP), les architectures (polling vs traps), les métriques clés (CPU, RAM, disque, réseau), et les outils du marché (Nagios, Zabbix, PRTG, Grafana).

Débutant / Intermédiaire — SISR 1ère / 2ème année ⏱️ 25 min 📁 Supervision

🎯 Objectifs de la fiche

  1. Pourquoi superviser ? — Enjeux métiers et techniques de la supervision
  2. Supervision active vs passive — Polling (interrogation) et traps / événements
  3. Le protocole SNMP — Agent, manager, MIB, OID, communautés
  4. Autres protocoles de supervision — ICMP, WMI, API, agents propriétaires
  5. Les métriques essentielles — CPU, RAM, disque, réseau, services, logs
  6. Architecture d'une solution de supervision — Collecteur, base de données, interface, alerting
  7. Présentation des outils courants — Nagios, Zabbix, PRTG, Prometheus + Grafana
  8. Seuils, alertes et remontées — Criticité, escalade, notification (email, SMS, Slack)
  9. Bonnes pratiques — Éviter le bruit, dimensionner, prioriser

Prérequis

Connaître les bases de l'administration système et réseau (adressage IP, services, ports, systèmes d'exploitation).

1. Pourquoi superviser ?

Superviser, c'est surveiller en continu l'état de santé d'un parc informatique (serveurs, équipements réseau, applications, bases de données) pour anticiper les pannes, garantir la disponibilité des services et optimiser les performances. Objectifs clés : - Disponibilité : s'assurer que les services sont accessibles (uptime). - Performance : détecter les ralentissements avant qu'ils n'impactent les utilisateurs. - Anticipation : repérer les tendances (ex: remplissage disque) pour agir avant la panne. - SLA (Service Level Agreement) : justifier et vérifier les engagements de niveau de service. - Sécurité : détecter des comportements anormaux (ex: pics de trafic suspects).

ℹ️ Sans supervision, on navigue à vue : on découvre les pannes quand les utilisateurs se plaignent, ce qui nuit à la crédibilité du service informatique.

2. Supervision active vs passive

On distingue deux grands modes de fonctionnement : Mode actif (Polling) : - Principe : Le superviseur interroge régulièrement la cible (ex: toutes les 5 min). - Avantages : Contrôle total, suivi temporel, historique précis. - Inconvénients : Génère du trafic, peut saturer si trop fréquent. Mode passif (Traps / Événements) : - Principe : La cible envoie spontanément une alerte au superviseur lorsque quelque chose se produit (ex: panne, seuil dépassé). - Avantages : Réactif, ne consomme pas de bande passante en continu. - Inconvénients : Nécessite que la cible soit configurée pour envoyer les traps ; peut manquer des événements si l'agent est indisponible.

💡 Les solutions modernes combinent les deux : poll pour les métriques de tendance, traps pour les alertes critiques instantanées.

3. Le protocole SNMP (Simple Network Management Protocol)

SNMP est le protocole standard de supervision réseau. Il fait partie de la suite TCP/IP et fonctionne sur le port UDP 161 (requêtes) et 162 (traps).

ÉlémentDescriptionExemple
Manager (superviseur)Le poste ou serveur qui interroge les agents.Zabbix server, Nagios server.
AgentUn logiciel embarqué sur l'équipement surveillé (switch, routeur, serveur) qui répond aux requêtes.snmpd sous Linux.
MIB (Management Information Base)Base de données hiérarchique définissant les objets surveillables (OID).RFC1213-MIB, IF-MIB.
OID (Object Identifier)Identifiant numérique unique pour un paramètre spécifique..1.3.6.1.2.1.1.1.0 (sysDescr).
Communauté (Community String)Mot de passe en clair pour l'authentification (v1/v2c).public (lecture), private (écriture).
⛔ SNMPv1 et v2c sont vulnérables car les communautés (mots de passe) circulent en clair sur le réseau. Utilisez SNMPv3 avec chiffrement et authentification renforcée dès que possible.
Exemple de requête SNMP (commande snmpget) :
snmpget -v 2c -c public 192.168.1.1 .1.3.6.1.2.1.1.1.0
→ Réponse : SNMPv2-MIB::sysDescr.0 = STRING: Cisco IOS Software, Version 15.1

4. Autres protocoles et méthodes de supervision

Protocole / MéthodeUsageExemple
ICMP (ping)Vérifier qu'une machine est joignable (réponse aux paquets echo).Ping vers un serveur pour tester la connectivité réseau.
WMI (Windows)Accès aux informations système sous Windows (performances, services, événements).Script PowerShell ou agent WMI dans Zabbix.
API REST / HTTPInterroger des applications web ou des services cloud (ex: AWS, Azure).Vérifier le statut d'une API, récupérer des métriques Prometheus via HTTP.
Agents propriétairesLogiciel installé sur la cible, communiquant avec le serveur de supervision (souvent chiffré).Zabbix Agent, Nagios NRPE, Telegraf.

5. Les métriques essentielles à superviser

Une supervision efficace repose sur le choix des bonnes métriques. Voici les plus courantes :

CatégorieMétriqueSeuil typiquePourquoi c'est critique
CPUUtilisation (%)< 80 % sur 5 minUn CPU saturé ralentit tous les services.
RAMMémoire utilisée (%)< 90 %Une mémoire pleine provoque des swaps, voire des crashes.
DisqueOccupation (%)< 85 %Un disque plein empêche l'écriture de logs et de données.
RéseauDébit entrant / sortant (bps)Variable selon la bande passantePermet de détecter une saturation, une attaque DDoS ou une exfiltration.
ServicesÉtat d'un service (running/stopped)Doit être 'running'Un service critique arrêté = interruption de service.
LatenceTemps de réponse (ms)Variable selon l'applicationLes délais trop longs dégradent l'expérience utilisateur.
💡 Ne supervisez pas tout pour ne pas vous noyer. Commencez par les équipements critiques (cœur de réseau, serveurs métiers) et élargissez progressivement.

6. Architecture d'une solution de supervision

Une solution de supervision se compose généralement de plusieurs briques : Architecture typique : - Agents (SNMP, WMI, API) -> Collecteur (Polling, Traps) -> Base de données (temps réel) | -> Moteur d'alertes (seuils) -> Interface (Web, Dashboards) - Collecteur : interroge les cibles, reçoit les traps. - Moteur d'alertes : compare les valeurs aux seuils et déclenche des notifications. - Base de données : stocke les historiques pour les graphiques et l'analyse. - Interface : visualisation (tableaux de bord, graphiques, listes d'alertes).

7. Présentation des outils courants

OutilTypePoints fortsInconvénients
Nagios CoreOpen source, plutôt orienté pollingTrès stable, plugins nombreux, communauté activeConfiguration complexe, interface vieillissante
ZabbixOpen source, agent + SNMP + pollingTout-en-un, interface moderne, auto-discovery, très completCourbe d'apprentissage, lourd à maintenir
PRTGCommercial (freemium jusqu'à 100 capteurs)Interface intuitive, installation rapide, capteurs nombreuxLimité en version gratuite, coût élevé pour les grands parcs
Prometheus + GrafanaOpen source, orienté métriques (pull) et stockage TSDBTrès performant, écosystème cloud-native, dashboards magnifiquesNécessite des compétences, pas de gestion intégrée des traps SNMP
CheckmkOpen source / commercialÉvolution de Nagios, interface moderne, découverte automatiqueMoins connu, versions payantes pour les fonctionnalités avancées
ℹ️ Le choix dépend du périmètre (réseau, serveurs, applications cloud), des compétences de l'équipe et du budget.

8. Seuils, alertes et remontées

Une alerte est déclenchée lorsqu'une métrique franchit un seuil prédéfini. Pour être efficace, il faut définir des seuils adaptés et éviter les faux positifs.

NiveauSeuilAction typiqueExemple
INFOAvertissement préventifLog, tableau de bordOccupation disque > 70 %
WARNINGSeuil d'attentionEmail + SlackOccupation disque > 80 %
CRITICALIncident immédiatSMS, appel téléphonique, escaladeOccupation disque > 90 %
DOWNIndisponibilitéEscalade vers le support de niveau supérieurPing perdu sur un serveur critique
⚠️ Les faux positifs (alertes non justifiées) sont l'ennemi numéro 1 d'une supervision efficace. Ils fatiguent les équipes et peuvent faire passer à côté d'une vraie alerte. Ajustez les seuils, utilisez des fenêtres de maintenance et affinez les règles au fil du temps.
💡 Les seuils doivent être calibrés en fonction des pics normaux d'activité (ex: un serveur à 90 % CPU pendant une sauvegarde nocturne peut être normal). Utilisez des périodes de référence (baseline) pour affiner.

9. Bonnes pratiques pour une supervision efficace

Quel est le port UDP utilisé par SNMP pour les requêtes (polling) ?
  • 162
  • 161
  • 80
  • 443

✅ Réponse : 161

Quelle est la différence entre une supervision active et passive ?
  • Active utilise SNMP, passive utilise ICMP
  • Active interroge les cibles, passive attend des événements (traps)
  • Active est payante, passive est gratuite
  • Active surveille les serveurs, passive surveille les routeurs

✅ Réponse : Active interroge les cibles, passive attend des événements (traps)

Que signifie l'acronyme MIB dans le contexte SNMP ?
  • Management Information Base
  • Main Interface Board
  • Multipurpose Internet Browser
  • Monitoring Integration Block

✅ Réponse : Management Information Base

Parmi ces outils, lequel est une solution open source tout-en-un très complète ?
  • PRTG
  • Zabbix
  • Nagios Core seul
  • Prometheus seul

✅ Réponse : Zabbix

Quel type de métrique est le plus adapté pour détecter une future panne de disque ?
  • Le nombre de processus
  • Le taux d'erreur réseau
  • Le pourcentage d'occupation du disque et l'évolution de sa croissance
  • La version du système d'exploitation

✅ Réponse : Le pourcentage d'occupation du disque et l'évolution de sa croissance

Quel protocole est utilisé pour vérifier simplement qu'une machine est joignable ?
  • SNMP
  • HTTP
  • ICMP (ping)
  • WMI

✅ Réponse : ICMP (ping)

Quelle est l'utilité d'un seuil 'WARNING' par rapport à 'CRITICAL' ?
  • WARNING est plus grave que CRITICAL
  • WARNING est une alerte préventive, CRITICAL est une alerte d'incident immédiat
  • WARNING est réservé aux administrateurs, CRITICAL aux utilisateurs
  • Il n'y a pas de différence

✅ Réponse : WARNING est une alerte préventive, CRITICAL est une alerte d'incident immédiat

Quelle est la principale vulnérabilité de SNMPv2c ?
  • Il est trop lent
  • La communauté (mot de passe) circule en clair
  • Il ne fonctionne pas sur les switchs
  • Il utilise le port 443

✅ Réponse : La communauté (mot de passe) circule en clair

Que signifie 'polling' en supervision ?
  • Le superviseur attend que les équipements envoient des alertes
  • Le superviseur interroge régulièrement les équipements pour collecter des données
  • Le superviseur redémarre automatiquement les services
  • Le superviseur bloque les IP malveillantes

✅ Réponse : Le superviseur interroge régulièrement les équipements pour collecter des données

Pourquoi est-il important de réduire les faux positifs (bruit) dans un outil de supervision ?
  • Pour économiser de la bande passante
  • Pour éviter que les équipes ne désensibilisent et négligent les vraies alertes
  • Pour réduire le coût des licences
  • Pour accélérer l'interface utilisateur

✅ Réponse : Pour éviter que les équipes ne désensibilisent et négligent les vraies alertes

🎯 Passer l'évaluation de cette fiche