Le monitoring n'est pas un outil, c'est trois questions : qu'est-ce qui s'est passé (logs), comment se porte le système (métriques), et suis-je prévenu quand ça va mal (alertes) ?
Un console.log en texte libre est illisible dès que le volume monte. Un log structuré (JSON) se filtre, se cherche et s'agrège — tu retrouves toutes les erreurs d'un user en une requête.
Pour un agent IA, la même logique donne le traçage : chaque étape visible et cherchable, comme dans tracer et scorer un agent.
Une alerte qui se déclenche trop souvent finit ignorée — c'est la fatigue d'alerte, et c'est pire que pas d'alerte du tout. On alerte sur des symptômes qui comptent pour l'utilisateur, pas sur chaque soubresaut technique.
Le % de requêtes en 5xx dépasse un seuil : quelque chose est cassé, maintenant.
Le p95 explose : l'app rame pour une part réelle des utilisateurs.
Un ping depuis l'extérieur toutes les minutes : le site répond-il vraiment ?
Disque plein, connexions DB au max : les pannes annoncées, à prévenir avant le crash.
Ne monitore pas tout d'un coup. Un uptime check et une alerte sur le taux d'erreur couvrent déjà l'essentiel des pannes réelles.