On surveillait les sites de nos clients avec les outils du marché, puis avec notre propre moteur. Un matin, 47 alertes dans la boîte. On les a ouvertes une par une : 43 ne correspondaient à rien du tout.
La cause était chez nous, et elle était bête. Nos sondes interrogeaient les mêmes serveurs trop vite, les fichiers répondaient « trop de requêtes », et le moteur lisait cette réponse comme un fichier disparu. Il annonçait donc des mises en page cassées sur des sites parfaitement intacts.
Un outil qui crie au loup finit dans une règle de filtrage de la boîte mail. Et un outil filtré ne surveille plus rien : c'est pire que pas d'outil, parce qu'on croit être couvert.
On a repris le moteur de décision à zéro. Un problème d'apparence ne peut plus être annoncé comme une panne. Les pannes qui partagent une adresse IP deviennent une seule alerte. Rien ne part avant confirmation. Et chaque règle de décision a désormais sa propre suite de tests.
Le récit complet, avec le détail de ce qui était faux et des quatre corrections : 47 alertes un matin, 43 étaient fausses.