Consultez l'activité CPU, réseau et disque de vos serveurs sous forme de graphiques, et soyez averti lorsqu'une valeur dépasse une limite trop longtemps. Cette fonctionnalité s'adresse à toute personne surveillant l'état des serveurs sans avoir besoin d'être un expert en supervision.
Vue d'ensemble
- InfraNest collecte automatiquement les métriques CPU, réseau et disque de chaque serveur et les affiche sous forme de graphiques.
- Vous pouvez définir des règles d'alerte pour qu'InfraNest vous informe lorsqu'une métrique reste trop élevée trop longtemps.
- La mémoire, l'espace disque et la charge moyenne nécessitent l'installation de l'agent serveur, car votre fournisseur ne les communique pas.
- Lorsqu'un service sur le serveur échoue, InfraNest vous explique pourquoi en termes simples, sans jamais lire vos journaux.
Consulter les métriques
- Allez dans Moniteurs pour voir tous les serveurs d'un coup d'œil.
- Ouvrez un serveur pour voir sa propre page de surveillance, avec des graphiques en direct du CPU, du réseau entrant/sortant et de la lecture/écriture disque, ainsi que l'espace disque et ce qui est en cours d'exécution.
NoteUn serveur doit avoir la surveillance activée avant que quoi que ce soit ne soit collecté à son sujet. En attendant, il est répertorié mais aucune donnée ne s'affiche.
La mémoire, l'espace disque et la charge moyenne ne sont pas affichés par défaut — l'API de votre fournisseur ne les communique pas. Ils n'existent que sur le serveur lui-même, donc les règles portant sur ces métriques restent grisées jusqu'à l'installation de l'agent.
D'où viennent les règles d'alerte
La plupart des règles sont définies une seule fois pour toute votre organisation sous Alert defaults, et chaque serveur les hérite. Dans la liste d'alertes d'un serveur, elles apparaissent comme Par défaut de l'org.
Si un serveur a besoin de valeurs différentes — une machine de build censée chauffer, par exemple — modifiez la règle à cet endroit et elle devient Remplacé ici, n'affectant que ce serveur. Utilisez Réinitialiser pour revenir à la règle de l'organisation. Vous pouvez aussi ajouter une règle qui n'existe que sur un seul serveur et nulle part ailleurs.
Désactiver une règle d'organisation la désactive partout, y compris sur les serveurs qui l'avaient personnalisée.
Configurer une alerte
- Sur la page de surveillance du serveur, ouvrez Règles d'alerte et sélectionnez Ajouter une alerte métrique.
- Choisissez la Métrique (CPU, réseau entrant/sortant, ou lecture/écriture disque), un seuil, et la durée pendant laquelle le dépassement doit persister.
- Sélectionnez Enregistrer.
La durée correspond à la fenêtre sur laquelle InfraNest calcule une moyenne, et non à un chronomètre. Il prend la moyenne de la métrique sur ces minutes et n'alerte que si cette moyenne dépasse votre limite — ainsi, un pic d'une minute dû à une sauvegarde ou une tâche planifiée ne déclenchera rien, tandis qu'une charge véritablement soutenue le fera. Lorsqu'elle se déclenche, elle ouvre un incident et notifie vos destinations d'alerte.
Une fois qu'une alerte s'est déclenchée, la métrique doit redescendre clairement sous votre limite (environ 10 % en dessous) avant d'être considérée comme rétablie. Cela évite qu'une valeur oscillant juste autour du seuil ne déclenche et ne se rétablisse en boucle.
Ce que vous recevrez
Vous recevez au maximum deux messages par alerte :
- Au déclenchement — la valeur actuelle, la limite que vous avez définie, et depuis combien de temps elle est dépassée.
- Au retour à la normale — un message de fin d'alerte indiquant combien de temps la valeur est restée au-dessus de la limite. Aucune action n'est requise ; il clôture simplement le premier message.
Si un pic est trop court pour déclencher l'alerte, vous ne recevez rien du tout — pas même un message de fin d'alerte, puisqu'il n'y avait aucune alerte à clôturer. L'incident se résout automatiquement lorsque la métrique se rétablit.
NoteCes incidents figurent aux côtés de vos incidents de surveillance de disponibilité, afin que l'état des serveurs et la disponibilité des services soient regroupés au même endroit.
Si vous installez l'agent
Rien ne change ici — les seuils, durées, comportement de rétablissement, incidents et notifications fonctionnent tous de la même manière. Vous obtenez simplement davantage de métriques sur lesquelles définir des règles, une lecture chaque minute au lieu de chaque cinq minutes, et la possibilité de créer une alerte pour un serveur qui cesse complètement d'envoyer des données.
Supprimer le dernier token d'agent fait immédiatement basculer le serveur sur les métriques du fournisseur. InfraNest vous informe lorsque cela se produit, car les règles que seul l'agent peut mesurer cessent alors d'être mesurées.
Lorsqu'un service échoue, nous vous disons pourquoi
Si vous avez installé l'agent, l'onglet Services répertorie ce qui est configuré pour s'exécuter sur la machine, en plaçant tout ce qui a échoué en haut de la liste.
Un service en échec affiche pourquoi il a échoué, en termes simples, à côté de son nom :
| Ce que vous voyez | Ce qui s'est passé |
|---|---|
| À court de mémoire | Le système l'a arrêté pour libérer de la mémoire. Généralement, la machine est trop petite pour ce qui y tourne, ou le service a une fuite mémoire. |
| Arrêté sur une erreur | Il s'est terminé sur sa propre erreur. Le code d'erreur est affiché à côté. |
| A mis trop de temps et a été arrêté | Il n'a pas terminé son démarrage ou son arrêt dans le temps qui lui était accordé. |
| A échoué trop souvent pour réessayer | Il n'a cessé de redémarrer et a abandonné. Quelque chose ne va pas qu'un redémarrage ne corrige pas. |
| Ne répondait plus | Il a cessé de se signaler, il a donc été redémarré. |
| A planté | Il s'est arrêté de manière inattendue et a laissé un fichier de plantage. |
| N'a pas pu obtenir ce qu'il fallait pour démarrer | Quelque chose dont il dépend était manquant — un fichier, un port, un périphérique. |
Cela suffit généralement pour savoir quoi faire ensuite : « à court de mémoire » pointe vers la taille du serveur, « n'a pas pu obtenir ce qu'il fallait pour démarrer » pointe vers la configuration.
Pourquoi nous n'affichons pas le journal du service
InfraNest ne transmet volontairement pas les sorties de journal de vos services dans le système, et n'a pas l'intention de le faire.
Les journaux contiennent régulièrement des mots de passe et des clés d'accès — une chaîne de connexion à une base de données dans une erreur de démarrage, un jeton dans une requête échouée. Les copier depuis votre serveur vers InfraNest exposerait vos identifiants là où ils n'ont pas besoin d'être, et aucun filtrage ne peut distinguer de manière fiable un secret d'un texte ordinaire dans la sortie d'un programme quelconque.
La raison de l'échec affichée dans l'onglet Services répond à la question que le journal aurait répondue, sans que rien ne quitte votre machine.
Pour lire le journal lui-même, utilisez la machine à laquelle vous faites déjà confiance : connectez-vous en SSH et exécutez
journalctl -u name-of-the-service --since "1 hour ago"
Le nom du service affiché dans l'onglet Services est exactement ce qui suit -u.
Dépannage
- Une règle reste grisée — cette métrique nécessite l'agent installé sur le serveur ; les métriques du fournisseur seules ne peuvent pas la mesurer.
- Aucune alerte déclenchée pour un pic visible sur le graphique — le pic était probablement plus court que la durée que vous avez définie, donc sa moyenne n'a jamais dépassé votre seuil.
- Vous n'avez pas reçu de message de fin d'alerte — cela signifie qu'aucune alerte ne s'est jamais déclenchée pour cette baisse, il n'y avait donc rien à clôturer.
Cet article vous a-t-il été utile ?