Chaque AI Server héberge un tableau de bord accessible à l'adresse <code>/dashboard</code> pour les humains, expose les mêmes données sous forme de JSON agrégé, et fournit des métriques Prometheus natives pour les alertes <a href="#ref-1">[1]</a>. Les synthèses d'utilisation se décomposent par clé, application, modèle ou worker ; le statut du pool de workers est interrogeable pour l'automatisation de la ferme ; et les sondes de l'orchestrateur couvrent la vivacité et la disponibilité. Tout est intégré, il s'agit donc de bien l'utiliser plutôt que de l'installer.

Détecter les problèmes avant les utilisateurs

Le tableau de bord affiche la santé de chaque worker, le taux d'erreur, la latence p95 et la saturation, de sorte qu'un worker en PANNE ou une dérive de latence est visible avant d'affecter un utilisateur <a href="#ref-2">[2]</a>. Pour les alertes, récupérez le point de terminaison Prometheus et commencez avec trois règles : un seuil de taux d'erreur, un p95 qui dépasse deux fois sa valeur de base pendant dix minutes, et une ferme dont le nombre de workers sains est inférieur au total pendant cinq minutes.

Refacturation sans sidecar de mesure

L'audit sans contenu attribue chaque requête à son application et installation, et dans une ferme au worker qui sert, ce qui constitue des données natives de refacturation par équipe et par application <a href="#ref-1">[1]</a>. Une requête d'utilisation sur une plage de dates, groupée par application, retourne les requêtes, tokens et erreurs par application ; groupée par worker, elle répartit le coût sur le matériel de la ferme ; groupée par clé, elle rapporte par identifiant. La tarification par modèle peut être configurée côté serveur afin que les synthèses incluent des estimations de coût.

Des chiffres qui résistent à la due diligence

Le tableau de bord est prêt pour un projecteur et sa légende s'explique d'elle-même aux non-ingénieurs, ainsi une démonstration en direct sous charge remplace les présentations : lancez un chat et observez les requêtes par seconde, mettez un worker hors service et regardez la bascule, puis montrez la vue par application comme image de la refacturation <a href="#ref-1">[1]</a>. Chaque chiffre est reproductible à partir de ces recettes de déploiement, ce qui permet à une affirmation de résister à la diligence raisonnable de l'acheteur.