Une observabilité complète maintient votre widget fiable. Le suivi des erreurs capture les exceptions avec un contexte complet. Le suivi des performances suit TTFB, FCP et les temps de rendu. Les vérifications de santé permettent de surveiller le temps de disponibilité. Les règles d'alerte notifient les ingénieurs de garde. La page d'état informe les clients.
La fiabilité nécessite de la visibilité. Vous ne pouvez pas réparer ce que vous ne pouvez pas voir. Notre infrastructure de suivi et d'alerte fournit une observabilité complète sur la santé, la performance, les erreurs et l'expérience utilisateur du widget — permettant une détection proactive des incidents et une réponse rapide.
Chaque exception est capturée, enrichie de contexte et transmise aux services de suivi des erreurs (Sentry, Rollbar, Bugsnag, Application Insights). Les données capturées incluent :
Les métriques clés suivies par percentile (p50, p75, p90, p95, p99) :
Les métriques p95/p99 garantissent que les cas limites affectant de petits pourcentages d'utilisateurs sont traités.
Définissez des seuils de performance acceptables :
Le suivi alerte lorsque la performance réelle viole les budgets.
Seuils pour des événements exploitables :
Les alertes passent par des systèmes de garde (PagerDuty, Opsgenie) avec des politiques d'escalade et des runbooks attachés.
/health — retourne 200 OK si le service est opérationnel/health/deep — vérifie la connectivité de la base de données, l'accès à la base de connaissances et la disponibilité du service IALes vérifications de santé s'exécutent toutes les 30-60 secondes depuis plusieurs régions géographiques. La conformité SLA est suivie automatiquement.
Des modèles d'apprentissage automatique détectent des modèles inhabituels :