Aller au contenu

RÉALISATION · OBSERVABILITÉ · FINOPS

Audit Datadog : optimiser les coûts sans perdre la maîtrise de l’observabilité

Un système d’information se transforme vers AWS. Comment faire évoluer la supervision sans multiplier les coûts ni créer de nouveaux angles morts ?

5 min de lecture · Avec Peter, consultant DevOps chez ADN Consulting
DatadogAWSKubernetesAPMFinOps

LE PROJET EN UN COUP D’ŒIL

Pourquoi réexaminer une plateforme déjà en place ?

Contexte

Un système d’information hybride, en migration progressive vers AWS, supervisé avec Datadog depuis plus de deux ans.

Enjeu

Rationaliser les consommations tout en améliorant la visibilité, la détection des incidents et le diagnostic.

Démarche

Audit des usages, analyse des leviers d’optimisation et feuille de route technique et financière.

Vigilance

Ne pas supprimer, au nom des économies, la télémétrie nécessaire aux investigations.

Datadog était déjà utilisé dans le système d’information depuis plusieurs années. Mais l’arrivée progressive d’infrastructures AWS, de services managés et de conteneurs change la nature des données à observer. La question ne se limite plus à savoir si une métrique remonte : elle est de comprendre si les équipes peuvent détecter puis diagnostiquer une dégradation suffisamment vite, pour un coût maîtrisé.

Peter intervient dans cette démarche d’expertise Datadog. Le périmètre porte sur les usages, les coûts, la qualité de la supervision et la préparation des futures migrations cloud.

01 · LE DIAGNOSTIC

Repartir de la télémétrie, pas des dashboards

Un tableau de bord complet ne garantit pas une investigation efficace. L'audit doit vérifier que les métriques, les logs et les traces APM sont exploitables ensemble. Une API peut ralentir sans consommation CPU excessive : les traces peuvent alors orienter l’enquête vers une dépendance ou une requête de base de données. Ce scénario est un exemple technique illustratif, non un incident client documenté.

La valeur de l’observabilité se mesure à la capacité à relier le symptôme à une hypothèse technique exploitable.

02 · L’ARBITRAGE TECHNIQUE

Comprendre les coûts avant de réduire les données

La consommation Datadog ne se résume pas à un seul compteur. L’analyse porte sur les métriques personnalisées, la volumétrie des logs, leur indexation, les environnements conteneurisés, le suivi des bases de données, l’APM et les tests synthétiques.

La cardinalité : un coût parfois discret

Les tags service, env et region servent à isoler les comportements. En revanche, ajouter une dimension très volatile comme un identifiant de requête unique peut multiplier les séries temporelles sans améliorer le diagnostic. En environnement Kubernetes, les identifiants éphémères doivent être examinés au regard de leur véritable utilité.

Les logs : collecter n’est pas forcément indexer

Les règles d’indexation, les pipelines et la durée de conservation méritent une revue par usage. Les événements nécessaires aux enquêtes doivent rester accessibles selon une politique explicite. Exclure de l’indexation sans autre stratégie de conservation pourrait simplement déplacer le problème.

Le choix à instruire : préserver la granularité utile au diagnostic, tout en limitant la collecte et l’indexation sans valeur opérationnelle.

03 · L’ARCHITECTURE

Superviser des services plutôt que des serveurs

Une migration AWS s’accompagne de ressources mouvantes. Un pod Kubernetes qui redémarre n’est pas systématiquement un incident ; ce qui compte est son effet sur la disponibilité du service et l’expérience applicative. La corrélation des signaux CloudWatch, des événements Kubernetes, des traces APM et des logs doit donc rester lisible au niveau d’un service.

L’harmonisation des tags env, service et version facilite les recherches transverses. Les approches SLI/SLO permettent, elles, de faire évoluer les alertes de simples seuils techniques vers des indicateurs de qualité de service.

Les capacités de détection automatique de Watchdog peuvent compléter ces moniteurs. Elles ne remplacent pas les alertes déterministes indispensables sur les services critiques.

04 · LA FEUILLE DE ROUTE

Transformer l’audit en décisions actionnables

La mission prévoit un état des lieux technique, des recommandations financières, une estimation des efforts et une restitution structurée pour la direction. Les chantiers doivent être hiérarchisés selon le gain potentiel, le risque opérationnel et la complexité de déploiement.

À court terme : identifier les consommations les plus importantes, les métriques à forte cardinalité et les moniteurs peu pertinents. À moyen terme : harmoniser les tags, renforcer les corrélations et les dashboards de services. Sur la durée : accompagner les migrations AWS et l’autonomie des équipes d’exploitation.

Les résultats chiffrés de mise en œuvre ne sont pas publiés ici : ils n’ont pas encore été confirmés par l’expert intervenant.

LE REGARD DE L’EXPERT

Trois enseignements à retenir

Une donnée collectée n’est pas toujours une donnée utile

L'intérêt d'une métrique tient à la décision ou au diagnostic qu’elle permet, pas uniquement à sa disponibilité.

La facture reflète plusieurs modes de consommation

Logs ingérés et indexés, métriques à forte cardinalité, conteneurs, APM et tests synthétiques doivent être examinés séparément.

L’observabilité doit suivre les services

En cloud hybride, l’enjeu est de relier un symptôme d’infrastructure à la disponibilité et à la performance applicatives.

Peter · Consultant DevOps ADN Consulting

Cette expérience montre qu’une plateforme d’observabilité n’est pas seulement un outil de collecte. Son intérêt dépend des conventions d’instrumentation, de la qualité des signaux, des arbitrages économiques et de la capacité des équipes à les exploiter.

QUESTIONS FRÉQUENTES

Approfondir l’audit Datadog

Comment conduire un audit Datadog ?

En confrontant les usages réels de Datadog, les volumes facturables, la couverture des services et les scénarios de diagnostic. Le résultat attendu est une feuille de route priorisée.

Comment optimiser les coûts Datadog sans perdre en visibilité ?

En analysant d’abord la cardinalité des métriques, l’indexation des logs, l’instrumentation APM et les fonctionnalités sous-utilisées, puis en évaluant les risques de chaque changement.

Pourquoi harmoniser les tags AWS et Kubernetes ?

Des conventions communes comme env, service et version permettent de corréler métriques, traces et logs malgré le renouvellement des ressources.

Watchdog remplace-t-il les moniteurs classiques ?

Non. La détection automatique d’anomalies complète les seuils explicites et les alertes basées sur les objectifs de service.