Google Cloud Observability inclut des services d'observabilité qui vous aident à comprendre le comportement, l'état et les performances de vos applications, y compris les applications agentiques. Comprendre le comportement des applications et la manière dont les composants se connectent vous aide à anticiper, identifier et gérer rapidement et efficacement les changements inattendus.
Ce document inclut les informations suivantes :
- Définitions de termes tels qu'observabilité, observabilité des agents et observabilité des applications et APM.
- Avantages des services d'observabilité pour le développement et la maintenance d'applications fiables.
- Comment Google Cloud Observability vous aide à surveiller et à maintenir l'état de l'application et de l'infrastructure.
- Étapes pour commencer à utiliser l'observabilité dans Google Cloud.
Observabilité
L'observabilité est une approche complète de la collecte et de l'analyse des données de télémétrie qui vous aide à comprendre l'état de vos applications, y compris les applications agentiques, et leur environnement d'exploitation. Les données de télémétrie incluent les données de journaux, les données de métriques et les données de trace. Elles peuvent également inclure d'autres données générées par vos applications, telles que des requêtes et des réponses. Les données de télémétrie fournissent les informations dont vous avez besoin pour comprendre l'état et les performances de vos applications.
- Données de métriques
- Les données de métriques sont des données numériques sur l'état ou les performances que le système mesure à intervalles réguliers, par exemple l'utilisation du processeur et la latence des requêtes. Les modifications inattendues apportées aux données de métriques peuvent indiquer un problème que vous devez examiner. Au fil du temps, vous pouvez également analyser les tendances pour comprendre les schémas d'utilisation et anticiper les besoins en ressources.
- Données des journaux
Un journal est un enregistrement généré de l'activité du système ou de l'application au fil du temps. Chaque journal est un ensemble d'entrées de journal horodatées, et chaque entrée de journal décrit un événement spécifique.
Les données des journaux contiennent souvent des informations enrichies et détaillées qui vous aident à comprendre ce qui s'est passé dans une partie spécifique de votre application. Toutefois, les données des journaux ne montrent pas efficacement comment une modification apportée à un composant d'application est liée à l'activité d'autres composants. Les données de trace peuvent combler ce fossé.
- Données de trace
Une trace représente le chemin d'une requête entre les composants de votre application distribuée. Autrement dit, chaque trace représente une seule opération de bout en bout. Comme les traces sont composées de segments, qui sont des enregistrements pour une seule fonction ou opération, elles vous permettent de suivre le flux des requêtes et d'examiner les données de latence. Ces informations peuvent vous aider à identifier la cause première d'un problème.
Pour les applications agentiques, les traces capturent les actions effectuées par votre agent. Par exemple, une trace peut capturer des appels MCP.
- Other data
Vous pouvez obtenir des insights supplémentaires en analysant les données des journaux, les données de métriques et les données de trace, ainsi que d'autres informations pertinentes. Par exemple, un libellé indiquant la gravité d'un incident ou un ID client dans les données des journaux fournit un contexte utile pour le dépannage et le débogage.
Observabilité des agents
L'observabilité des agents fait référence à des méthodes permettant de comprendre l'état interne et le comportement des agents logiciels, en particulier les agents basés sur l'IA créés à l'aide de grands modèles de langage (LLM). Les agents IA sont non déterministes et complexes. Par conséquent, l'observabilité est essentielle pour comprendre, déboguer, évaluer et améliorer leurs performances, leur sécurité et leur fiabilité.
Google Cloud offre une prise en charge de l'observabilité des applications avec la surveillance des applications, qui crée des tableaux de bord affichant des données de télémétrie des données, des données de métriques de ressources d'IA et des informations telles que les incidents ouverts. Pour en savoir plus, consultez la section Observabilité des agents et des applications Google Cloud de ce document.
Observabilité des applications et APM
La gestion des performances des applications (APM) surveille, diagnostique et gère les performances, la disponibilité et l'expérience utilisateur des applications logicielles, y compris les applications agentiques. Un système APM fournit généralement des tableaux de bord affichant des données de télémétrie et des services qui surveillent ces données. Ces systèmes vous aident à identifier les échecs.
L'observabilité des applications utilise des données de télémétrie pour générer des insights qui vous aident à comprendre le comportement de vos applications.
Google Cloud offre une prise en charge de l'observabilité des applications avec la surveillance des applications, qui crée des tableaux de bord affichant des données de télémétrie des données, des données de métriques de ressources d'IA et des informations telles que les incidents ouverts. Pour en savoir plus, consultez la section Observabilité des agents et des applications Google Cloud de ce document.
Services d'observabilité
Les services d'observabilité collectent, analysent et mettent en corrélation des données de télémétrie, telles que des données de journaux, des données de métriques et des données de trace. Ils offrent les fonctionnalités suivantes pour vous aider à maintenir la fiabilité des applications :
- Détecter les problèmes de manière proactive avant qu'ils n'affectent les utilisateurs.
- Résoudre les problèmes connus et nouveaux.
- Déboguer les applications pendant le développement.
- Comprendre l'impact des modifications apportées à vos applications.
- Découvrir de nouveaux insights grâce à l'exploration des données.
Pour en savoir plus sur les pratiques de fiabilité, y compris les principes et les pratiques d'observabilité, consultez l'ouvrage Site Reliability Engineering: How Google Runs Production Systems. Vous y trouverez des informations sur la surveillance des systèmes distribués, les alertes et le dépannage.
Google Cloud Observability
Les services de Google Cloud Observability vous aident à collecter, analyser et mettre en corrélation des données de télémétrie, à la fois à partir de vos applications et de l'infrastructure sous-jacente. Ces services fournissent également des valeurs par défaut intégrées pour vous aider à démarrer. Par exemple,