Accéder aux métriques

Ce document explique comment accéder aux métriques générées par votre application Gemini Enterprise. Ces métriques fournissent des insights sur les performances et l'état de votre application.

Vous pouvez afficher la télémétrie des métriques à l'aide de l'explorateur de métriques ou directement dans des agents individuels à l'aide de l'onglet Observabilité de l'agent.

Concepts clés

Cette section présente les concepts clés liés à l'observabilité dans Gemini Enterprise.

Concept Description
Métriques Les métriques sont des mesures numériques que les systèmes collectent au fil du temps. Ces mesures représentent les performances, l'utilisation des ressources ou le comportement d'un système. Les ingénieurs utilisent les métriques pour surveiller l'état du système, identifier les tendances et déclencher des alertes.
Métriques de portée agent Métriques qui mesurent l'activité d'un agent individuel, comme ses sessions, ses tours de conversation et ses appels d'outils. Elles sont listées sous le type de ressource Gemini Enterprise Agent et ne sont collectées que lorsque le paramètre d'observabilité Activer l'instrumentation des traces et des journaux OpenTelemetry est activé pour cet agent.
Métriques de portée application Métriques qui mesurent l'ensemble du trafic vers une application plutôt que vers un seul agent, comme le nombre de requêtes et la latence de bout en bout. Elles sont listées sous le type de ressource Gemini Enterprise Engine, où Engine est le nom de l'API d'une application Gemini Enterprise, et sont collectées quels que soient les paramètres d'observabilité.

Avant de commencer

Assurez-vous de disposer des éléments suivants :

  • Le rôle Administrateur Gemini Enterprise ou le rôle Utilisateur Gemini Enterprise de la Google Cloud console.

  • Une application Web Gemini Enterprise existante. Pour en savoir plus sur la création d'une nouvelle application, consultez Créer une application.

  • Pour accéder à l'explorateur de métriques, vous devez disposer du rôle Lecteur Monitoring (roles/monitoring.viewer).

  • Activez le paramètre d'observabilité Activer l'instrumentation des traces et des journaux OpenTelemetry. Selon le type d'agent, activez-le dans les configurations au niveau de l'application (pour l'agent Assistant principal) ou dans l'onglet Configuration de l'agent (pour les agents créés par les employés de Workflow Builder et les agents de recherche approfondie). Pour en savoir plus, consultez Gérer les paramètres d'observabilité. Ce paramètre est requis pour les métriques de portée agent. Les métriques de portée application, qui sont listées sous le type de ressource Gemini Enterprise Engine, sont collectées sans ce paramètre.

Conservation des données

Les métriques générées par votre application Gemini Enterprise sont stockées dans Cloud Monitoring dans votre Google Cloud projet, et leur conservation est régie par Cloud Monitoring. Les métriques Gemini Enterprise sont publiées sous le discoveryengine.googleapis.com/ préfixe, qui appartient au niveau "Toutes les autres Google Cloud métriques" et est conservé pendant six semaines par défaut. Les données antérieures à la période de conservation sont automatiquement supprimées. Pour obtenir les valeurs de conservation faisant autorité et les plus récentes, consultez Conservation des données dans la documentation Quotas et limites de Cloud Monitoring.

Accéder aux métriques dans l'explorateur de métriques

Pour accéder aux métriques, procédez comme suit :

  1. Dans la Google Cloud console, accédez à la page Explorateur de métriques.

    Accéder à l'explorateur de métriques

  2. Sélectionnez le Google Cloud projet dans lequel votre application Gemini Enterprise a été créée.

  3. Cliquez sur Sélectionner une métrique pour ouvrir une barre de recherche.

  4. Dans la barre de recherche, recherchez les métriques suivantes :

    Nom de la métrique Description
    Gemini Enterprise Agent - Gemini Enterprise Agent Session Count Nombre de sessions gérées par l'agent Gemini Enterprise.
    Gemini Enterprise Agent - Gemini Enterprise Agent Tool Count Nombre de fois où les outils ont été appelés par l'agent Gemini Enterprise.
    Gemini Enterprise Agent - Gemini Enterprise Agent Turn Count Nombre de tours de conversation dans les sessions de l'agent Gemini Enterprise.
    Gemini Enterprise Agent - Gemini Enterprise Agent Total Latency Latence totale des réponses de l'agent Gemini Enterprise.
    Gemini Enterprise Agent - Gemini Enterprise Agent Tool Total Latency Latence totale générée par les exécutions d'outils dans l' agent Gemini Enterprise.
    Gemini Enterprise DataConnector - Gemini Enterprise DataConnector Request Count Nombre total de requêtes adressées aux connecteurs de données Gemini Enterprise (également appelés datastores dans la Google Cloud console).
    Gemini Enterprise DataConnector - Gemini Enterprise DataConnector Request Latencies (Bêta) Latence des requêtes adressées aux connecteurs de données Gemini Enterprise (également appelés datastores dans la Google Cloud console) en millisecondes.
    Gemini Enterprise Engine - Gemini Enterprise Engine Request Count Nombre total de requêtes reçues par votre application Gemini Enterprise, pour l'ensemble du trafic vers l'application plutôt que vers un seul agent. Répartition par méthode d'API, code de réponse gRPC canonique, classe de code de réponse, type de requête et modèle.
    Gemini Enterprise Engine - Gemini Enterprise Engine Request Total Latency Distribution de la latence des requêtes de bout en bout pour votre application Gemini Enterprise. Enregistrée pour chaque requête, y compris celles qui renvoient une erreur.
    Gemini Enterprise Engine - Gemini Enterprise Engine Time to First Answer Latency Distribution de la latence entre la réception d'une requête et la diffusion du premier jeton de réponse. Enregistrée uniquement pour les requêtes qui produisent au moins un jeton de réponse.
    Gemini Enterprise Engine - Gemini Enterprise Engine Time to First Token Latency Distribution de la latence entre la réception d'une requête et la diffusion du premier jeton, que ce jeton fasse partie du processus de réflexion du modèle ou d'une réponse finale. Enregistrée uniquement pour les requêtes qui produisent au moins un jeton diffusé.
  5. Sélectionnez la métrique que vous souhaitez explorer, puis cliquez sur Appliquer.

  6. Vous pouvez également définir des filtres de libellés supplémentaires, des éléments d'agrégation et ajuster la plage de dates.

    Capture d'écran de l'explorateur de métriques dans la console Google Cloud , montrant les métriques de l'agent Gemini Enterprise.

Accéder aux métriques des agents

Vous pouvez également afficher des tableaux de bord de métriques opérationnelles, spécifiques aux outils et de session directement pour des agents individuels dans l'onglet Observabilité de l'agent dans la Google Cloud console.

Pour accéder aux métriques d'un agent :

  1. Dans la Google Cloud console, accédez à votre application, puis cliquez sur Agents.
  2. Sélectionnez l'agent que vous souhaitez inspecter, puis cliquez sur l'onglet Observabilité.

L'onglet Observabilité fournit des données de télémétrie opérationnelles clés divisées en quatre vues : Présentation, Outils, Latence et Taux d'erreur.

Métriques générales

Cette vue fournit un tableau de bord récapitulatif des données standards sur l'état des sessions et des agents, qui inclut les éléments suivants :

  • Sessions : nombre total de sessions utilisateur.
  • Temps moyen par session : temps moyen écoulé pendant une session.
  • Appels d'agent : nombre total d'appels de l'agent.
  • Latence de l'agent : latence au fil du temps et métriques spécifiques.
  • Trafic de l'agent : volume de requêtes entrantes.
  • Taux d'erreur de l'agent : pourcentage d'appels d'agent ayant échoué.

Capture d'écran de la vue "Présentation" de l'onglet "Observabilité" dans la console Google Cloud , montrant les sessions, le nombre moyen de tours par session, les invocations d'agent, la latence, le trafic et le taux d'erreur

Métriques des outils

Cette vue se concentre spécifiquement sur l'utilisation et la latence des outils connectés à votre agent, y compris les éléments suivants :

  • Nombre total d'appels : nombre de requêtes d'exécution d'outils.
  • Durée P95 par outil : 95e centile de latence des exécutions, classé par outil.
  • Nombre d'appels par outil : nombre total d'appels répartis entre différents outils.
  • Taux d'erreur par outil : taux d'échec des exécutions par outil.
  • Taux"Aucun outil appelé" : taux auquel les interactions n'ont déclenché aucune exécution d'outil.

Statistiques relatives à la latence

Cette vue affiche la latence de réponse de votre agent. Chaque métrique est affichée sous forme de fiche récapitulative p50 et p95 pour la plage de dates sélectionnée, ainsi que sous forme de graphique de série temporelle montrant les tendances au fil du temps. Vous pouvez également filtrer les métriques de latence par fonctionnalité. La vue affiche les métriques suivantes :

  • Délai avant le premier jeton (TTFT) : latence entre la réception d'une requête et la diffusion du premier jeton, que ce jeton fasse partie du processus de réflexion du modèle ou de la réponse.
  • Délai avant la première réponse (TTFA) : latence entre la réception d'une requête et la diffusion du premier jeton de réponse, qui est le premier jeton ne faisant pas partie de la réflexion du modèle. Si l'agent appelle un outil après avoir commencé à répondre, la mesure redémarre. Ainsi, le TTFA reflète le moment où la réponse que l'utilisateur lit a commencé à être diffusée, et non une narration intermédiaire.
  • Délai avant le dernier jeton (TTLT) : latence entre la réception d’une requête et la diffusion du dernier jeton, qui correspond au moment où la réponse est terminée.

Filtrer les métriques de latence par fonctionnalité

Une fonctionnalité est le type d'interaction qu'un tour représente, comme une recherche sur le Web ou une génération d'image. Filtrez les métriques de latence par fonctionnalité pour voir quels types d'interaction sont les plus lents et pour éviter qu'une fonctionnalité lente ne fausse votre latence globale.

Pour filtrer les métriques de latence par fonctionnalité :

  1. Dans l'onglet Observabilité de l'agent, cliquez sur la vue Latence.
  2. Cliquez sur Filtrer par fonctionnalité.
  3. Sélectionnez la fonctionnalité que vous souhaitez inspecter.

Les fiches récapitulatives et les graphiques de séries temporelles n'affichent alors que les tours de cette fonctionnalité.

Pour comparer toutes les fonctionnalités à la fois, utilisez le tableau Télémétrie des fonctionnalités , qui liste les éléments suivants pour chaque fonctionnalité :

  • Part du trafic : pourcentage de tours attribués à la fonctionnalité.
  • TTFT, TTFA et TTLT : latence p50 et p95 pour la fonctionnalité.

Vous pouvez filtrer à l'aide des fonctionnalités suivantes :

  • Paramétrique : interactions qui envoient des requêtes au modèle pour une sortie textuelle uniquement, sans outils, comme les tâches de traduction.
  • Génération de contenus multimédias : tâches de génération d'images et de vidéos.
  • Recherche sur le Web uniquement : interactions qui envoient des requêtes au modèle à l'aide de l'outil de recherche sur le Web.
  • Analyse des fichiers importés : interactions qui envoient des requêtes au modèle en plus des fichiers importés par l'utilisateur.
  • Connecteur : requêtes qui envoient des requêtes à des connecteurs internes ou tiers.
  • Canvas : tâches de génération qui utilisent Canvas.
  • Compétence : interactions qui appellent une compétence.
  • Autre : fourre-tout pour les tours qui couvrent plusieurs fonctionnalités ou qui ne sont pas encore classés.

Capture d'écran de la vue "Latence" de l'onglet "Observabilité" dans la console Google Cloud , montrant le filtre de fonctionnalités, les cartes récapitulatives p50 et p95, les graphiques de séries temporelles pour le temps avant le premier jeton, le temps avant la première réponse et le temps avant le dernier jeton, ainsi que le tableau de télémétrie des fonctionnalités listant chaque fonctionnalité avec sa part de trafic et ses latences p50 et p95

Métriques du taux d'erreur

Cette vue montre comment les requêtes de votre agent sont résolues, regroupées par classe de réponse : OK (2xx), Erreurs client (4xx), Erreurs serveur (5xx) et Annulé. La plate-forme inclut :

  • Volume de requêtes par classe de réponse : nombre de requêtes entrantes au fil du temps, empilées par classe de réponse.
  • Taux d'erreur par classe de réponse : pourcentage de requêtes ayant échoué au fil du temps, divisé par classe de réponse.
  • Codes d'erreur client (4xx) et Codes d'erreur serveur (5xx) : codes de réponse gRPC canoniques individuels au fil du temps, tels que INVALID_ARGUMENT ou INTERNAL, afin que vous puissiez identifier les erreurs spécifiques qui entraînent un pic.
  • Totaux : nombre de requêtes et pourcentage du nombre total de requêtes pour chaque résultat sur la plage de dates sélectionnée, avec des tableaux distincts qui classent les codes d'erreur client et serveur individuels.

Capture d'écran de la vue "Taux d'erreur" de l'onglet "Observabilité" dans la console Google Cloud , montrant le volume de requêtes et le taux d'erreur par classe de réponse, les graphiques de série temporelle pour les codes d'erreur client et serveur, et les tableaux des totaux

Étape suivante