Ce document fournit une architecture générale pour la mise en œuvre de workflows d'analyse inter-cloud qui utilisent des agents IA. Il est destiné aux architectes cloud, aux ingénieurs de données et aux data scientists qui souhaitent utiliser l'IA agentique pour les workflows d'analyse dans des lacs de données multiclouds, des entrepôts de données structurées et des datastores non structurés. Ce document part du principe que vous possédez des connaissances de base sur les concepts d'IA agentique, l'analyse de données et l'architecture cloud.
La section Déploiement de ce document fournit un atelier de programmation que vous pouvez utiliser pour découvrir comment créer une solution d'analyse agentique.
Architecture
Le schéma suivant illustre une architecture pour une solution d'analyse agentique qui génère des insights commerciaux à partir de données structurées et non structurées distribuées sur plusieurs datastores et fournisseurs de services cloud.
Les composants de cette architecture sont organisés dans les couches suivantes :
Actions utilisateur et agentiques
- Environnement de développement agentique : les experts en données, tels que les ingénieurs de données
et les data scientists, envoient des requêtes en langage naturel à l'aide de l'une des
méthodes suivantes :
- Un environnement de développement agentique tel que Google Antigravity IDE ou Microsoft Visual Studio Code.
- Un agent CLI tel que Gemini CLI, Claude Code ou Codex.
- Extension Google Cloud Data Agent Kit : L' extension permet aux agents d'accéder à des données fiables dans Google Cloud en chargeant les compétences appropriées et en se connectant à des serveurs MCP distants pour les Google Cloud services.
- Modèle de fondation : pour générer des insights commerciaux à partir de données et d'un contexte fiables, l'environnement de développement agentique utilise un modèle de fondation, tel qu'un modèle de la famille Gemini. Le modèle utilise les compétences appropriées de l'extension Data Agent Kit et les outils de serveur MCP requis pour implémenter des workflows d'analyse complexes.
- Environnement de développement agentique : les experts en données, tels que les ingénieurs de données
et les data scientists, envoient des requêtes en langage naturel à l'aide de l'une des
méthodes suivantes :
Workflows d'analyse
- Lakehouse pour Apache Iceberg: Lakehouse fournit un catalogue de métadonnées unifié et hautes performances qui intègre le format de table ouvert Apache Iceberg au stockage de niveau entreprise dans Google Cloud.
- Managed Service pour Apache Spark: il s'agit du composant de traitement des données principal de l'architecture. La fonctionnalité Lightning Engine de Managed Service pour Apache Spark prend en charge le traitement des données sans serveur et hautes performances en mode batch et interactif. Les tâches de traitement des données Spark utilisent les métadonnées du catalogue Iceberg dans Lakehouse, lisent les données structurées à partir de BigQueryet effectuent des lectures sans copie à partir de sources externes telles qu'Amazon S3.
- Knowledge Catalog: L'agent utilise Knowledge Catalog pour effectuer des analyses intelligentes des données non structurées dans Cloud Storage, extraire des métadonnées sémantiques et créer un graphique de contexte.
Datastores fiables
- Données dans Google Cloud : BigQuery sert d'entrepôt central pour les données structurées, y compris les extraits structurés de données non structurées dans Cloud Storage.
- Données provenant de sources externes : l'architecture affiche des sources de données externes, telles que des données dans des buckets Amazon S3 et des métadonnées dans Databricks Unity Catalog. Cross-Cloud Interconnect fournit une connectivité dédiée à bande passante élevée entre Google Cloud et d'autres fournisseurs de services cloud.
Produits utilisés
L'architecture utilise les Google Cloud produits et outils suivants :
- Google Cloud Data Agent Kit : extensions d'agent permettant aux data scientists, aux ingénieurs de données et aux développeurs d'applications de données de gérer l'ensemble du cycle de vie des données à partir de leurs environnements de développement agentiques préférés.
- BigQuery : entrepôt de données d'entreprise qui vous aide à gérer et analyser vos données grâce à des fonctionnalités intégrées telles que le machine learning, l'analyse géospatiale et l'informatique décisionnelle.
- Managed Service pour Apache Spark : service géré qui exécute des charges de travail par lot Apache Spark sur une infrastructure de calcul gérée.
- Lakehouse pour Apache Iceberg : moteur de stockage hautes performances qui vous permet de créer des lakehouses de données ouverts et fournit une interface unifiée pour l'analyse avancée et l'IA.
- Knowledge Catalog : service optimisé par l'IA qui fournit un catalogue unifié d'actifs de données avec des métadonnées intelligentes et des fonctionnalités de gouvernance.
- Gemini: famille de modèles d'IA multimodaux développés par Google.
- Cloud Storage : store d'objets économique et sans limite pour tout type de données. Les données sont accessibles depuis et en dehors de Google Cloud, et sont répliquées sur plusieurs emplacements à des fins de redondance.
- Cross-Cloud Interconnect : service qui fournit une connectivité dédiée à bande passante élevée et à faible latence entre Google Cloud et d'autres fournisseurs de services cloud.
- Serveurs MCP Google Cloud : services distants gérés par Google qui implémentent le protocole MCP (Model Context Protocol) pour permettre aux applications d'IA d'accéder aux Google Cloud produits et services Google.
Cas d'utilisation
L'architecture décrite dans ce document convient aux cas d'utilisation suivants :
- Analyse de données multicloud : interrogez et analysez efficacement les données distribuées sur Google Cloud et d'autres fournisseurs de services cloud sans déplacer de fichiers ni créer de pipelines d' extraction, de transformation et de chargement (ETL) complexes. Par exemple, un responsable marketing d'un détaillant mondial peut analyser l'efficacité des campagnes marketing en associant les données de fidélisation client dans Amazon S3 aux données d'opérations marketing dans BigQuery.
- Découverte intelligente des données : utilisez des prompts en langage naturel et des agents IA pour découvrir, interroger et traiter des ensembles de données fédérés dans plusieurs environnements. Par exemple, un spécialiste des achats peut déterminer les causes courantes des perturbations de la chaîne d'approvisionnement en fonction des données structurées d'un système de gestion de la chaîne d'approvisionnement (SCM) combinées aux insights provenant de communications par e-mail non structurées et de rapports d'évaluation des dommages.
- Extraction de données structurées à partir de sources non structurées : analysez de grands volumes de données non structurées, dérivez des métadonnées sémantiques et stockez des extraits de données structurées dans BigQuery pour une analyse en aval. Par exemple, un contrôleur des opérations peut analyser efficacement les dépenses en extrayant des données structurées de milliers de factures stockées dans un format non structuré, tel que des fichiers PDF.
Déploiement
Pour découvrir comment créer une solution d'analyse agentique à l'aide de l' extension Data Agent Kit, consultez l'atelier de programmation Des données brutes aux prévisions en quelques secondes avec les agents IA. L'atelier de programmation montre comment l'extension Data Agent Kit vous permet d'analyser efficacement les données à partir de votre environnement de développement agentique préféré. Toutes les données d'exemple utilisées par l'atelier de programmation sont stockées dans Google Cloud.
Étape suivante
- Découvrez comment l'extension Data Agent Kit vous permet d'utiliser des notebooks pour la transformation et l'analyse des données.
- Découvrez les cas d'utilisation de Knowledge Catalog.
- En savoir plus sur Lakehouse sans frontières.
- Découvrez comment accélérer les charges de travail Apache Spark à l'aide de Lightning Engine.
- Découvrez comment utiliser Knowledge Catalog comme couche de gouvernance et agentique pour BigQuery.
- Pour découvrir d'autres architectures de référence, schémas et bonnes pratiques, explorez le Cloud Architecture Center.
Contributeurs
Auteur : Kumar Dhanagopal | Cross-product solution developer
Autres contributeurs :
- Abirami Sukumaran | Staff Developer Advocate
- Arti Prasad | Rédacteur technique
- Brad Miro | Senior Developer Advocate
- Matthew Rahmann | Senior Product Manager
- Ranadip Chatterjee | Ingénieur de solutions
- Remigiusz Samborski | Lead Developer Relations Engineer