Implementa flujos de trabajo de análisis de agentes para datos distribuidos

Last reviewed 2026-06-09 UTC

En este documento, se proporciona una arquitectura de alto nivel para implementar flujos de trabajo de análisis en varias nubes que usan agentes de IA. El documento está dirigido a arquitectos de la nube, ingenieros de datos y científicos de datos que desean usar la IA de agentes para los flujos de trabajo de análisis en data lakes de múltiples nubes, almacenes de datos estructurados y almacenes de datos no estructurados. En este documento, se supone que tienes conocimientos básicos de los conceptos de IA de agentes, el análisis de datos y la arquitectura de nube.

En la sección Implementación de este documento, se proporciona un codelab que puedes usar para aprender a compilar una solución de análisis basada en agentes.

Arquitectura

En el siguiente diagrama, se muestra una arquitectura para una solución de análisis basada en agentes que deriva estadísticas empresariales a partir de datos estructurados y no estructurados distribuidos en varios almacenes de datos y proveedores de servicios en la nube.

Una arquitectura que usa un entorno de desarrollo basado en agentes y un modelo de IA para analizar datos distribuidos en Google Cloud y otros proveedores de servicios en la nube.

Los componentes de esta arquitectura se organizan en las siguientes capas:

  • Acciones del usuario y del agente

    • Entorno de desarrollo basado en agentes: Los profesionales de datos, como los ingenieros y los científicos de datos, envían solicitudes en lenguaje natural con uno de los siguientes métodos:
    • Extensión del kit de agentes de datos de Google Cloud: La extensión permite que los agentes accedan a datos confiables enGoogle Cloud cargando las habilidades adecuadas y conectándose a servidores MCP remotos para los servicios de Google Cloud .
    • Modelo fundamental: Para generar estadísticas empresariales a partir de datos y contexto confiables, el entorno de desarrollo de agentes usa un modelo fundamental, como un modelo de la familia Gemini. El modelo usa las habilidades adecuadas de la extensión Data Agent Kit y las herramientas necesarias del servidor de MCP para implementar flujos de trabajo de análisis complejos.
  • Flujos de trabajo de Analytics

    • Lakehouse para Apache Iceberg: Lakehouse proporciona un catálogo de metadatos unificado y de alto rendimiento que integra el formato de tabla abierta de Apache Iceberg con el almacenamiento de nivel empresarial en Google Cloud.
    • Managed Service para Apache Spark: Este es el componente principal de procesamiento de datos en la arquitectura. La función Lightning Engine de Managed Service para Apache Spark admite el procesamiento de datos sin servidores y de alto rendimiento en modos interactivos y por lotes. Los trabajos de procesamiento de datos de Spark usan metadatos del catálogo de Iceberg en Lakehouse, leen datos estructurados de BigQuery y realizan lecturas sin copias de fuentes externas, como Amazon S3.
    • Knowledge Catalog: El agente usa Knowledge Catalog para realizar análisis inteligentes de datos no estructurados en Cloud Storage, extraer metadatos semánticos y compilar un gráfico de contexto.
  • Almacenes de datos de confianza

    • Datos en Google Cloud: BigQuery funciona como el almacén central de datos estructurados, incluidas las extracciones estructuradas de datos no estructurados en Cloud Storage.
    • Datos de fuentes externas: La arquitectura muestra fuentes de datos externas, como los datos en los buckets de Amazon S3 y los metadatos en el catálogo de Databricks Unity. Cross-Cloud Interconnect proporciona conectividad dedicada de ancho de banda alto entre Google Cloudy otros proveedores de servicios en la nube.

Productos usados

La arquitectura usa los siguientes productos y herramientas de Google Cloud :

  • Kit de agentes de datos de Google Cloud: Extensiones de agentes para que los científicos de datos, los ingenieros de datos y los desarrolladores de apps de datos administren todo el ciclo de vida de los datos desde sus entornos de desarrollo de agentes preferidos.
  • BigQuery: Un almacén de datos empresarial que te ayuda a administrar y analizar tus datos con funciones integradas como el aprendizaje automático, el análisis geoespacial y la inteligencia empresarial.
  • Managed Service para Apache Spark: Es un servicio administrado que ejecuta cargas de trabajo por lotes de Apache Spark en una infraestructura de procesamiento administrada.
  • Lakehouse para Apache Iceberg: Un motor de almacenamiento de alto rendimiento que te permite crear lakehouses de datos abiertos y proporciona una interfaz unificada para el análisis avanzado y la IA.
  • Knowledge Catalog: Es un servicio potenciado por IA que proporciona un catálogo unificado de recursos de datos con metadatos inteligentes y capacidades de administración.
  • Gemini: Es una familia de modelos de IA multimodales desarrollados por Google.
  • Cloud Storage: Un almacén de objetos de bajo costo y sin límites para varios tipos de datos. Se puede acceder a los datos desde y hacia Google Cloud, y estos se replican en las ubicaciones para aumentar la redundancia.
  • Cross-Cloud Interconnect: Es un servicio que proporciona conectividad dedicada de gran ancho de banda y baja latencia entre Google Cloud y otros proveedores de servicios en la nube.
  • Servidores de MCP de Google Cloud: Servicios remotos administrados por Google que implementan el Protocolo de contexto del modelo (MCP) para proporcionar a las aplicaciones de IA acceso a los productos y servicios de Google y Google Cloud .

Casos de uso

La arquitectura que se describe en este documento es adecuada para los siguientes casos de uso:

  • Análisis de datos en múltiples nubes: Consulta y analiza de manera eficiente los datos que se distribuyen en Google Cloud y otros proveedores de servicios en la nube sin mover archivos ni compilar canalizaciones complejas de extracción, transformación y carga (ETL). Por ejemplo, un gerente de marketing de una cadena minorista global puede analizar la eficacia de las campañas de marketing combinando los datos de lealtad del cliente en Amazon S3 con los datos de las operaciones de marketing en BigQuery.
  • Descubrimiento inteligente de datos: Usa instrucciones en lenguaje natural y agentes de IA para descubrir, consultar y procesar conjuntos de datos federados en múltiples entornos. Por ejemplo, un especialista en adquisiciones puede determinar las causas comunes de las interrupciones en la cadena de suministro en función de los datos estructurados de un sistema de administración de la cadena de suministro (SCM) combinados con estadísticas de las comunicaciones por correo electrónico no estructuradas y los informes de evaluación de daños.
  • Extracción de datos estructurados de fuentes no estructuradas: Analiza grandes volúmenes de datos no estructurados, deriva metadatos semánticos y almacena extractos de datos estructurados en BigQuery para el análisis posterior. Por ejemplo, un controlador de operaciones puede analizar los gastos de manera eficiente extrayendo datos estructurados de miles de facturas que se almacenan en un formato no estructurado, como archivos PDF.

Implementación

Si quieres aprender a compilar una solución de análisis basada en agentes con la extensión del Data Agent Kit, consulta el codelab De datos sin procesar a previsiones en segundos con agentes de IA. En el codelab, se muestra cómo la extensión del Kit de agente de datos te permite analizar datos de manera eficiente desde tu entorno de desarrollo con agentes preferido. Todos los datos de muestra que usa el codelab se almacenan enGoogle Cloud.

¿Qué sigue?

Colaboradores

Autor: Kumar Dhanagopal | Desarrollador de soluciones entre productos

Otros colaboradores: