Este documento fornece uma arquitetura de alto nível para implementar fluxos de trabalho de análise entre nuvens que usam agentes de IA. O documento é destinado a arquitetos de nuvem, engenheiros de dados e cientistas de dados que querem usar a IA agêntica para fluxos de trabalho de análise em data lakes multicloud, data warehouses estruturados e armazenamentos de dados não estruturados. O documento pressupõe que você tenha uma compreensão básica dos conceitos de IA agêntica, análise de dados e arquitetura de nuvem.
A seção Implantação deste documento fornece um codelab que pode ser usado para aprender a criar uma solução de análise agêntica.
Arquitetura
O diagrama a seguir mostra uma arquitetura para uma solução de análise agêntica que deriva insights de negócios de dados estruturados e não estruturados distribuídos em vários armazenamentos de dados e provedores de serviços de nuvem.
Os componentes dessa arquitetura são organizados nas seguintes camadas:
Ações agênticas e do usuário
- Ambiente de desenvolvimento agêntico: profissionais de dados, como engenheiros de dados
e cientistas de dados, enviam solicitações de linguagem natural usando um dos
seguintes métodos:
- Um ambiente de desenvolvimento agêntico, como o Google Antigravity IDE ou o Microsoft Visual Studio Code.
- Um agente de CLI como a CLI do Gemini, o Claude Code ou o Codex.
- Extensão do Kit de Agente de Dados do Google Cloud: a extensão permite que os agentes acessem dados confiáveis em Google Cloud carregando habilidades adequadas e se conectando a servidores MCP remotos para Google Cloud serviços.
- Modelo de fundação: para gerar insights de negócios com base em contexto e dados confiáveis, o ambiente de desenvolvimento agêntico usa um modelo de fundação, como um modelo da família Gemini. O modelo usa habilidades adequadas da extensão do Data Agent Kit e as ferramentas necessárias do servidor MCP para implementar fluxos de trabalho de análise complexos.
- Ambiente de desenvolvimento agêntico: profissionais de dados, como engenheiros de dados
e cientistas de dados, enviam solicitações de linguagem natural usando um dos
seguintes métodos:
Fluxos de trabalho de análise
- Lakehouse para Apache Iceberg: o Lakehouse fornece um catálogo de metadados unificado e de alta performance que integra o formato de tabela aberta do Apache Iceberg com armazenamento de nível empresarial no Google Cloud.
- Serviço Gerenciado para Apache Spark: esse é o componente principal de tratamento de dados na arquitetura. O recurso Lightning Engine do Serviço Gerenciado para Apache Spark oferece suporte ao tratamento de dados sem servidor e de alta performance nos modos em lote e interativo. Os jobs de tratamento de dados do Spark usam metadados do catálogo do Iceberg no Lakehouse, leem dados estruturados do BigQuery e realizam leituras de cópia zero de fontes externas, como o Amazon S3.
- Knowledge Catalog: O agente usa o Knowledge Catalog para realizar verificações inteligentes de dados não estruturados no Cloud Storage, extrair metadados semânticos, e criar um gráfico de contexto.
Armazenamentos de dados confiáveis
- Dados no Google Cloud: o BigQuery serve como o data warehouse central para dados estruturados, incluindo extrações estruturadas de dados não estruturados no Cloud Storage.
- Dados de fontes externas: a arquitetura mostra fontes de dados externas, como dados em buckets do Amazon S3 e metadados no Databricks Unity Catalog. O Cross-Cloud Interconnect oferece conectividade dedicada de alta largura de banda entre Google Cloud e outros provedores de serviços de nuvem.
Produtos usados
A arquitetura usa os seguintes Google Cloud produtos e ferramentas:
- Kit de Agente de Dados do Google Cloud: extensões de agente para permitir que cientistas de dados, engenheiros de dados e desenvolvedores de apps de dados gerenciem todo o ciclo de vida dos dados nos ambientes de desenvolvimento agêntico preferidos.
- BigQuery: um data warehouse corporativo que ajuda a gerenciar e analisar seus dados com recursos integrados, como machine learning, análise geoespacial e Business Intelligence.
- Serviço Gerenciado para Apache Spark: um serviço gerenciado que executa cargas de trabalho em lote do Apache Spark em uma infraestrutura de computação gerenciada.
- Lakehouse para Apache Iceberg: um mecanismo de armazenamento de alta performance que permite criar data lakehouses abertos e fornece uma interface unificada para análise avançada e IA.
- Knowledge Catalog: um serviço com tecnologia de IA que fornece um catálogo unificado de recursos de dados com metadados inteligentes e governança recursos.
- Gemini: uma família de modelos de IA multimodais desenvolvidos pelo Google.
- Cloud Storage: um repositório de objetos de baixo custo e sem limite para diversos tipos de dados. Os dados podem ser acessados de dentro e de fora Google Cloud, e são replicados entre locais para redundância.
- Cross-Cloud Interconnect: um serviço que oferece conectividade dedicada de alta largura de banda e baixa latência entre Google Cloud e outros provedores de serviços de nuvem.
- Servidores MCP do Google Cloud: serviços remotos gerenciados pelo Google que implementam o Protocolo de Contexto de Modelo (MCP, na sigla em inglês) para fornecer acesso de aplicativos de IA ao Google e a Google Cloud produtos e serviços.
Casos de uso
A arquitetura descrita neste documento é adequada para os seguintes casos de uso:
- Análise de dados multicloud: consulte e analise com eficiência os dados que estão distribuídos entre Google Cloud e outros provedores de serviços de nuvem sem mover arquivos ou criar pipelines complexos deextração, transformação e carregamento (ETL, na sigla em inglês). Por exemplo, um gerente de marketing de um varejista global pode analisar a eficácia das campanhas de marketing unindo dados de fidelidade do cliente no Amazon S3 com dados de operações de marketing no BigQuery.
- Descoberta inteligente de dados: use comandos de linguagem natural e agentes de IA para descobrir, consultar e tratar conjuntos de dados federados em vários ambientes. Por exemplo, um especialista em compras pode determinar causas comuns de interrupções na cadeia de suprimentos com base em dados estruturados em um sistema de gerenciamento da cadeia de suprimentos (SCM, na sigla em inglês) combinados com insights de comunicações de e-mail não estruturadas e relatórios de avaliação de danos.
- Extração de dados estruturados de fontes não estruturadas: verifique grandes volumes de dados não estruturados, derive metadados semânticos e armazene extrações de dados estruturados no BigQuery para análise downstream. Por exemplo, um controlador de operações pode analisar despesas com eficiência extraindo dados estruturados de milhares de faturas armazenadas em um formato não estruturado, como arquivos PDF.
Implantação
Para aprender a criar uma solução de análise agêntica usando a extensão do Kit de Agente de Dados, consulte o codelab, Dados brutos para previsão em segundos com agentes de IA. O codelab mostra como a extensão do Data Agent Kit permite analisar dados com eficiência no ambiente de desenvolvimento agêntico preferido. Todos os dados de amostra usados no codelab são armazenados no Google Cloud.
A seguir
- Saiba como a extensão do Data Agent Kit permite que você use notebooks para transformação e análise de dados.
- Confira os casos de uso do Knowledge Catalog.
- Saiba mais sobre o Lakehouse sem fronteiras.
- Aprenda a acelerar as cargas de trabalho do Apache Spark usando o Lightning Engine.
- Aprenda a usar o Knowledge Catalog como uma camada agêntica e de governança para o BigQuery.
- Para mais arquiteturas de referência, diagramas e práticas recomendadas, confira a Central de arquitetura do Cloud.
Colaboradores
Autor: Kumar Dhanagopal | Desenvolvedor de soluções de vários produtos
Outros colaboradores:
- Abirami Sukumaran | Mediadora de desenvolvedores sênior
- Arti Prasad | Redatora técnica
- Brad Miro | Mediador de desenvolvedores sênior
- Matthew Rahmann | Gerente de produtos sênior
- Ranadip Chatterjee | Engenheiro de soluções
- Remigiusz Samborski | Engenheiro de relações com desenvolvedores líder