Descripción general de Knowledge Catalog

Knowledge Catalog es una capa de contexto potenciada por Gemini que proporciona contexto empresarial universal y capacidades de fundamentación activa en todo tu acervo de datos. Al compilar un gráfico de contexto dinámico a partir de datos estructurados y no estructurados, ayuda a los equipos de datos y a los desarrolladores a descubrir recursos, verificar la calidad de los datos y fundamentar de forma segura las aplicaciones de IA generativa para reducir las alucinaciones.

Para obtener una explicación detallada de Knowledge Catalog, mira el siguiente video:

Público y requisitos previos

Esta descripción general está diseñada para ingenieros de datos y contexto, científicos de datos, administradores de datos y desarrolladores de IA. Antes de usar Knowledge Catalog, debes tener lo siguiente:

  • Conocimiento de los sistemas de almacenamiento y bases de datos, como BigQuery o Cloud Storage

  • Conocimientos básicos de los conceptos de IA generativa, como la generación aumentada por recuperación (RAG) o el Protocolo de contexto del modelo (MCP)

Resuelve la complejidad de los datos específicos de la industria

En las empresas modernas, los datos son complejos, están muy distribuidos y existen en formatos estructurados y no estructurados. Las solicitudes comerciales rara vez se asignan a un solo esquema de base de datos o almacén de documentos. Alinear estos silos de forma segura y, al mismo tiempo, brindar respuestas inmediatas y confiables a preguntas de varios dominios es un gran desafío operativo.

Knowledge Catalog actúa como la base semántica que une esta brecha, lo que permite que los agentes de IA y las herramientas de análisis recuperen contexto fundamentado y pertinente.

Roles clave del usuario

  • Ingenieros de contexto (ingenieros de datos). Automatiza la agregación de metadatos en bases de datos y Cloud Storage, rastrea las transformaciones con el linaje y crea flujos de trabajo de enriquecimiento y evaluación.

  • Administradores de datos (equipos de administración) Supervisar la calidad de los metadatos proporcionando revisiones humanas de las descripciones generadas por IA, estandarizar los vocabularios empresariales con glosarios y definir aspectos personalizados para adjuntar contexto específico del dominio a las entradas del catálogo

  • Desarrolladores de IA. Fundamenta los LLM y las aplicaciones de IA con esquemas de datos empresariales confiables a través de servidores de MCP o APIs de recuperación de contexto.

Casos prácticos del sector

En la siguiente tabla, se ilustran las preguntas complejas que surgen en la práctica, cómo cruzan los límites técnicos y cómo el Catálogo de conocimiento ayuda a las organizaciones a abordarlas:

Sector Desafíos operativos y de datos Problema empresarial que se debe resolver Cómo lo aborda Knowledge Catalog
Comercio electrónico
  • Las bases de datos transaccionales y las imágenes de productos no estructuradas residen en entornos de almacenamiento separados, lo que dificulta vincular los historiales de devoluciones con el estado físico.
  • Correlacionar las tasas de devoluciones con los comentarios visuales de los clientes requiere canalizaciones de datos complejas y manuales.
"Busca productos electrónicos con altas tasas de devoluciones y fotos de clientes que muestren signos de daños al llegar". Fundamentación semántica en todos los formatos de datos: Descubre automáticamente los metadatos de las bases de datos transaccionales y los vincula a las imágenes no estructuradas en los buckets de almacenamiento de Cloud Storage, lo que permite que las herramientas de IA resuelvan la búsqueda en sistemas de almacenamiento dispares.
Manufactura
  • Los registros de telemetría y los escaneos en PDF de la inspección en papel se aíslan en las divisiones geográficas.
  • Compilar resúmenes de las verificaciones de seguridad y buscar patrones operativos históricamente lleva semanas de coordinación entre equipos.
"Genera resúmenes de todos los informes de inspección relacionados con las máquinas de la región occidental que no pasaron las verificaciones de seguridad el trimestre pasado". Indexación regional y no estructurada: Indexa y cataloga informes de inspección en PDF no estructurados junto con metadatos de activos, lo que permite que los agentes de IA generativa ubiquen, compilen y resuman informes por región.
Salud
  • Los datos clínicos de los registros electrónicos de salud deben permanecer seguros y cumplir con las reglamentaciones de la HIPAA, a la vez que admiten modelos predictivos en tiempo real.
  • Las anomalías no detectadas en la calidad de los datos pueden generar predicciones incorrectas del modelo o alertas de atención al paciente.
"¿Qué pacientes tienen el mayor riesgo de reingreso en un plazo de 30 días si se tienen en cuenta los signos vitales recientes y la frecuencia de las citas?". Calidad y linaje de los datos: Calcula el perfil de calidad de los datos a nivel de la línea y los mapas de linaje en los feeds de registros de salud electrónicos, lo que ayuda a garantizar que los modelos predictivos clínicos se basen solo en datos vitales verificados y de alta calidad de los pacientes.
Servicios financieros
  • Los archivos de texto de comentarios de los clientes, las cuentas de CRM y los libros contables de facturación se administran en sistemas separados, lo que impide un análisis unificado.
  • Para proyectar las tendencias financieras, es necesario unir los datos de opinión no estructurados con las bases de datos de ingresos históricos.
"¿Cuáles son los 10 clientes principales que generaron ingresos y se quejaron de "problemas de rendimiento"? ¿Cómo afecta esto a las proyecciones del tercer trimestre?" Gráfico de contexto unificado: Unifica los registros de clientes, los comentarios de asistencia y las tablas financieras, lo que permite que las consultas en lenguaje natural unan las estadísticas de ingresos de los clientes con los archivos de comentarios no estructurados para predecir el impacto financiero.

Para abordar estos desafíos operativos, Knowledge Catalog proporciona capacidades clave que ayudan a los ingenieros de datos, los científicos de datos y los desarrolladores de IA a compilar sistemas de datos administrados:

  • Fundamenta los agentes de IA con el Protocolo de contexto del modelo (MCP). Expón metadatos, esquemas, linaje y reglas comerciales directamente a los agentes de IA con servidores MCP locales o remotos. Estos servidores permiten que los modelos verifiquen las expectativas operativas antes de proponer acciones.

  • Acelera el descubrimiento para la IA y las estadísticas. Encuentra recursos de datos relevantes con la búsqueda semántica en lenguaje natural. Los resúmenes y las recomendaciones generativos ayudan a los usuarios a ubicar datos sin tener que esperar las revisiones manuales de la documentación.

  • Extrae contexto de datos no estructurados. Analiza automáticamente archivos no estructurados, como los PDFs en Cloud Storage, para extraer entidades y relaciones, y convertirlos en recursos consultables en BigQuery para admitir agentes conversacionales.

  • Administra productos de datos a gran escala. Empaqueta colecciones de recursos con acuerdos de nivel de servicio (ANS), contratos, detalles de propiedad y notas de uso en unidades únicas y controladas para la búsqueda y la suscripción.

Cómo funciona Knowledge Catalog

Knowledge Catalog unifica la administración de datos y el contexto a través de un ciclo de vida de tres pilares. En el siguiente diagrama, se ilustra cómo el servicio asigna recursos de datos físicos a la semántica empresarial para la fundamentación de agentes de IA:

Arquitectura de Knowledge Catalog que muestra la selección de metadatos, la lógica empresarial y las relaciones de datos en un gráfico de contexto unificado para los agentes de IA. Arquitectura de Knowledge Catalog que muestra la selección de metadatos, la lógica empresarial y las relaciones de datos en un gráfico de contexto unificado para los agentes de IA.
Figura 1. Arquitectura de Knowledge Catalog

Para obtener más información sobre estos conceptos de metadatos, consulta Acerca de los metadatos.

En las siguientes secciones, se describen los tres pilares del ciclo de vida de los metadatos y se ilustra cómo una empresa minorista los aplica a las tablas de bases de datos, los archivos y las entradas de catálogos externos:

  1. Agregación (Descubre y procesa). Knowledge Catalog rastrea e indexa automáticamente los metadatos técnicos en todo tu patrimonio de datos sin mover los datos subyacentes:

    • Bases de datos integradas. El catalogado automatizado captura esquemas y atributos en plataformas como BigQuery, AlloyDB para PostgreSQL y Spanner.
    • Conectividad administrada. Ingiere definiciones de sistemas externos, como Oracle o PostgreSQL, o registros de socios, como Collibra, sin escribir canalizaciones personalizadas.
    • Linaje de datos. Haz un seguimiento de las transformaciones a nivel de la columna en todas las canalizaciones para saber de dónde provienen tus datos y cómo cambiaron.
    • Ejemplo: Una empresa de venta minorista ingiere automáticamente metadatos de bases de datos transaccionales, como las tablas orders y order_items, y, luego, indexa archivos de productos no estructurados almacenados en buckets de Cloud Storage. Vinculan bases de datos externas para establecer un índice de metadatos unificado en un directorio detectable.

    Más información sobre la agregación de metadatos y la transferencia de datos (haz clic para expandir)

  2. Enriquecimiento (selecciona el contexto y verifica la confianza). Knowledge Catalog adjunta significado comercial a las estructuras técnicas y establece indicadores de confianza:

    • Estadísticas generadas por IA Gemini analiza los registros de consultas para generar descripciones de columnas, resúmenes de tablas y uniones recomendadas.
    • Indexación no estructurada Explorar directorios de archivos para extraer entidades y conexiones de recursos no estructurados, como PDFs o imágenes
    • Glosarios y aspectos Asigna los nombres de las métricas internas a un vocabulario compartido con términos comerciales y plantillas lógicas.
    • Calidad de los datos y detección de anomalías. Aplicamos los lineamientos de limpieza y ejecutamos análisis de aprendizaje automático para detectar valores atípicos estadísticos o problemas de actualización de datos, lo que genera indicadores clave de confianza.
    • Revisiones de administración. Administra el riesgo con procesos de revisión de flujos de trabajo para verificar las actualizaciones de metadatos antes de la publicación.
    • Ejemplo: El equipo de venta minorista enriquece los recursos activando estadísticas de datos para recomendar descripciones de columnas y ejecutar reglas de calidad de los datos. Asignan definiciones comerciales a pedidos activos creando glosarios y aspectos.

    Más información sobre la verificación de la confianza y el enriquecimiento de metadatos (haz clic para expandir)

  3. Búsqueda y recuperación (acceso y fundamentación). Las aplicaciones de IA y los usuarios empresariales consultan el gráfico de contexto unificado para acceder a los datos de forma segura:

    • Agentes de fundamentación. Conecta tus apps y agentes basados en LLMs al catálogo.
    • API de Context Realiza solicitudes de carga útil de fundamentación de baja latencia.
    • Búsqueda semántica. Encuentra los recursos adecuados con consultas en lenguaje natural.
    • Empaquetado de datos Agrupa colecciones de tablas, detalles de licencias y ANS en paquetes de datos seguros de autoservicio.
    • Ejemplo: Los analistas realizan búsquedas semánticas en lenguaje natural para ubicar recursos. Las aplicaciones de IA consumen este índice de forma segura con servidores de MCP o la API de recuperación de contexto, y los recursos de alta calidad se empaquetan en una vista segura.

    Más información sobre la recuperación de contexto y la fundamentación del agente (haz clic para expandir)

Knowledge Catalog en Google Cloud y el ecosistema de IA

Comprender cómo se integra Knowledge Catalog con los servicios relacionados es fundamental para crear una base de datos.

Bases de datos y modelosGoogle Cloud

  • BigQuery. Knowledge Catalog rastrea e indexa automáticamente los conjuntos de datos, las tablas y las vistas de BigQuery. Activa las estadísticas de datos potenciadas por Gemini para analizar los historiales de búsqueda, publicar descripciones y sugerir ejemplos de búsquedas verificadas.
  • Looker (Google Cloud Core) Knowledge Catalog ingiere paneles, vistas y estructuras de LookML de Looker, como vistas, exploraciones, dimensiones y medidas. Esta transferencia crea asignaciones de linaje para rastrear cómo los valores operativos se asignan a la semántica empresarial.
  • Catálogo de entorno de ejecución de Lighthouse Knowledge Catalog se integra en Lighthouse, el metastore de tiempo de ejecución para cargas de trabajo de Iceberg de código abierto. Indexa automáticamente los metadatos técnicos sobre las cargas de trabajo de Lighthouse para proporcionar un contexto activo unificado.

Plataformas y asistentes de agentes de IA

  • Análisis conversacional Las interfaces de análisis usan términos del catálogo y herramientas de búsqueda para permitir que los usuarios consulten métricas comerciales en lenguaje natural con fundamentación verificada.
  • Gemini para agentes de IA Los asistentes de alta precisión usan metadatos del catálogo para ejecutar búsquedas en la base de datos, lo que reduce las alucinaciones.
  • Gemini Enterprise Agent Platform. Knowledge Catalog funciona como el estándar central de administración de datos en los entornos de la plataforma de destino. Se vincula de forma cruzada con Gemini Enterprise Agent Platform para proporcionar herramientas y contexto al registro de agentes de la plataforma.

Google Cloud Integración de servicios de IA y bases de datos

Knowledge Catalog funciona junto con otros productos deGoogle Cloud para formar tu base de datos. En la siguiente tabla, se destaca cómo Knowledge Catalog se integra con los servicios relacionados y los complementa:

Servicio Rol principal Cómo se integra con Knowledge Catalog
Knowledge Catalog Administración y contexto de agentes Sirve como el gráfico de contexto semántico unificado, ejecuta análisis de verificación de calidad de los datos y expone esquemas fundamentados a los modelos y las aplicaciones de IA.
BigQuery Almacenamiento de datos empresariales Almacena, consulta y procesa conjuntos de datos; rastrea, indexa y enriquece automáticamente estas tablas con aspectos de clasificación empresarial.
Vertex AI Desarrollo de modelos de IA Crea, implementa y aloja modelos de base. Los agentes personalizados recuperan el contexto de los metadatos para fundamentar el razonamiento lógico.
Cloud Storage Almacenamiento de archivos no estructurados Almacena archivos sin procesar y no estructurados, y ejecuta automáticamente análisis de descubrimiento no estructurados para analizar archivos PDF e imágenes y crear mapas de relaciones.

Semántica y formatos de datos

Para instruir y fundamentar sistemas basados en agentes de manera eficaz, debes distinguir entre la estructura de datos física y el significado semántico:

  • Semántica. El significado, la intención y las relaciones comerciales asociadas con tus datos. Si bien los esquemas técnicos definen especificaciones de almacenamiento estructurales, como un tipo de base de datos, la longitud de caracteres o una restricción de números enteros, la semántica describe lo que el conjunto de datos representa en realidad. Por ejemplo, puedes asignar una columna llamada txn_qty a la definición comercial de "cantidad comprada".
  • Datos estructurados Información almacenada en esquemas definidos y formatos relacionales. Entre los ejemplos, se incluyen las tablas de BigQuery, las bases de datos de Spanner y las tablas operativas de Postgres. Knowledge Catalog rastrea automáticamente estos metadatos y registra las columnas y las restricciones.
  • Datos no estructurados: Información sin formato que contiene texto sin procesar o archivos multimedia que carecen de un esquema estructural. Entre los ejemplos, se incluyen hojas de datos en PDF, correos electrónicos de asistencia al cliente e imágenes almacenadas en Cloud Storage. Knowledge Catalog ejecuta análisis de descubrimiento con estadísticas de datos no estructurados para extraer las relaciones subyacentes entre entidades y registrarlas en un perfil de grafo, que es un aspecto especializado que contiene nodos y aristas de relaciones entre entidades extraídos por IA.

Orquestación del contexto de la Nube de datos con agentes

Dentro del framework de nube de datos con agentes de Google, Knowledge Catalog funciona como el plano de orquestación semántica. En lugar de requerir que los desarrolladores codifiquen de forma manual esquemas y reglas de bases de datos en las instrucciones, el motor de contexto proporciona de forma dinámica el contexto semántico preciso que un agente necesita para tomar decisiones inteligentes.

En la siguiente figura, se muestra cómo Knowledge Catalog organiza y entrega el contexto de los datos:

Arquitectura de orquestación del contexto de nube de datos con agentes.
Ruta de acceso de orquestación y entrega de contexto en la nube de datos con agentes.
Arquitectura de orquestación del contexto de nube de datos con agentes.

El flujo de trabajo de orquestación del contexto consta de las siguientes fases:

  1. Transferencia y descubrimiento. Las bases de datos operativas, los almacenes como Spanner y BigQuery, los almacenes de objetos no estructurados como Cloud Storage y los metastores de tiempo de ejecución como Lighthouse envían esquemas técnicos, mapas de linaje y definiciones de metadatos directamente a Knowledge Catalog.
  2. Mapa de contexto Dentro del Catálogo de conocimiento, estas propiedades de metadatos se vinculan a elementos semánticos, incluidos aspectos técnicos, glosarios empresariales y consultas verificadas, para ensamblar el gráfico de contexto activo.
  3. Interfaces de entrega. Las aplicaciones y los orquestadores de IA recuperan este gráfico de contexto consolidado de forma programática con conectores estándar, como MCP o extremos de API de LookupContext directos.
  4. Fundamentación del agente. Los frameworks de organización, como el Kit de desarrollo de agentes (ADK) o LangChain, insertan este contexto de metadatos directamente en las instrucciones de LLM. Esta inyección fundamenta el razonamiento del agente en reglas organizacionales verificadas, lo que le permite consultar bases de datos o ejecutar acciones automatizadas sin alucinaciones.

Perfiles de agentes de IA

Según los flujos de trabajo que desees automatizar, puedes crear diferentes clases de agentes potenciados por Knowledge Catalog:

  • Agentes de detección de datos. Estos asistentes ayudan a los usuarios a buscar y navegar por el patrimonio de datos. En lugar de usar la coincidencia de palabras clave, analizan la intención y las restricciones de formato largo en lenguaje natural para recuperar los recursos físicos más relevantes.
  • Agentes de enriquecimiento de metadatos Estos agentes en segundo plano incorporan texto no estructurado de wikis, archivos README o registros de chat, analizan el texto para convertirlo en metadatos formales y escriben los metadatos como aspectos en Knowledge Catalog para mantenerlos actualizados.
  • Calidad de los datos y agentes de canalización. Estos agentes autónomos evalúan las reglas de calidad, detectan la desviación del esquema y compilan o reparan canalizaciones de transformación de datos consultando el linaje de los datos y las estadísticas del perfil.

Herramientas de organización

Para compilar e integrar estos agentes, puedes usar las siguientes herramientas:

Contexto de acceso con MCP

El Protocolo de contexto del modelo (MCP) es un puente estandarizado que permite que los agentes y las herramientas de IA se conecten sin problemas a fuentes de datos, como Knowledge Catalog. Usa la siguiente tabla de comparación para determinar la mejor opción para tu integración:

Implementación Ideal para Detalles clave Extremo o configuración
Servidor de MCP remoto Implementaciones centradas en la nube, entornos sin servidores como Cloud Run y servicios externos administrados. Es un extremo alojado en Google que no requiere administración de servidores locales. Extremo: https://dataplex.googleapis.com/mcp
Para configurarlo, consulta Cómo usar un servidor de MCP remoto.
Caja de herramientas del MCP local Desarrollo de agentes locales, creación rápida de prototipos e integraciones de IDE de escritorio, como VS Code o Cursor. Herramienta de línea de comandos que actúa como proxy local entre tu entorno de espacio de trabajo y Knowledge Catalog. Requiere la instalación binaria y la configuración de .mcp.json.
Para configurar, consulta Usa un servidor MCP local.

Prácticas recomendadas para el contexto de datos con agentes

Para crear experiencias de agentes confiables, ten en cuenta las siguientes prácticas recomendadas cuando organices y consultes metadatos en Knowledge Catalog:

  • Agregar aspectos Los agentes de IA no pueden distinguir entre las tablas de producción oficiales y las simulaciones temporales de zona de pruebas solo por el nombre. Define y aplica un aspecto de indicador de confianza personalizado para certificar productos de datos autorizados, lo que ayuda a garantizar que los agentes prioricen o restrinjan las búsquedas a estos recursos.
  • Optimiza las búsquedas con presupuestos de contexto. Cuando llames a la API de LookupContext, especifica el parámetro context_budget. La API optimiza y ajusta primero los metadatos más importantes, como el linaje y las descripciones principales, dentro de las restricciones de tokens especificadas.
  • Proporciona recursos relacionados para exponer las rutas de unión. En tus consultas contextuales, enumera hasta 10 tablas o recursos relacionados. Proporcionar un grupo de recursos permite que el motor de contexto complete automáticamente las rutas de unión y las relaciones, lo que ayuda al agente a comprender cómo interactúan las tablas.
  • Estructura glosarios semánticos. Estandarizar los términos y las abreviaturas en los glosarios empresariales Esta estandarización ayuda a las herramientas de conversación a resolver sinónimos y métricas específicos de la empresa con precisión.
  • Publica consultas de referencia. Adjunta consultas verificadas en lenguaje natural y sus equivalentes correctos en SQL directamente a las entradas del Knowledge Catalog. Al fundamentar el razonamiento en estas plantillas verificadas, evitas errores de conversión de SQL en los agentes de texto a SQL.

Transición de Dataplex Universal Catalog a Knowledge Catalog

Dataplex Universal Catalog evolucionó a Knowledge Catalog. Para obtener más información sobre esta transición, consulta Transición de Dataplex Universal Catalog a Knowledge Catalog.

Limitaciones

Cuando planifiques tu implementación, ten en cuenta las siguientes limitaciones:

  • Integraciones admitidas. Si bien Knowledge Catalog admite los principales sistemas de terceros, es posible que algunas extracciones semánticas automatizadas se limiten a los servicios Google Cloud integrados.

  • Límites de cuota. Las cuotas de la API estándar Google Cloud se aplican a las operaciones de recuperación de contexto y extracción de metadatos.

¿Qué sigue?

Concepto

Comprende cómo el contexto activo transforma los metadatos pasivos para fundamentar los agentes de IA y evitar las alucinaciones.

Instructivo

Crea un glosario empresarial, define tipos de aspectos personalizados y enriquece los activos en BigQuery.

Integración de IA

Conecta agentes de IA y herramientas para desarrolladores a Knowledge Catalog con el Protocolo de contexto del modelo.

Discovery

Encuentra y explora recursos del catálogo en Google Cloud y sistemas de terceros con lenguaje natural.

Administración

Define reglas de validación y supervisa la limpieza de los datos en las tablas con análisis de calidad automatizados.

Casos de uso

Analiza soluciones del mundo real para el enriquecimiento del contexto, el linaje de datos y los flujos de trabajo basados en agentes.