Acerca de los metadatos en Knowledge Catalog

Knowledge Catalog (anteriormente, Dataplex Universal Catalog) proporciona una plataforma unificada y estructurada de administración de metadatos en todo tu patrimonio de datos distribuidos. Descubre, indexa y organiza automáticamente estructuras técnicas, contexto empresarial, métricas de calidad de los datos y relaciones operativas.

Al organizar los metadatos en un metamodelo flexible y extensible, Knowledge Catalog establece la base estructural del gráfico de contexto activo dentro de la nube de datos con agentes de Google. Este gráfico de contexto permite que los equipos de datos descubran y administren recursos, al mismo tiempo que permite que los agentes de IA generativa recuperen contexto empresarial fundamentado y confiable.

Metamodelo de Knowledge Catalog

Knowledge Catalog organiza los metadatos a través de una jerarquía modular de contenedores, recursos, esquemas y relaciones:

  • Contenedores y recursos: Los grupos de entrada organizan las entradas, que representan recursos de datos individuales y sus columnas de esquema.
  • Enriquecimiento estructurado: Los tipos de aspectos definen esquemas para los aspectos, que adjuntan metadatos estructurados a entradas, columnas o relaciones.
  • Estándares y administración: Los tipos de entrada definen plantillas que aplican los aspectos requeridos en las entradas.
  • Relaciones: Los tipos de vínculos de entrada definen relaciones (vínculos de entrada) que conectan entradas y términos empresariales relacionados.

En la siguiente tabla, se resume la distinción entre los recursos administrados por el sistema (que proporciona automáticamente Google Cloud) y los recursos personalizados definidos por el usuario:

Elemento del metamodelo Administrado por el sistema (integrado) Definido por el usuario (personalizado)
Grupos de entrada Predefinidos por proyecto para Google Cloud servicios (por ejemplo, @bigquery, @spanner, @pubsub). Creados por los usuarios para agrupar y administrar recursos de datos y permisos personalizados.
Entradas Se propagan automáticamente desde Google Cloud fuentes (como tablas, vistas, conjuntos de datos y modelos de BigQuery). Creadas por los usuarios para representar fuentes de datos, archivos o bases de datos de terceros personalizados.
Tipos de aspectos Plantillas de sistema predefinidas (por ejemplo, Schema, Overview, Contacts, DataQuality, Lineage). Creadas por los usuarios para definir esquemas de metadatos específicos del dominio (como la clasificación de PII o los niveles de ANS).
Aspectos Se propagan automáticamente desde sistemas de origen, registros de consultas o análisis automatizados. Creados por usuarios, canalizaciones o agentes, y adjuntos a entradas, columnas o vínculos de entrada.
Tipos de entrada Plantillas predefinidas que representan Google Cloud tipos de recursos. Definidos por los usuarios para especificar aspectos obligatorios y opcionales para los recursos de datos personalizados
Vínculos de entrada Tipos de relaciones integrados (como synonym, definition, schema-join, related). Instancias creadas entre entradas o columnas específicas para modelar conexiones entre sistemas.

En las siguientes secciones, se describen los componentes principales que conforman el metamodelo de Knowledge Catalog.

Grupos de entrada

Un grupo de entrada (EntryGroup) es un contenedor regional para entradas y vínculos de entrada que actúa como el límite administrativo y de seguridad para administrar esos recursos.

Usa grupos de entrada para configurar lo siguiente:

  • Control de acceso de Identity and Access Management: Otorga permisos de lectura o edición a equipos específicos en un grupo de entrada sin modificar los permisos de entrada individuales.
  • Atribución de ubicación y proyecto: Agrupa los recursos por región geográfica y propiedad del proyecto.

Para Google Cloud fuentes, Knowledge Catalog crea grupos de entrada del sistema por proyecto automáticamente (como @bigquery o @spanner). Para las fuentes de datos personalizadas, debes crear grupos de entrada personalizados.

Por ejemplo, un equipo de finanzas puede crear un grupo de entrada personalizado llamado production_finance_data para administrar los permisos de acceso de todas las entradas personalizadas relacionadas con las finanzas en una sola ubicación.

Son grupos de entradas que contienen entradas y vínculos entre ellas. Son grupos de entradas que contienen entradas y vínculos entre ellas.
Figura 1. Grupos de entrada, entradas y vínculos de entrada (haz clic para ampliar).

Para obtener más información, consulta Grupos de entrada.

Entradas y rutas de acceso del esquema

Una entrada (Entry) representa un solo recurso de datos. Una entrada puede representar una tabla de base de datos estructurada, un modelo analítico, una tabla de objetos no estructurada o un conjunto de datos externo personalizado.

Entre los componentes clave de una entrada, se incluyen los siguientes:

  • Identificador de entrada: Un nombre de recurso único dentro de su grupo de entrada superior.
  • Tipo de entrada: La plantilla que define la estructura de la entrada y los aspectos requeridos.
  • Aspectos: Atributos de metadatos estructurados adjuntos a la entrada.
  • Rutas de acceso del esquema (columnas): Subsecciones o campos específicos dentro del recurso de datos como una columna en una tabla de BigQuery o un campo en un esquema JSON.

Las columnas te permiten adjuntar metadatos a campos individuales dentro de un recurso. No defines las columnas de forma manual; se propagan cuando adjuntas un aspecto de tipo schema a una entrada. Puedes hacer referencia a los campos anidados con rutas de acceso de notación de puntos (por ejemplo, customer.address.postal_code).

Por ejemplo, una tabla de BigQuery llamada orders_project.sales.customer_orders se representa como una entrada. Para describir el campo email_address dentro de esa tabla como que contiene información sensible, adjunta un aspecto de clasificación directamente a la ruta de acceso de la columna email_address.

Para obtener más información, consulta Entradas.

Tipos de aspecto

Un tipo de aspecto (AspectType) es una plantilla de esquema reutilizable que define los campos, los tipos de datos y las reglas de validación para un aspecto. Cada aspecto es una instancia de un tipo de aspecto.

Los tipos de aspectos pueden ser definidos por el sistema (proporcionados por Google Cloud) o personalizados (creados por tu organización).

Cuando defines el metadata_template para un tipo de aspecto personalizado, puedes usar los siguientes tipos de datos compatibles:

Tipo de datos del campo Descripción Ejemplo de caso de uso
string Valor de texto (UTF-8). Correo electrónico del propietario, etiqueta de clasificación de datos, nombre del departamento
integer / number Valores numéricos (números enteros o de punto flotante) Días de retención de datos, porcentaje objetivo de ANS, clasificación de prioridad
boolean Marca verdadero o falso contains_pii: true, is_certified: false
enum Una lista predefinida de valores de cadena permitidos Entorno: ["DEV", "STAGING", "PROD"]
datetime / timestamp Fecha y hora con formato ISO 8601 Fecha de certificación más reciente, fecha límite de revisión de cumplimiento
record Un objeto estructurado anidado que contiene campos secundarios ContactInfo { name: string, email: string, phone: string }
array Una lista de valores repetidos de cualquier tipo primitivo o de registro Lista de propietarios de datos secundarios: ["user1@example.com", "user2@example.com"]
map Pares clave-valor de cadena para atributos extensibles Etiquetas de implementación personalizadas: {"cost_center": "1042", "tier": "gold"}

Por ejemplo, para definir una plantilla reutilizable para la información de contacto, puedes crear un tipo de aspecto llamado ContactInfo con campos para owner_name (string), email (string) y support_channel (string).

Son los tipos de aspectos que definen los aspectos adjuntos a las entradas y los tipos de entrada que requieren tipos de aspectos. Son los tipos de aspectos que definen los aspectos adjuntos a las entradas y los tipos de entrada que requieren tipos de aspectos.
Figura 2. Tipos de aspectos, aspectos y tipos de entrada (haz clic para ampliar).

Para obtener más información, consulta Tipos de aspecto.

Aspectos

Un aspecto (Aspect) es un conjunto de campos de metadatos relacionados que se ajustan a un tipo de aspecto. Los aspectos se adjuntan a una entrada, una ruta de acceso de entrada (columna) o un vínculo de entrada para describir ese recurso.

A diferencia de los sistemas de etiquetado heredados, los aspectos de Knowledge Catalog se encapsulan directamente dentro de sus entradas o vínculos de entrada superiores, lo que te permite realizar operaciones de lectura y escritura atómicas.

Los aspectos se usan en varias funciones:

  • Estructura técnica: El aspecto Schema describe las columnas de la tabla, los tipos de datos y las descripciones.
  • Contexto empresarial: Los aspectos personalizados describen la propiedad, el cumplimiento y el estado del ciclo de vida.
  • Confianza operativa: Los aspectos de calidad de los datos registran los resultados de análisis de reglas automatizadas y las puntuaciones de validación.
  • Gráficos de entidades no estructuradas: El aspecto GraphProfile captura las entidades extraídas por IA y los bordes de relación de los archivos sin procesar.

Por ejemplo, puedes crear una instancia del tipo de aspecto ContactInfo con los valores {"owner_name": "Alex", "email": "alex@example.com"} y adjuntarla a la customer_orders entrada.

Para obtener más información, consulta Aspectos.

Tipos de entrada

Un tipo de entrada (EntryType) es una plantilla de administración para crear entradas personalizadas. Aplica estándares de calidad de metadatos mediante el establecimiento de los tipos de aspectos requeridos que se deben adjuntar a una entrada de ese tipo.

Cuando creas una entrada de un tipo de entrada específico, Knowledge Catalog valida que todos los tipos de aspectos marcados como required en el tipo de entrada estén presentes y sean válidos.

Por ejemplo, puedes crear un tipo de entrada llamado CertifiedDataProduct que especifique los tipos de aspectos OwnerInfo y DataRetentionPolicy como obligatorios. Cualquier entrada nueva creada con este tipo de entrada debe incluir estos aspectos antes de que puedas guardarla.

Para obtener más información, consulta Tipos de entrada.

Vínculos de entrada y tipos de vínculos de entrada

Un vínculo de entrada (EntryLink) establece una relación semántica entre dos entradas de datos o entre columnas específicas dentro de las entradas. Cada vínculo de entrada es una instancia de un tipo de vínculo de entrada (EntryLinkType).

Los vínculos de entrada pueden ser direccionales o no direccionales:

  • Simétrico (no direccional): Relaciones en las que ambos lados son pares (por ejemplo, synonym, related, o schema-join).
  • Asimétrico (direccional): Relaciones con una fuente y un destino explícitos (por ejemplo, definition, que vincula un término del glosario empresarial a una columna de tabla).

También puedes adjuntar aspectos directamente a los vínculos de entrada (excepto los vínculos schema-join). Esto te permite describir la relación en sí, como registrar puntuaciones de confianza de combinación, reglas de transformación o notas de asignación.

Knowledge Catalog admite los siguientes tipos de vínculos de entrada integrados:

  • synonym: Conecta conceptos empresariales equivalentes o términos alternativos.
  • related: Conecta recursos con acoplamiento bajo en todos los sistemas.
  • definition: Conecta definiciones de glosario empresarial a columnas o entradas físicas.
  • schema-join: Conecta tablas que se pueden unir a lo largo de clave externa o rutas de acceso del esquema coincidentes.
Es el vínculo de entrada con las entradas, los aspectos y sus tipos vinculados. Es el vínculo de entrada con las entradas, los aspectos y sus tipos vinculados.
Figura 3. Vínculo de entrada con entradas, aspectos y sus tipos vinculados (haz clic para ampliar).

Para obtener más información, consulta la referencia de REST de EntryLinks.

Glosarios y términos empresariales

Un glosario empresarial te permite establecer una taxonomía empresarial formal mediante la definición de glosarios, categorías y términos empresariales.

Con los vínculos de entrada de tipo definition o synonym, puedes asignar términos empresariales directamente a entradas físicas y rutas de acceso de columnas. Cuando los usuarios o los agentes de IA buscan en el catálogo con lenguaje natural, el motor de búsqueda resuelve estos términos empresariales para ubicar los recursos de datos físicos correctos.

Para obtener más información, consulta Administra glosarios empresariales.

Fuentes compatibles Google Cloud

Knowledge Catalog transfiere automáticamente metadatos de las siguientes Google Cloud fuentes. Para algunos servicios, como AlloyDB para PostgreSQL y Cloud SQL, primero debes habilitar la integración de Knowledge Catalog antes de que se puedan transferir los metadatos:

  • Analytics y lakehouse

    • Tablas, vistas, modelos, rutinas, conexiones y conjuntos de datos vinculados, y conjuntos de datos de BigQuery
    • Intercambios y fichas de BigQuery sharing (anteriormente Analytics Hub)
    • Repositorios de Dataform y recursos de código
    • Servicios, base de datos y tablas de Dataproc Metastore
    • Tablas del catálogo de REST de Iceberg (incluidos Google Cloud el IRC del catálogo de tiempo de ejecución de Lakehouse , el IRC de Databricks Unity, el IRC del catálogo de Data Catalog de AWS Glue y el IRC de Snowflake Horizon )

  • IA y aprendizaje automático

    • Modelos, conjuntos de datos, grupos de atributos, vistas de atributos y instancias de la tienda en línea de Vertex AI
  • Inteligencia empresarial

    • Instancias, paneles, elementos de panel, Looks, proyectos de LookML, modelos, Explorar y vistas de Looker (Google Cloud Core) (versión preliminar)
  • Bases de datos

    • Instancias, clústeres y tablas de Bigtable (incluidos los detalles de la familia de columnas)
    • Instancias, bases de datos, tablas y vistas de Spanner
  • Transmisión y mensajería

    • Temas de Pub/Sub
  • Datos no estructurados

  • Bases de datos operativas

Para importar metadatos de una fuente externa a Knowledge Catalog, puedes usar conectores de Knowledge Catalog o una canalización de conectividad administrada. Para obtener más información, consulta Acerca de los conectores de Knowledge Catalog y Descripción general de la conectividad administrada.

Restricciones de proyectos y ubicaciones

Los recursos del catálogo en Knowledge Catalog se encuentran dentro de proyectos y ubicaciones geográficas específicos. Google Cloud Se aplican las siguientes restricciones de alcance:

Recurso Regla de ubicación Regla de proyecto
Entradas La ubicación de la entrada debe coincidir con la ubicación de su EntryType, o el EntryType debe ser global. Puede hacer referencia a tipos de entrada globales o del mismo proyecto.
Aspectos de las entradas El AspectType del aspecto debe almacenarse en la misma ubicación que la entrada, o el AspectType debe ser global. Puede hacer referencia a tipos de aspectos globales o del mismo proyecto.
Vínculos de entrada La ubicación del vínculo de entrada debe coincidir con su EntryLinkType, o el EntryLinkType debe ser global. Puede vincular entradas que residen en diferentes proyectos dentro de la misma organización.
Tipos de entrada Compuesto por tipos de aspectos almacenados en la misma ubicación que el tipo de entrada, o tipos de aspectos que son global. Si un tipo de entrada hace referencia a tipos de aspectos personalizados, los tipos de aspectos deben estar en el mismo proyecto y ubicación.

Feeds de cambios de metadatos

Knowledge Catalog puede transmitir eventos de cambio de metadatos casi en tiempo real con feeds de cambios de metadatos.

Un feed de cambios de metadatos publica notificaciones sobre la creación, las actualizaciones o la eliminación de entradas en un tema de Pub/Sub que configures. Los clientes suscriptores pueden consumir estos eventos para automatizar flujos de trabajo operativos, como activar evaluaciones de calidad de los datos cuando cambia un esquema o actualizar los paneles de administración descendentes.

Para obtener más información, consulta Acerca de los feeds de cambios de metadatos.

Precios

Knowledge Catalog usa el SKU de almacenamiento de metadatos para cobrar el volumen de metadatos almacenados. Para obtener más información, consulta Precios de Knowledge Catalog.

No se cobra por lo siguiente:

  • Crear y administrar recursos del metamodelo del catálogo (tipos de entrada, tipos de aspectos, grupos de entrada, entradas y vínculos de entrada)
  • Llamadas a la API de Search y consultas de búsqueda realizadas en la Google Cloud consola

¿Qué sigue?

Guía de inicio rápido

Descubre recursos y adjunta metadatos de aspectos personalizados a una tabla de BigQuery.

Transferencia

Define tipos de entrada y transfiere metadatos personalizados de bases de datos y canalizaciones externas.

Administración

Crea una taxonomía empresarial y asigna términos directamente a tablas y columnas físicas.

Descubrimiento

Descubre recursos en Google Cloud y fuentes personalizadas con predicados de búsqueda.

Contexto de IA

Recupera metadatos listos para LLM y contexto activo para fundamentar agentes de IA generativa.

Migración

Migra plantillas de etiquetas, entradas personalizadas y flujos de trabajo a Knowledge Catalog.