Knowledge Catalog mit BigQuery verwenden
Knowledge Catalog (früher Dataplex Universal Catalog) interagiert mit BigQuery als zentrale Ebene für Datenverwaltung und Agentenzugriff für die Metadaten von BigQuery. Weitere Informationen finden Sie in der Übersicht zu Knowledge Catalog.
Wie verwende ich Knowledge Catalog mit BigQuery?
Knowledge Catalog interagiert auf folgende Weise mit BigQuery.
Automatisierte Metadatenaufnahme
Knowledge Catalog ermittelt und indexiert automatisch technische Metadaten aus BigQuery-Assets. Der Support umfasst
- Asset-Typen: Datasets, Tabellen, Ansichten, Modelle, Routinen, Verbindungen, verknüpfte Datasets und Diagramme (Vorschau).
- BigQuery Sharing: Datenpools und Einträge aus BigQuery Sharing (früher Analytics Hub).
- Echtzeitaktualisierungen: Das System unterstützt die Aufnahme von Daten nahezu in Echtzeit und bietet Feeds für Metadatenänderungen über Pub/Sub, um Downstream-Systeme über Schemaänderungen oder Löschvorgänge in BigQuery zu benachrichtigen.
- Dark Data-Erkennung: Knowledge Catalog kann unstrukturierte Dateien scannen (z. B. PDFs in Cloud Storage), Entitäten extrahieren und in abfragefähige Assets in BigQuery konvertieren. Dadurch werden bisher nicht zugängliche „Dark Data“ für BigQuery-basierte Analysen und KI-Fundierung verfügbar.
Metadatendarstellung und ‑anreicherung
- Einträge: Jede BigQuery-Tabelle oder jedes BigQuery-Asset wird im Katalog als Eintrag und nicht als gesamte Tabelle dargestellt, z. B.
project.dataset.table. - Einbindung der Datenqualitätsübersicht: Knowledge Catalog bietet für jeden Eintrag im Katalog eine Datenqualitätsübersicht. Neben den integrierten Knowledge Catalog-Datenscans sind auch Assertion-Ergebnisse aus Dataform eine Quelle für diese Kurzübersicht (Vorschau).
Automatisierte Metadatenanreicherung: Für Tabellen und Ansichten, die mit Dataform erstellt wurden, können Sie semantische Metadaten direkt in Ihrem Code definieren. Diese Metadaten werden nach erfolgreichem Abschluss einer Pipeline-Aktion (Vorabversion) automatisch mit Knowledge Catalog synchronisiert. Die folgenden Aspekttypen werden unterstützt:
- Übersicht: Dokumentation und Zusammenfassungstext für den Eintrag.
- Allgemeine Aspekte: Semantische Metadatentags für technische Details wie Tabellensystem und Typinformationen.
Wenn Sie den Status einer Metadatenaktualisierung prüfen möchten, folgen Sie der Anleitung unter Letzte manuelle Ausführungen ansehen.
Nachdem die Metadaten synchronisiert wurden, können Sie im Knowledge Catalog nach dem Eintrag suchen und ihn aufrufen. Weitere Informationen finden Sie unter Nach Ressourcen suchen.
Metadaten auf Spaltenebene: Einzelne Spalten oder Felder werden als Pfade dargestellt. So können Sie bestimmten Feldern in einer BigQuery-Tabelle spezifische Metadaten wie PII-Markierungen oder Datenqualitätswerte zuweisen und nicht nur der Tabelle selbst.
Aspekte: Technische Metadaten werden mit Aspekten angereichert, die Daten geschäftlichen Kontext hinzufügen, z. B. Eigentumsrechte, Datenqualität und Dokumentation.
Datenprodukte: Sie können zugehörige BigQuery-Assets in Datenprodukte packen, z. B. E-Commerce-Geschäftsdaten, die gemeinsame Zugriffs- und Governance-Einschränkungen haben.
Datenerkennung und ‑suche
- Semantische Suche: Nutzer können BigQuery-Daten in natürlicher Sprache suchen. Das ist besonders nützlich für Data Scientists und KI-Agenten, um vertrauenswürdige Datenprodukte mit langen oder komplexen Anfragen zu finden.
- Namensübersetzung: Für eine einfachere programmatische Suche ermöglicht das System die Übersetzung von BigQuery-SQL-Namen oder vollqualifizierten Namen in Knowledge Catalog-Eintragsnamen.
Zugriff und Fundierung von KI-Agenten
- Agentenzugriff: KI-Agenten können Knowledge Catalog-Tools über einen lokalen oder Remote-MCP-Server erkennen und adaptiv verwenden.
- Kontext für KI-Agents: Im Knowledge Catalog wird ein Kontextdiagramm erstellt, in dem BigQuery-Datasets mit Geschäftssemantik verknüpft werden. So werden KI-Halluzinationen reduziert, da sichergestellt wird, dass Modelle von Unternehmen genehmigte Daten verwenden.
Governance und Compliance
- Datenherkunft: Knowledge Catalog verfolgt automatisch, wie Daten in BigQuery-Tabellen einfließen und transformiert werden und wie sie aus BigQuery-Tabellen herausfließen und transformiert werden. Diese Funktion ist wichtig, um sensible Informationen wie personenidentifizierbare Informationen in den Daten zu prüfen.
- Zugriffssteuerung:Die Metadatenverwaltung ist in Identity and Access Management (IAM) und VPC Service Controls integriert, um sicherzustellen, dass die Ermittlung und der Zugriff auf BigQuery-Metadaten den Sicherheitsrichtlinien der Organisation entsprechen.
Hinweise zur Migration
Die Migration von Data Catalog (eingestellt) zu Knowledge Catalog umfasst mehrere Schritte. Standardmetadaten aus BigQuery (z. B. Datasets, Tabellen, Ansichten) sind automatisch in Knowledge Catalog verfügbar. Der Migrationsprozess konzentriert sich daher hauptsächlich auf benutzerdefinierte Metadaten, die API-Nutzung und die Standardeinstellungen der Benutzeroberfläche.
Im Folgenden sind die wichtigsten Punkte aufgeführt, die Sie bei der Migration berücksichtigen sollten.
Änderung verstehen
Knowledge Catalog bietet im Vergleich zu Data Catalog erweiterte Funktionen für die Metadatenverwaltung, Governance und Ermittlung. Knowledge Catalog verwendet eine andere API (die Knowledge Catalog API) und ein leicht abweichendes Datenmodell. So werden in Knowledge Catalog beispielsweise Aspekte und Aspekttypen anstelle von Tags und Tag-Vorlagen verwendet.
Aktuelle Nutzung des Datenkatalogs bewerten
- Keine benutzerdefinierten Metadaten: Wenn Sie Knowledge Catalog nur für die automatische Aufnahme und Erkennung von Standard-BigQuery-Metadaten verwendet haben, ohne benutzerdefinierte Tags, Tag-Vorlagen, benutzerdefinierte Einträge oder Eintragsgruppen zu erstellen, ist die Umstellung unkompliziert. Sie können die Knowledge Catalog-Benutzeroberfläche sofort verwenden.
- Benutzerdefinierte Metadaten oder programmatische Verwendung: Wenn Sie benutzerdefinierte Tags oder Vorlagen, benutzerdefinierte Einträge erstellt oder die Data Catalog API, Clientbibliotheken, Google Cloud CLI-Befehle oder Terraform verwendet haben, ist ein strukturierterer Übergang erforderlich.
Spezifische Hinweise zu BigQuery
- Automatische Aufnahme: Technische Metadaten aus BigQuery-Assets (Datasets, Tabellen, Ansichten, Modelle, Routinen und Grafiken) werden weiterhin automatisch in Knowledge Catalog aufgenommen, wie es auch beim Dataplex Universal Catalog der Fall war.
- Richtlinien-Tags: Richtlinien-Tags, die für die Zugriffssteuerung auf Spaltenebene in BigQuery verwendet werden, sind nicht veraltet und ihre Verwaltung erfolgt weiterhin in BigQuery.
- Herkunft: Die Datenherkunft für BigQuery-Vorgänge wird im Knowledge Catalog angezeigt. Weitere Informationen zur Datenherkunft finden Sie unter Datenherkunft für eine BigQuery-Tabelle nachverfolgen.
Umstellungsleitfaden folgen
Wenn Sie zu Knowledge Catalog migrieren möchten, folgen Sie der Anleitung unter Von Data Catalog auf Knowledge Catalog umstellen.
Informationen zum Aktualisieren programmatischer Arbeitsabläufe auf die Knowledge Catalog API finden Sie unter Data Catalog API-Methoden Knowledge Catalog zuordnen.
Nächste Schritte
Weitere Informationen zu Knowledge Catalog: