Knowledge Catalog は、Gemini を活用したコンテキスト レイヤです。データ エステート全体にわたって、ユニバーサル ビジネス コンテキストとアクティブ グラウンディング機能を提供します。構造化データと非構造化データから動的なコンテキスト グラフを構築することで、データチームとデベロッパーがアセットを検出し、データ品質を検証し、生成 AI アプリケーションを安全にグラウンディングして、ハルシネーションを減らすことができます。
Knowledge Catalog の詳細なチュートリアルについては、次の動画をご覧ください。
対象者と前提条件
この概要は、データ エンジニア、コンテキスト エンジニア、データ サイエンティスト、データ スチュワード、AI デベロッパーを対象としています。Knowledge Catalog を使用する前に、次のものが必要です。
BigQuery や Cloud Storage などのデータベース システムとストレージ システムに関する知識。
検索拡張生成(RAG)や Model Context Protocol(MCP)などの生成 AI のコンセプトを基本的なレベルで理解していること。
業界固有のデータの複雑さを解決する
現代の企業では、データは複雑で高度に分散しており、構造化形式と非構造化形式の両方で存在しています。ビジネス リクエストが単一のデータベース スキーマまたはドキュメント ストアにマッピングされることはほとんどありません。これらのサイロを安全に連携させながら、クロスドメインの質問に即座に信頼性の高い回答を提供することは、運用上の大きな課題です。
Knowledge Catalog は、このギャップを埋めるセマンティック基盤として機能し、AI エージェントと分析ツールが根拠のある関連性の高いコンテキストを取得できるようにします。
主なユーザーロール
コンテキスト エンジニア(データ エンジニア)。データベースと Cloud Storage 全体でメタデータの集約を自動化し、リネージで変換を追跡し、拡充と評価のワークフローを構築します。
データ スチュワード(ガバナンス チーム)。AI 生成の説明の人間参加型のレビュー、用語集によるビジネス用語の標準化、カスタム アスペクトの定義により、メタデータの品質を管理し、カタログ エントリにドメイン固有のコンテキストを付加します。
AI デベロッパー。MCP サーバーまたはコンテキスト取得 API を使用して、信頼できるエンタープライズ データ スキーマで LLM と AI アプリケーションをグラウンディングします。
業界でのユースケース
次の表は、実際に発生する複雑な質問、技術的な境界を越える方法、Knowledge Catalog が組織による質問への対応をどのように支援するかを示しています。
| 業種 | データと運用の課題 | 解決するビジネス上の問題 | Knowledge Catalog での対応 |
|---|---|---|---|
| e コマース |
|
「返品率が高く、到着時に破損したことを示すお客様の写真がある電子機器製品を見つけてください。」 | データ形式間のセマンティック グラウンディング: トランザクション データベースからメタデータを自動的に検出し、Cloud Storage ストレージ バケット内の非構造化画像にリンクします。これにより、AI ツールは異なるストレージ システム間でクエリを解決できます。 |
| 製造 |
|
「前四半期に安全チェックに合格しなかった西部の機械に関連するすべての検査レポートの概要を生成して。」 | 地域別および非構造化クロール: アセットのメタデータとともに非構造化 PDF 検査レポートをクロールしてカタログ化し、生成 AI エージェントが地域別にレポートを検索、コンパイル、要約できるようにします。 |
| 医療 |
|
「最近の検査結果と予約頻度を考慮すると、30 日以内の再入院のリスクが最も高い患者は誰ですか?」 | データ品質とリネージ: 電子カルテ フィード全体で行レベルのデータ品質プロファイリングとリネージ マップを計算します。これにより、臨床予測モデルが検証済みの高品質な患者のバイタルデータのみに依存するようにします。 |
| 金融サービス |
|
「収益上位 10 社の顧客のうち、パフォーマンスの問題について苦情を申し立てたのはどの顧客か。また、そのことが第 3 四半期の予測にどのように影響するか。」 | 統合コンテキスト グラフ: 顧客レコード、サポート フィードバック、財務テーブルを統合し、自然言語クエリでクライアントの収益統計と非構造化フィードバック ファイルを結合して、財務への影響を予測できます。 |
こうした運用上の課題に対処するため、Knowledge Catalog には、データ エンジニア、データ サイエンティスト、AI デベロッパーが管理されたデータシステムを構築するのに役立つ主要な機能が用意されています。
Model Context Protocol(MCP)を使用して AI エージェントをグラウンディングします。ローカルまたはリモート MCP サーバーを使用して、メタデータ、スキーマ、リネージ、ビジネスルールを AI エージェントに直接公開します。これらのサーバーにより、モデルはアクションを提案する前に運用上の期待値を検証できます。
AI と分析の検出を高速化します。自然言語セマンティック検索を使用して、関連性の高いデータアセットを見つけます。生成された概要と推奨事項により、ユーザーは手動のドキュメント レビューを待たずにデータを見つけることができます。
非構造化データからコンテキストを抽出する。Cloud Storage の PDF などの非構造化ファイルを自動的に解析して、エンティティと関係を抽出し、BigQuery のクエリ可能なアセットに変換して、会話型エージェントをサポートします。
データ プロダクトを大規模に管理する。アセットのコレクションをサービスレベル契約(SLA)、契約、所有権の詳細、使用上の注意とともに、検索とサブスクリプション用の単一の管理対象ユニットにパッケージ化します。
Knowledge Catalog の仕組み
Knowledge Catalog は、3 つの柱からなるライフサイクルを通じて、データ管理とコンテキストを統合します。次の図は、サービスが AI エージェントのグラウンディング用に物理データ アセットをビジネス セマンティクスにマッピングする方法を示しています。
これらのメタデータ コンセプトの詳細については、メタデータについてをご覧ください。
以降のセクションでは、メタデータ ライフサイクルの 3 つの柱について説明し、小売業者がデータベース テーブル、ファイル、外部カタログ エントリにそれらを適用する方法を示します。
集計(検出と取り込み)。Knowledge Catalog は、基盤となるデータを移動することなく、データ資産全体でテクニカル メタデータを自動的にクロールしてインデックス登録します。
- 組み込みデータベース。自動カタログ作成では、BigQuery、AlloyDB for PostgreSQL、Spanner などのプラットフォーム全体でスキーマと属性がキャプチャされます。
- マネージド接続。カスタム パイプラインを作成せずに、Oracle や PostgreSQL などの外部システムや、Collibra などのパートナー レジストリから定義を取り込みます。
- データリネージ: パイプライン全体の列レベルの変換を追跡して、データの出所と変更方法を追跡します。
- 例: ある小売企業が、
ordersテーブルやorder_itemsテーブルなどのトランザクション データベース メタデータを自動的に取り込み、Cloud Storage バケットに保存されている非構造化商品ファイルをインデックス登録します。外部データベースをリンクして、検出可能なディレクトリの下に統合メタデータ インデックスを確立します。
メタデータの集計とデータの取り込みの詳細(クリックして展開)
- サポートされているデータソース: 自動取り込み用にサポートされているすべての Google Cloud と外部ソースを一覧表示します。
- マネージド接続の概要: 外部システムから技術スキーマを取り込む方法について説明します。
- データリネージを追跡する: 列レベルのパイプライン変換とデータフローを可視化する方法について説明します。
拡充(コンテキストをキュレートし、信頼性を検証)。Knowledge Catalog は、技術構造にビジネス上の意味を付加し、信頼シグナルを確立します。
- AI 生成の分析情報。Gemini はクエリログを分析して、列の説明、テーブルの概要、推奨される結合を生成します。
- 非構造化インデックス。ファイル ディレクトリをクロールして、PDF や画像などの非構造化アセットからエンティティと接続を抽出します。
- 用語集とアスペクト。ビジネス用語と論理テンプレートを使用して、内部指標名を共有語彙にマッピングします。
- データ品質と異常検出。クリーンネス ガイドラインを適用し、ML スキャンを実行して統計的な外れ値やデータの鮮度に関する問題を検出し、信頼性の高いシグナルを生成します。
- ガバナンス レビュー。ワークフローの審査プロセスを使用して、公開前にメタデータの更新を検証することで、リスクを管理します。
- 例: 小売チームは、データ分析情報をトリガーして列の説明を推奨し、データ品質ルールを実行することで、アセットを拡充します。ビジネス定義をアクティブな注文にマッピングするには、用語集とアスペクトを作成します。
メタデータの拡充と信頼性の検証の詳細(クリックして展開)
- データ分析情報を構成する: データセットの説明と概要を自動的に生成する方法について説明します。
- ビジネス用語集を管理する: 標準用語とビジネス用語をカスタマイズする方法について説明します。
- アスペクトを使用してメタデータを拡充する: 構造化されたメタデータ プロパティを論理アセットに関連付ける方法を示します。
- データ品質ルールを再利用する: データベースの検証ルールを確立して再利用する方法について説明します。
- データ プロファイリングの概要: スキーマの異常と統計的ドリフトのスキャンを構成する方法について説明します。
検索と検索(アクセスとグラウンディング)。AI アプリケーションとビジネス ユーザーは、統合コンテキスト グラフをクエリしてデータに安全にアクセスします。
- グラウンディング エージェント。LLM ベースのアプリとエージェントをカタログに接続します。
- Context API。低遅延グラウンディング ペイロード リクエストを実行します。
- セマンティック検索。自然言語クエリを使用して適切なアセットを見つけます。
- データ パッケージング。テーブル、ライセンスの詳細、SLA のコレクションを安全なセルフサービス データ パッケージにバンドルします。
- 例: アナリストが自然言語のセマンティック検索を実行してアセットを見つけます。AI アプリケーションは、MCP サーバーまたはコンテキスト取得 API を使用してこのインデックスを安全に消費し、高品質のアセットは安全なビューにパッケージ化されます。
コンテキストの取得とエージェントのグラウンディングの詳細(クリックして展開)
- Model Context Protocol(MCP)の概要: 生成 AI エージェントとアプリケーション レイヤを Knowledge Catalog コンテキストにブリッジする方法について説明します。
- LookupContext を使用してコンテキストを取得する: エージェント プロンプト用の重要なオペレーション ペイロードを抽出する方法を示します。
- アセットの検索: 自然言語のセマンティック クエリ構文を使用したアセット検索機能について説明します。
Google Cloud と AI エコシステムの Knowledge Catalog
データ基盤を構築する際は、Knowledge Catalog が関連サービスとどのように統合されるかを理解することが不可欠です。
Google Cloud データベースとモデル
- BigQuery。Knowledge Catalog は、BigQuery のデータセット、テーブル、ビューを自動的にクロールしてインデックス登録します。Gemini を活用したデータ分析情報がトリガーされ、クエリ履歴と公開された説明が分析され、検証済みのクエリ例が提案されます。
- Looker(Google Cloud コア)。Knowledge Catalog は、Looker ダッシュボード、Look、LookML 構造(ビュー、Explore、ディメンション、メジャーなど)を取り込みます。この取り込みでは、運用値がビジネス セマンティクスにどのようにマッピングされるかを追跡するためのリネージ マッピングが構築されます。
- Lighthouse ランタイム カタログ。Knowledge Catalog は、オープンソースの Iceberg ワークロードのランタイム メタストアである Lighthouse と統合されています。Lighthouse ワークロードの上に技術メタデータを自動的にインデックス登録し、統合されたアクティブ コンテキストを提供します。
AI エージェント プラットフォームとアシスタント
- 会話分析。分析インターフェースは、カタログ用語とルックアップ ツールを使用して、ユーザーが検証済みのグラウンディングで自然言語でビジネス指標をクエリできるようにします。
- AI エージェント向けの Gemini。高精度のアシスタント エージェントは、カタログ メタデータを使用してデータベース ルックアップを実行し、ハルシネーションを減らします。
- Gemini Enterprise Agent Platform。Knowledge Catalog は、ターゲット プラットフォーム環境内の中央データ ガバナンス標準として機能します。Gemini Enterprise Agent Platform と相互リンクして、プラットフォームの Agent Registry にツールとコンテキストをフィードします。
Google Cloud データベースと AI サービスの統合
Knowledge Catalog は、他のGoogle Cloud プロダクトと連携してデータ基盤を形成します。次の表は、Knowledge Catalog が関連サービスとどのように統合され、補完されるかを示しています。
| サービス | プライマリ ロール | Knowledge Catalog との統合方法 |
|---|---|---|
| Knowledge Catalog | ガバナンスとエージェントのコンテキスト | 統合されたセマンティック コンテキスト グラフとして機能し、データ品質チェック スキャンを実行して、グラウンディングされたスキーマを AI モデルとアプリケーションに公開します。 |
| BigQuery | エンタープライズ データ ウェアハウジング | データセットの保存、クエリ、処理を行います。これらのテーブルを自動的にクロール、インデックス登録し、ビジネス分類の側面で強化します。 |
| Vertex AI | AI モデルの開発 | 基盤モデルを構築、デプロイ、ホストします。カスタム エージェントは、メタデータ コンテキストを取得して論理的推論の根拠とします。 |
| Cloud Storage | 非構造化ファイル ストレージ | 未加工の非構造化ファイルを保存します。非構造化検出スキャンを自動的に実行して、PDF と画像を解析し、関係マップを構築します。 |
セマンティクスとデータ形式
エージェント型システムを効果的に指示してグラウンディングするには、物理データ構造とセマンティックな意味を区別する必要があります。
- セマンティクス。データに関連付けられたビジネス上の意味、意図、関係。技術スキーマは、データベースの型、文字長、整数制約などの構造ストレージ仕様を定義しますが、セマンティクスはデータセットが実際に何を表しているかを記述します。たとえば、
txn_qtyという名前の列を「購入数量」のビジネス定義にマッピングできます。 - 構造化データ。定義されたスキーマとリレーショナル形式で保存された情報。たとえば、BigQuery テーブル、Spanner データベース、運用 Postgres テーブルなどがあります。Knowledge Catalog は、このメタデータを自動的にクロールし、列と制約を記録します。
- 非構造化データ。構造スキーマのない未フォーマットのテキストやメディア ファイルを含む情報。たとえば、PDF データシート、顧客サポートのメール、Cloud Storage に保存された画像などがあります。Knowledge Catalog は、非構造化データ分析情報を使用して検出スキャンを実行し、基盤となるエンティティ関係を抽出して、グラフ プロファイルに記録します。これは、AI によって抽出されたエンティティ関係ノードとエッジを含む特殊なアスペクトです。
Agentic Data Cloud コンテキスト オーケストレーション
Google の Agentic Data Cloud フレームワーク内では、Knowledge Catalog はセマンティック オーケストレーション プレーンとして機能します。コンテキスト エンジンは、デベロッパーがデータベース スキーマとルールをプロンプトに手動でハードコードする必要がないように、エージェントがインテリジェントな意思決定を行うために必要な正確なセマンティック コンテキストを動的に提供します。
次の図は、Knowledge Catalog がデータ コンテキストをオーケストレートして配信する仕組みを示しています。
コンテキスト オーケストレーション ワークフローは、次のフェーズで構成されます。
- 取り込みと検出。運用データベース、Spanner や BigQuery などのウェアハウス、Cloud Storage などの非構造化オブジェクト ストア、Lighthouse などのランタイム メタストアは、技術スキーマ、リネージ マップ、メタデータ定義を Knowledge Catalog に直接フィードします。
- コンテキスト マッピング。Knowledge Catalog 内では、これらのメタデータ プロパティは、技術的な側面、ビジネス用語集、検証済みのクエリなどのセマンティック要素にリンクされ、アクティブなコンテキスト グラフを組み立てます。
- 配信インターフェース。AI アプリケーションとオーケストレーターは、MCP や直接
LookupContextAPI エンドポイントなどの標準コネクタを使用して、この統合コンテキスト グラフをプログラムで取得します。 - エージェントのグラウンディング。Agent Development Kit(ADK)や LangChain などのオーケストレーション フレームワークは、このメタデータ コンテキストを LLM プロンプトに直接挿入します。このインジェクションにより、エージェントの推論が検証済みの組織ルールに基づいて行われるため、ハルシネーションを起こすことなくデータベースのクエリや自動アクションの実行が可能になります。
AI エージェント プロファイル
自動化するワークフローに応じて、Knowledge Catalog を活用したさまざまなクラスのエージェントを構築できます。
- データ検出エージェント。これらのアシスタントは、ユーザーがデータ資産を検索してナビゲートするのに役立ちます。キーワードのマッチタイプを使用する代わりに、自然言語の長い形式のインテントと制約を分析して、最も関連性の高い物理アセットを取得します。
- メタデータ拡充エージェント。これらのバックグラウンド エージェントは、Wiki、README ファイル、チャットログから非構造化テキストを取り込み、テキストを正式なメタデータに解析し、メタデータを Knowledge Catalog のアスペクトとして書き込んで、メタデータを最新の状態に保ちます。
- データ品質とパイプライン エージェント。これらの自律エージェントは、データリネージとプロファイル統計情報をクエリして、品質ルールを評価し、スキーマのドリフトを検出し、データ変換パイプラインを構築または修復します。
オーケストレーション ツール
これらのエージェントを構築して統合するには、次のツールを使用します。
- Model Context Protocol(MCP)。エージェントを外部リソースにリンクするための標準化されたオープン プロトコル。リモート MCP サーバーまたはローカル MCP ツールボックスを使用して、カタログに接続するようにエージェントを構成できます。詳細については、Knowledge Catalog の Model Context Protocol(MCP)についてをご覧ください。
- Agent Development Kit(ADK)。生成 AI エージェントの構築、実行、テストを簡素化する Google のフレームワーク。Catalog Service API への組み込みバインディングを提供します。詳しくは、 ADK のホームページをご覧ください。
- LookupContext API。データアセットの統合された YAML または JSON コンテキスト ペイロードを抽出し、LLM プロンプトに直接挿入できる REST と gRPC の API エンドポイント。詳細については、LookupContext API を使用してコンテキストを取得するをご覧ください。
MCP を使用したアクセス コンテキスト
Model Context Protocol(MCP)は、AI エージェントとツールを Knowledge Catalog などのデータソースにシームレスに接続できる標準化されたブリッジです。次の比較表を使用して、統合に最適なオプションを判断します。
| 実装 | 最適な用途 | キーの詳細 | エンドポイントまたは設定 |
|---|---|---|---|
| リモート MCP サーバー | クラウド ファーストのデプロイ、Cloud Run などのサーバーレス環境、マネージド外部サービス。 | ローカル サーバー管理が不要な Google がホストするエンドポイント。 | エンドポイント: https://dataplex.googleapis.com/mcp設定については、リモート MCP サーバーを使用するをご覧ください。 |
| ローカル MCP ツールボックス | ローカル エージェント開発、迅速なプロトタイピング、VS Code や Cursor などのデスクトップ IDE 統合。 | ワークスペース環境と Knowledge Catalog 間のローカル プロキシとして機能するコマンドライン ツール。 | バイナリのインストールと .mcp.json 設定が必要です。設定については、ローカル MCP サーバーを使用するをご覧ください。 |
エージェント データ コンテキストのベスト プラクティス
信頼性の高いエージェント エクスペリエンスを構築するには、Knowledge Catalog でメタデータを整理してクエリを実行する際に、次のベスト プラクティスを念頭に置いてください。
- アスペクトを追加します。AI エージェントは、名前だけでは本番環境の公式テーブルとサンドボックスの一時的なモックアップを区別できません。カスタム トラスト シグナル アスペクトを定義して適用し、信頼できるデータ プロダクトを認定します。これにより、エージェントがこれらのリソースに対するクエリを優先または制限できるようになります。
- コンテキスト予算を使用してルックアップを最適化します。
LookupContextAPI を呼び出すときに、context_budgetパラメータを指定します。API は、リネージや主な説明など、最も重要なメタデータを最初に最適化して、指定されたトークン制約内に収めます。 - 関連リソースを提供して結合パスを公開します。コンテキストに関する問い合わせでは、関連するテーブルまたはアセットを 10 個までリストします。アセットのグループを指定すると、コンテキスト エンジンが結合パスと関係を自動的に入力し、エージェントがテーブルのインターフェースを理解できるようになります。
- セマンティック用語集を構造化する。ビジネス用語集の用語と略語を標準化します。この標準化により、会話型ツールはビジネス固有の同義語や指標を正確に解決できます。
- ゴールデン クエリを公開する。検証済みの自然言語クエリとそれに対応する正しい SQL を Knowledge Catalog エントリに直接関連付けます。これらの検証済みのテンプレートに基づいて推論を行うことで、テキストから SQL へのエージェントで SQL 変換エラーが発生するのを防ぐことができます。
Dataplex Universal Catalog から Knowledge Catalog に移行する
Dataplex Universal Catalog は Knowledge Catalog に進化しました。この移行の詳細については、Dataplex Universal Catalog から Knowledge Catalog への移行をご覧ください。
制限事項
デプロイを計画する際は、次の制限事項を考慮してください。
サポートされている統合。Knowledge Catalog は主要なサードパーティ システムをサポートしていますが、特定の自動セマンティック抽出は組み込みの Google Cloud サービスに限定される場合があります。
割り当て上限。コンテキスト取得とメタデータ抽出オペレーションには、標準の Google Cloud API 割り当てが適用されます。
次のステップ
MCP を使用してエージェントをグラウンディングする
Model Context Protocol を使用して、AI エージェントとデベロッパー ツールを Knowledge Catalog に接続します。