データ プロファイリングについて

Knowledge Catalog(旧称 Dataplex Universal Catalog)は、BigQuery、Google Cloud Lakehouse Iceberg REST Catalog、SAP Business Data Cloud(BDC)Delta Lake、Hive テーブルを自動的にプロファイリングすることで、データの理解と分析を容易にします。

プロファイリングは、データの詳細なヘルスレポートを取得するようなものです。一般的な値、データの分散状況(分布)、欠落しているエントリの数(null 数)などの主要な統計情報が表示されます。この情報により、分析を迅速に行えます。

データ プロファイリングでは、データが信頼性を維持できるように、データ品質チェックルールを推奨します。

概念モデル

Knowledge Catalog を使用すると、データ プロファイル スキャンを作成することで、データのプロファイルをより深く理解できるようになります。データ プロファイル スキャンは、BigQuery、 Google Cloud Lakehouse Iceberg REST Catalog、SAP BDC Delta Lake、または Hive テーブルを分析して統計的な分析情報を生成する Knowledge Catalog データスキャンの一種です。

次の図は、Knowledge Catalog がデータをスキャンして統計特性を報告する方法を示しています。

データ プロファイル スキャンでは、テーブルデータを分析して統計的特性が報告されます。

データ プロファイル スキャンは、1 つの BigQuery、 Google CloudLakehouse Iceberg REST Catalog、SAP BDC Delta Lake、または Hive テーブルに関連付けられており、テーブルをスキャンしてデータ プロファイリングの結果を生成します。データ プロファイル スキャンでは、いくつかの構成オプションがサポートされています。

構成オプション

このセクションでは、データ プロファイル スキャンの実行に使用できる構成オプションについて説明します。

プロファイリング モード

次のプロファイリング モードから選択できます。

  • 標準: デフォルト モードです。指定したサンプリングとフィルタに基づいてデータをスキャンし、包括的でカスタマイズ可能なプロファイルを提供します。標準モードは、データ特性の詳細な分析と長期的なモニタリングに適しています。

  • 軽量(プレビュー: このモードでは、結果を数秒で返す低レイテンシのプロファイル スキャンが提供されます。速度と費用対効果が最適化されており、次のようなユースケースをサポートします。

    • 即時データ特性で AI エージェントの回答をグラウンディングする
    • グローバル データ検出のために、費用対効果の高い方法でプロファイルを大規模に事前生成する
    • インタラクティブなデータ探索中に迅速な健全性レポートを提供

    軽量モードには次の制限があります。

    • 標準のプロファイリング モードとは異なり、軽量スキャンではスコープ、フィルタ、サンプリング サイズを変更できません。
    • BigQuery ビューと外部テーブルはサポートされていません。
  • 非構造化(プレビュー: このモードでは、Vertex AI Gemini モデルを搭載した非構造化データ(UnstructuredDataProfileSpec)のスタンドアロン データ プロファイル スキャンを使用して、既存の BigQuery オブジェクト テーブルを使用し、非構造化ファイル(Cloud Storage の PDF など)の実際の定性的なコンテンツを分析します。null 数や値の分布などの統計指標を計算する構造化プロファイリング モード(標準と軽量)とは異なり、非構造化データのデータ プロファイル スキャンでは、セマンティック推論を実行してビジネス エンティティ(NodeType)と関係(EdgeType)を抽出し、Graph Profile アスペクト(dataplex-types.global.graph-profile)をカタログ エントリに関連付け、物理 BigQuery テーブルまたはビューへのプログラムによるデータ具体化を可能にします。

    注: 非構造化データのデータ プロファイル スキャンは、Dataplex REST API を使用してのみ一般提供で利用できます。 Google Cloud コンソールと Google Cloud CLI のワークフローはサポートされていません。

    詳細については、非構造化データ インサイトについて非構造化データに検出スキャンを使用する(Cloud Storage 検出スキャンの場合)、非構造化データにデータ プロファイルを使用する(スタンドアロン オブジェクト テーブル プロファイリングの場合)をご覧ください。

スケジュールのオプション

定義した頻度でデータ プロファイル スキャンのスケジュールを設定することも、スキャンをオンデマンドで実行することもできます。スキャンジョブが想定よりも長く実行されている場合は、ジョブをキャンセルできます。

実行 ID

デフォルトでは、Knowledge Catalog は一元化されたサービス エージェント(service-PROJECT_NUMBER@gcp-sa-dataplex.)を使用してデータ プロファイル スキャンを実行します。

このデフォルトの実行 ID は、カスタム サービス アカウント(Bring Your Own Service Account)を指定するか、独自の End-User Credentials(EUC)を使用することでオーバーライドできます。次のようないくつかのメリットがあります。

  • 最小権限の原則: 特定のデータ プロファイリング タスクに必要な Identity and Access Management(IAM)権限のみを専用のサービス アカウントに付与し、過剰なアクセスを最小限に抑えます。
  • きめ細かいアクセス制御: 権限を特定のリソースにスコープ設定し、BigQuery の行レベルと列レベルのアクセス ポリシーとの統合を可能にします。
  • 監査可能性の向上: カスタム サービス アカウントまたはユーザー認証情報を特定のスキャンに割り当てることで、監査ログでのアクティビティの追跡とロギングがより明確になります。
  • 課金の統合: カスタム実行 ID を使用すると、処理料金とストレージ料金が BigQuery に直接一元化されます(Knowledge Catalog Premium SKU はバイパスされます)。これにより、BigQuery の企業割引とスロット コミットメントを利用できます。

カスタム実行 ID の構成方法については、実行 ID を構成するをご覧ください。

ネットワーキングの要件

スキャンを実行するには、スキャンに使用する VPC サブネットプライベート Google アクセスを有効にする必要があります。サブネットを指定しない場合は、デフォルトのサブネットで限定公開の Google アクセスが有効になっていることを確認してください。

範囲

標準プロファイリング スキャンでは、スキャンするデータの範囲を指定できます。

  • テーブル全体: データ プロファイル スキャンでテーブル全体がスキャンされます。サンプリング、行フィルタ、列フィルタは、プロファイリングの統計情報を計算する前にテーブル全体に適用されます。

  • 増分: 指定した増分データがデータ プロファイル スキャンでスキャンされます。増分として使用する Date 列または Timestamp 列をテーブルで指定します。通常、これはテーブルが分割される列です。プロファイリングの統計情報を計算する前に、サンプリング、行フィルタ、列フィルタが増分データに適用されます。

データをフィルタする

標準プロファイリング スキャンでは、行フィルタと列フィルタを使用して、プロファイリング用にスキャンするデータをフィルタできます。フィルタを使用すると、実行時間とコストを削減し、機密データや不要なデータを除外できます。軽量プロファイリング スキャンでは、列フィルタと行フィルタはサポートされていません。

  • 行フィルタ: 行フィルタを使用すると、特定の期間内や特定のセグメント(リージョンなど)のデータにフォーカスできます。たとえば、特定の日付より前のタイムスタンプを持つデータを除外できます。

  • 列フィルタ: 列フィルタを使用すると、テーブルに特定の列を追加または除外して、データ プロファイル スキャンを実行できます。

サンプルデータ

標準プロファイリング スキャンでは、データ プロファイル スキャンを実行するために、データからサンプリングするレコードの割合を指定できます。小さなサンプルデータに対してデータ プロファイル スキャンを作成すると、データセット全体のクエリの実行時間とコストを削減できます。

複数のデータ プロファイル スキャン

Google Cloud コンソールを使用して、一度に複数のデータ プロファイル スキャンを作成できます。1 つのデータセットから最大 100 個のテーブルを選択し、各データセットのデータ プロファイル スキャンを作成できます。詳細については、複数のデータ プロファイル スキャンを作成するをご覧ください。

スキャン結果を BigQuery テーブルにエクスポートする

データ プロファイル スキャン結果を BigQuery テーブルにエクスポートして、さらに分析を行うことができます。レポートをカスタマイズするには、BigQuery テーブルデータを Looker ダッシュボードに接続します。複数のスキャンで同じ結果テーブルを使用することで、集計レポートを作成できます。

データ プロファイリングの結果

データ プロファイリングの結果には、次の値が含まれます。

列の型 データ プロファイリングの結果
数値の列
  • null 値の割合。
  • 一意の(個別の)近似値の割合。
  • 列内の一般的な値の上位 10 個。列内の一意の値の数が 10 個未満の場合(null 値は含まれません)は、10 個未満になる場合があります。これらの上位の一般的な値ごとに、現在のスキャンでスキャンされたデータ内での出現率が表示されます。
  • 平均値、標準偏差、最小値、近似下位四分位値、近似中央値、近似上位四分位値、最大値。
文字列の列
  • null 値の割合。
  • 一意の(個別の)近似値の割合。
  • 列内の一般的な値の上位 10 個。列内の一意の値の数が 10 個未満の場合は、10 個未満になることがあります。
  • 文字列の平均長、最小長、最大長。
ネストされていないその他の列(日付、時刻、タイムスタンプ、バイナリなど)
  • null 値の割合。
  • 一意の(個別の)近似値の割合。
  • 列内の一般的な値の上位 10 個。列内の一意の値の数が 10 個未満の場合は、10 個未満になることがあります。
その他のすべてのネストされた列、または複雑なデータ型の列(Record、Array、JSON など)、または繰り返しモードの列。
  • null 値の割合。

結果には、すべてのジョブでスキャンされたレコードの数が含まれます。

レポートとモニタリング

データ プロファイリングの結果は、次のレポートとメソッドを使用してモニタリングおよび分析できます。

  • BigQuery ページと Knowledge Catalog ページのソーステーブルで公開されたレポート

    BigQuery と Knowledge Catalog に結果を公開するようにデータ プロファイル スキャンを構成すると、BigQuery と Knowledge Catalog の両方で、ソーステーブルの [データ プロファイル] タブで最新のデータ プロファイル スキャンの結果を表示できます。これらの結果には、どのプロジェクトからでもアクセスできます。

    公開されたレポート。

  • 過去のジョブ別レポート

    Knowledge Catalog と BigQuery の [データのプロファイリングと品質] > [データ プロファイル スキャン] ページで、最新のジョブと過去のジョブの詳細レポートを表示できます。これには、列レベルのプロファイル情報と使用された構成が含まれます。

    過去のジョブ別レポート。

  • [分析] タブ

    Knowledge Catalog と BigQuery の [データのプロファイリングと品質] > [データ プロファイル スキャン] ページで [分析] タブを使用すると、複数のプロファイル ジョブにける列の特定の統計情報に関する傾向を確認できます。たとえば、増分スキャンがある場合は、値の平均値の経時的な傾向を確認できます。

    [分析] タブ。

  • 独自のダッシュボードまたは分析を構築する

    BigQuery テーブルに結果をエクスポートするようにデータ プロファイル スキャンを構成した場合は、データポータルなどのツールを使用して独自のダッシュボードを構築できます。

  • Cloud Billing で DCU のコンピューティング費用をモニタリングする

    データ プロファイリング スキャンのコンピューティングはサーバーレス インフラストラクチャで実行され、Cloud Monitoring に時系列指標を出力しません。プロジェクト、スキャン ID、テーブル別にデータ プロファイリング DCU の費用を追跡して帰属させるには、goog-dataplex-datascan-* システムラベルを使用して BigQuery で Cloud Billing エクスポートをクエリします。詳細については、Cloud Billing エクスポートを使用して Dataplex DCU の費用をモニタリングして割り当てるをご覧ください。

制限事項

  • データ プロファイル スキャンは、BigQuery、Lakehouse Iceberg REST カタログ、SAP BDC Delta Lake、Hive テーブルでのみ実行できます。 Google Cloud
  • データ プロファイリングは、BIGNUMERIC を除くすべての列型を持つ BigQuery テーブルでサポートされています。BIGNUMERIC 列を含むテーブルに対して作成されたスキャンは、検証エラーになり、正常に作成されません。
  • Lakehouse テーブルでは、複数のデータ プロファイル スキャンはサポートされていません。

料金

次のステップ