在 Lakehouse 运行时目录中创建包含元数据的 Apache Iceberg 表

本文档介绍了如何运行 Managed Service for Apache Spark SQL 和 PySpark 批量工作负载,以创建元数据存储在 Lakehouse 运行时目录中的 Apache Iceberg 表。 如需了解运行 Spark 代码的其他方法,请参阅 在 BigQuery 笔记本中运行 PySpark 代码运行 Apache Spark 工作负载

准备工作

如果您尚未创建项目和 Cloud Storage 存储桶,请先创建这些资源。 Google Cloud

  1. 设置项目

    1. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

      Roles required to select or create a project

      • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
      • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

      Go to project selector

    2. Enable the Dataproc, BigQuery, and Cloud Storage APIs.

      Roles required to enable APIs

      To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

      Enable the APIs

  2. 在项目中创建 Cloud Storage 存储桶

    1. 在 Google Cloud 控制台中,前往 Cloud Storage 存储分区 页面。

      进入“存储分区”

    2. 点击 创建
    3. 创建存储桶 页面上,输入您的存储桶信息。要转到下一步 ,请点击继续
      1. 开始使用 部分,执行以下操作:
        • 输入符合 存储桶命名要求的全局唯一的名称。
        • 如需添加 存储桶标签, 请展开 标签 部分 (), 点击 添加标签,并为标签指定 keyvalue
      2. 选择数据存储位置 部分,执行以下操作:
        1. 选择位置类型
        2. 位置类型下拉菜单中选择一个位置,用于永久存储存储桶的数据。
        3. 如需设置 跨存储桶复制,请选择 通过 Storage Transfer Service 添加跨存储桶复制 ,然后 按照以下步骤操作:

          设置跨存储桶复制

          1. 存储桶 菜单中,选择一个存储桶。
          2. 复制设置 部分中, 点击配置 以配置 复制作业的设置。

            系统会显示配置跨存储桶复制 窗格 显示。

            • 如需按对象名称前缀过滤要复制的对象, 请输入要用于包含或排除对象的前缀,然后点击 添加前缀
            • 如需为复制的对象设置存储类别, 请从存储类别菜单中选择一个存储类别。 如果您跳过此步骤,则复制的对象会默认使用 目标存储桶的存储类别。
            • 点击完成
      3. 选择数据存储位置 部分中,执行以下操作:
        1. 为存储桶选择默认存储类别,或者选择Autoclass对存储桶数据进行自动存储类别管理。
        2. 如需启用 分层命名空间,请在 针对数据密集型工作负载优化存储 部分中,选择 在此存储桶上启用分层命名空间
      4. 选择如何控制对对象的访问权限 部分中,选择 存储桶是否强制执行禁止公开访问, 然后为存储桶对象选择访问权限控制方法
      5. 选择如何保护对象数据 部分中,执行以下操作:
        • 数据保护 下,选择您要为存储桶设置的任何选项。
          • 如需启用 软删除,请点击 软删除政策(用于数据恢复) 复选框, 然后指定您希望在删除对象后保留对象的天数。
          • 如需设置 对象版本控制,请点击 对象版本控制(用于版本控制) 复选框, 然后指定每个对象的最大版本数以及非当前版本过期的天数。
          • 如需对对象和存储分区启用保留政策,请点击保留(用于合规性) 复选框,然后执行以下操作:
            • 如需启用 对象保留锁定,请点击 启用对象保留 复选框。
            • 如需启用存储桶锁定,请点击设置存储桶保留政策 复选框,然后为保留期限选择时间单位和时间长度。
        • 如需选择对象数据的加密方式,请展开 数据加密 部分 (),然后选择 数据加密 方法
    4. 点击创建

  3. Compute Engine 默认服务账号 PROJECT_NUMBER-compute@ 授予BigQuery Data Editor (roles/bigquery.dataEditor)角色。如需查看相关说明,请参阅 授予单个角色

    Google Cloud CLI 示例:

    gcloud projects add-iam-policy-binding PROJECT_ID \
        --member PROJECT_NUMBER-compute@ \
    --role roles/bigquery.dataEditor
    

    注意:

    • PROJECT_IDPROJECT_NUMBER 列在 项目信息 部分中,位于 Google Cloud 控制台 信息中心

OSS 资源到 BigQuery 资源的映射

请注意以下开源资源与 BigQuery 资源术语之间的映射:

OSS 资源 BigQuery 资源
命名空间、数据库 数据集
分区表或未分区表 表格
视图 视图

创建 Iceberg 表

本部分介绍了如何使用 Managed Service for Apache Spark Spark SQL 和 PySpark 批量工作负载,在 Lakehouse 运行时目录中创建包含元数据的 Iceberg 表。

Spark SQL

运行 Spark SQL 工作负载以创建 Iceberg 表

以下步骤介绍了如何运行 Managed Service for Apache Spark SQL 批量工作负载,以创建表元数据存储在 Lakehouse 运行时目录中的 Iceberg 表。

  1. 在本地或 Cloud Shell 中将以下 Spark SQL 命令复制到 iceberg-table.sql 文件中。

    USE CATALOG_NAME;
    CREATE NAMESPACE IF NOT EXISTS example_namespace;
    USE example_namespace;
    DROP TABLE IF EXISTS example_table;
    CREATE TABLE example_table (id int, data string) USING ICEBERG LOCATION 'gs://BUCKET/WAREHOUSE_FOLDER';
    INSERT INTO example_table VALUES (1, 'first row');
    ALTER TABLE example_table ADD COLUMNS (newDoubleCol double);
    DESCRIBE TABLE example_table;
    

    替换以下内容:

    • CATALOG_NAME:Iceberg 目录名称。
    • BUCKETWAREHOUSE_FOLDER:用作 Iceberg 数据仓库目录的 Cloud Storage 存储桶 和文件夹。
  2. 在本地或 Cloud Shell 中,从包含 iceberg-table.sql 的目录运行以下命令,以提交 Spark SQL 工作负载。

    gcloud dataproc batches submit spark-sql iceberg-table.sql \
        --project=PROJECT_ID \
        --region=REGION \
        --deps-bucket=BUCKET_NAME \
        --version=2.2 \
        --subnet=SUBNET_NAME \
        --properties="spark.sql.catalog.CATALOG_NAME=org.apache.iceberg.spark.SparkCatalog,spark.sql.catalog.CATALOG_NAME.catalog-impl=org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog,spark.sql.catalog.CATALOG_NAME.gcp_project=PROJECT_ID,spark.sql.catalog.CATALOG_NAME.gcp_location=LOCATION,spark.sql.catalog.CATALOG_NAME.warehouse=gs://BUCKET/WAREHOUSE_FOLDER"
      

    注意:

    • PROJECT_ID:您的 Google Cloud 项目 ID。 项目 ID 列在项目信息 部分中,位于 控制台 Google Cloud 信息中心
    • REGION:用于运行工作负载的可用 Compute Engine 区域
    • BUCKET_NAME:Cloud Storage 存储桶的名称。Spark 会先将工作负载依赖项上传到此存储桶中的 /dependencies 文件夹,然后再运行批量工作负载。WAREHOUSE_FOLDER 位于此存储桶中。
    • --version :Managed Service for Apache Spark 运行时版本 2.2 或更高版本。
    • SUBNET_NAMEREGION 中的 VPC 子网的名称。如果您省略此标志,Managed Service for Apache Spark 会在会话区域中选择 default 子网。Managed Service for Apache Spark 会在 子网中启用 专用 Google 访问通道 (PGA)。如需了解网络连接要求,请参阅 Managed Service for Apache Spark 网络配置
    • LOCATION:受支持的 BigQuery 位置。 默认位置为“US”。
    • --properties 目录属性
  3. 查看 BigQuery 中的表元数据

    1. 在 Google Cloud 控制台中,前往 BigQuery 页面。

      进入 BigQuery Studio

    2. 查看 Iceberg 表元数据。

PySpark

以下步骤介绍了如何运行 Managed Service for Apache Spark PySpark 批量工作负载,以创建表元数据存储在 Lakehouse 运行时目录中的 Iceberg 表。

  1. 在本地或 Cloud Shell 中将以下 PySpark 代码复制到 iceberg-table.py 文件中。
    from pyspark.sql import SparkSession
    spark = SparkSession.builder.appName("iceberg-table-example").getOrCreate()
    
    catalog = "CATALOG_NAME"
    namespace = "NAMESPACE"
    
    spark.sql(f"USE `{catalog}`;")
    spark.sql(f"CREATE NAMESPACE IF NOT EXISTS `{namespace}`;")
    spark.sql(f"USE `{namespace}`;")
    
    # Create table and display schema
    spark.sql("DROP TABLE IF EXISTS example_iceberg_table")
    spark.sql("CREATE TABLE example_iceberg_table (id int, data string) USING ICEBERG") 
    spark.sql("DESCRIBE example_iceberg_table;")
    
    # Insert table data.
    spark.sql("INSERT INTO example_iceberg_table VALUES (1, 'first row');")
    
    # Alter table, then display schema. 
    spark.sql("ALTER TABLE example_iceberg_table ADD COLUMNS (newDoubleCol double);")
    spark.sql("DESCRIBE example_iceberg_table;")

    替换以下内容:

    • CATALOG_NAMENAMESPACE:Iceberg 目录名称 和命名空间组合起来,用于标识 Iceberg 表 (catalog.namespace.table_name)。
  2. 在本地或 Cloud Shell 中,从包含 iceberg-table.py 的目录运行以下命令,以提交 PySpark 工作负载。
    gcloud dataproc batches submit pyspark iceberg-table.py \
        --project=PROJECT_ID \
        --region=REGION \
        --deps-bucket=BUCKET_NAME \
        --version=2.2 \
        --subnet=SUBNET_NAME \
        --properties="spark.sql.catalog.CATALOG_NAME=org.apache.iceberg.spark.SparkCatalog,spark.sql.catalog.CATALOG_NAME.catalog-impl=org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog,spark.sql.catalog.CATALOG_NAME.gcp_project=PROJECT_ID,spark.sql.catalog.CATALOG_NAME.gcp_location=LOCATION,spark.sql.catalog.CATALOG_NAME.warehouse=gs://BUCKET/WAREHOUSE_FOLDER"
        

    注意:

    • PROJECT_ID:您的 Google Cloud 项目 ID。 项目 ID 列在项目信息 部分中,位于 控制台 Google Cloud 信息中心
    • REGION:用于运行工作负载的可用 Compute Engine 区域
    • BUCKET_NAME:Cloud Storage 存储桶的名称。Spark 会先将工作负载依赖项上传到此存储桶中的 /dependencies 文件夹,然后再运行批量工作负载。
    • --version :Managed Service for Apache Spark 运行时版本 2.2 或更高版本。
    • SUBNET_NAME: 中的 VPC 子网的名称。REGION如果您省略此标志,Managed Service for Apache Spark 会在会话区域中选择 default子网。Managed Service for Apache Spark 会在 子网中启用专用 Google 访问通道 (PGA)。如需了解网络连接要求,请参阅 Managed Service for Apache Spark 网络配置
    • LOCATION:受 支持的 BigQuery 位置。 默认位置为“US”。
    • BUCKETWAREHOUSE_FOLDER:用作 Iceberg 数据仓库目录的 Cloud Storage 存储桶 和文件夹。
    • --properties目录属性
  3. 查看 BigQuery 中的表架构。
    1. 在 Google Cloud 控制台中,前往 BigQuery 页面。 进入 BigQuery Studio
    2. 查看 Iceberg 表元数据。