数据同步概览

借助数据同步功能,您可以直接在 AlloyDB for PostgreSQL 集群中创建 BigQuery 分析数据的可写托管副本。此功能会按照您定义的时间表,自动定期将数据仓库中的数据刷新到运营数据库中。

通过将表直接同步到 AlloyDB,您无需构建、管理和维护复杂的自定义数据流水线,即可将分析数据从 BigQuery 转移到运营数据库。

数据同步的运作方式

数据同步使用 alloydb_sync 扩展程序来自动执行数据复制。创建同步表时,AlloyDB 会设置一个本地只读表,并安排后台工作器定期从 BigQuery 中的来源拉取更新后的数据。

您的客户端应用直接在 AlloyDB 中查询本地同步表,从而受益于低查询延迟时间、AlloyDB 列式引擎以及跨读取池的横向扩展,而无需通过网络将查询发送到 BigQuery。

使用场景

当您需要将 BigQuery 中的分析数据提供给需要高吞吐量、低延迟和交互式性能的运营数据库的应用时,请同步表。

常见用例包括下列各项:

  • 高并发应用服务:向数千名并发用户提供分析洞见。通过将数据同步到 AlloyDB 并使用读取池进行横向伸缩,您可以绕过 BigQuery 的并发查询和连接限制。
  • 性能加速:使用 AlloyDB 列式引擎和本地缓冲区缓存处理数据,实现亚秒级查询响应时间。
  • 自动数据镜像:自动按计划刷新 BigQuery 中的分析数据,无需手动编排批处理 ETL 作业。
  • 启用 AI 和运营工作流:将分析数据具体化到 AlloyDB 中,以生成向量嵌入、运行相似性搜索,并使用 AlloyDB AI 为智能体工作流提供支持。

架构和数据传输

alloydb_sync 扩展程序使用后台工作器根据您配置的计划定期将数据从 BigQuery 流式传输到 AlloyDB 集群中的本地表。然后,应用以低延迟查询本地表。

下图说明了数据同步架构。

流程图:显示数据如何通过预定的同步作业从 BigQuery 迁移到 AlloyDB。
图 1. 同步表的架构和数据传输

数据类型映射

当您将数据从 BigQuery 同步到 AlloyDB 时,AlloyDB 会将 BigQuery 数据类型映射到相应的 PostgreSQL 数据类型。

在创建同步表之前,请验证源 BigQuery 列是否使用受支持的数据类型。如需查看映射和支持的类型的完整列表,请参阅支持的数据类型映射

价格

使用数据同步时, Google Cloud 会根据以下组件向您收取费用。如需了解详情,请参阅将 BigQuery 数据同步到 AlloyDB

  • AlloyDB:AlloyDB 实例和本地同步表使用的存储空间按标准价格收费。
  • BigQuery:在 alloydb_sync 刷新作业期间执行的查询和数据流会产生标准 BigQuery 分析费用和 BigQuery Storage API 费用。
  • Cloud Storage:当您同步 Cloud Storage 中 Apache Iceberg 表的数据时,需要按标准存储和数据检索费率付费。

限制

数据同步具有以下限制:

  • 数据新鲜度:同步表中的数据反映了自上次完成刷新以来源 BigQuery 表的状态。
  • PostgreSQL 版本:使用 alloydb_sync 扩展程序进行数据同步仅适用于 PostgreSQL 版本 18。
  • 数据类型兼容性:源列必须映射到受支持的 PostgreSQL 数据类型。对于不受支持的复杂类型(例如 ARRAYBYTESVECTORGEOGRAPHY),您需要在同步之前在 BigQuery 视图中转换或转换列。

后续步骤