Présentation de la synchronisation des données

La synchronisation des données vous permet de créer une copie gérée et accessible en écriture de vos données analytiques BigQuery directement dans votre cluster AlloyDB pour PostgreSQL. Cette fonctionnalité actualise automatiquement et périodiquement les données de votre entrepôt de données dans votre base de données opérationnelle selon une planification que vous définissez.

En synchronisant les tables directement dans AlloyDB, vous n'avez plus besoin de créer, de gérer ni de maintenir des pipelines de données personnalisés complexes pour transférer des données analytiques de BigQuery vers votre base de données opérationnelle.

Fonctionnement de la synchronisation des données

La synchronisation des données utilise l'extension alloydb_sync pour automatiser la réplication des données. Lorsque vous créez une table synchronisée, AlloyDB configure une table locale en lecture seule et planifie des tâches en arrière-plan pour extraire périodiquement les données mises à jour de la source dans BigQuery.

Vos applications clientes interrogent directement la table synchronisée locale dans AlloyDB, ce qui vous permet de bénéficier d'une faible latence des requêtes, du moteur de données en colonnes AlloyDB et d'un scaling horizontal sur les pools de lecture sans envoyer de requêtes sur le réseau vers BigQuery.

Cas d'utilisation

Synchronisez les tables lorsque vous devez diffuser des données analytiques de BigQuery vers des applications qui nécessitent le haut débit, la faible latence et les performances interactives d'une base de données opérationnelle.

Voici quelques cas d'utilisation courants :

  • Diffusion d'applications à forte concurrence : diffusez des insights analytiques à des milliers d'utilisateurs simultanés. En synchronisant les données avec AlloyDB et en effectuant un scaling horizontal avec des pools de lecture, vous contournez les limites de requêtes et de connexions simultanées de BigQuery.
  • Accélération des performances : traitez les données à l'aide du moteur de données en colonnes AlloyDB et du cache de mémoire tampon local pour obtenir des temps de réponse des requêtes inférieurs à une seconde.
  • Mise en miroir automatisée des données : maintenez une actualisation automatisée et planifiée des données analytiques de BigQuery sans orchestrer manuellement les tâches ETL par lot.
  • Activation de l'IA et des workflows opérationnels : matérialisez les données analytiques dans AlloyDB pour générer des embeddings vectoriels, exécuter des recherches de similarité et alimenter des workflows d'agent à l'aide d'AlloyDB AI.

Architecture et flux de données

L'extension alloydb_sync utilise des tâches en arrière-plan pour diffuser périodiquement des données de BigQuery dans une table locale de votre cluster AlloyDB selon la planification que vous avez configurée. Les applications interrogent ensuite la table locale avec une faible latence.

Le schéma suivant illustre l'architecture de synchronisation des données.

Organigramme montrant comment les données sont transférées de BigQuery vers AlloyDB via des jobs de synchronisation planifiés.
Figure 1. Architecture et flux de données pour les tables synchronisées

Mappage des types de données

Lorsque vous synchronisez des données de BigQuery avec AlloyDB, AlloyDB mappe les types de données BigQuery avec les types de données PostgreSQL correspondants.

Avant de créer une table synchronisée, vérifiez que vos colonnes BigQuery sources utilisent des types de données compatibles. Pour obtenir la liste complète des mappages et des types compatibles, consultez la section Mappages des types de données compatibles.

Tarifs

Lorsque vous utilisez la synchronisation des données, Google Cloud vous êtes facturé en fonction des composants suivants. Pour en savoir plus, consultez Synchroniser des données BigQuery avec AlloyDB.

  • AlloyDB : les tarifs standards s'appliquent à vos instances AlloyDB et à l'espace de stockage utilisé par les tables synchronisées locales.
  • BigQuery : les requêtes et les flux de données exécutés lors des tâches d'actualisation alloydb_sync entraînent des frais standards d'analyse BigQuery et d'API BigQuery Storage.
  • Cloud Storage : lorsque vous synchronisez des données à partir de tables Apache Iceberg dans Cloud Storage, les tarifs standards de stockage et de récupération des données s'appliquent.

Limites

La synchronisation des données présente les limites suivantes :

  • Fraîcheur des données : les données des tables synchronisées reflètent l'état de la table BigQuery source depuis la dernière actualisation terminée.
  • Version de PostgreSQL : la synchronisation des données à l'aide de l'extension alloydb_sync n'est compatible qu'avec la version 18 de PostgreSQL.
  • Compatibilité des types de données : les colonnes sources doivent être mappées avec des types de données PostgreSQL compatibles. Les types complexes non compatibles (tels que ARRAY, BYTES, VECTOR et GEOGRAPHY) nécessitent que vous convertissiez ou que vous transtypiez la colonne dans une vue BigQuery avant la synchronisation.

Étape suivante