複雑な ETL を使用せずに、Amazon Web Services(AWS)、 Google Cloud、AlloyDB for PostgreSQL 全体でデータサイロを統合するために、クロスクラウド データアクセスを設定する方法について説明します。
ボーダーレス レイクハウスを中央インテリジェンス ハブとして、AlloyDB を運用データソースとして、Managed Service for Apache Spark を高性能のベクトル化処理に使用します。最後に、Gemini を使用して、レイクハウスから強力なビジネス分析情報を導き出します。
シナリオ
このシナリオでは、次のソースにデータがあります。
- 運用 AlloyDB データベースのトランザクション データ(ユーザー、注文、注文アイテム)。
- AWS S3 バケット内の商品データ。
- Cloud Storage のクリックストリーム イベントログ。
これらのデータセットを結合して、次のマーケティング キャンペーンのターゲット層を特定し、パーソナライズされたアウトリーチ メールを生成します。
学習内容
この Codelab では、次のタスクを行います。
- Lakehouse カタログ エンドポイントを設定して構成し、AWS S3、Cloud Storage、AlloyDB 全体でデータサイロを統合します。
- Managed Service for Apache Spark を使用して、高パフォーマンスのベクトル化されたクエリ処理を実行します。
- データの移動や複雑な ETL パイプラインなしで、トランザクション データセット、プロダクト データセット、クリックストリーム データセットを結合します。
- Gemini を使用して、レイクハウスからビジネス分析情報を取得し、パーソナライズされたマーケティング アウトリーチを生成します。
Codelab を開始する
手順ごとの Codelab を開始します。
次のステップ
- Lakehouse のコンセプトの詳細を確認する。
- リモートデータをクエリする方法を確認する。
- サポートされているリージョンと機能を確認します。