복잡한 ETL 없이 Amazon Web Services (AWS), Google Cloud, 및 PostgreSQL용 AlloyDB 전반에서 데이터 사일로를 통합하기 위해 교차 클라우드 데이터 액세스를 설정하는 방법을 알아봅니다.
경계 없는 Lakehouse를 중앙 인텔리전스 허브로, AlloyDB를 운영 데이터 소스로, Managed Service for Apache Spark를 고성능 벡터화 처리로 사용합니다. 마지막으로 Gemini를 사용하여 Lakehouse에서 강력한 비즈니스 통계를 도출합니다.
시나리오
이 시나리오에서는 다음 소스 전반에 데이터가 있습니다.
- 운영 AlloyDB 데이터베이스의 트랜잭션 데이터 (사용자, 주문, 주문 항목)
- AWS S3 버킷의 제품 데이터
- Cloud Storage의 클릭스트림 이벤트 로그
이러한 데이터 세트를 조인하여 다음 마케팅 캠페인의 타겟 인구통계를 파악하고 맞춤설정된 아웃리치 이메일을 생성합니다.
학습 내용
이 Codelab에서는 다음 작업을 수행합니다.
- Lakehouse 카탈로그 엔드포인트를 설정 및 구성하여 AWS S3, Cloud Storage, AlloyDB 전반에서 데이터 사일로를 통합합니다.
- Managed Service for Apache Spark를 사용하여 고성능 벡터화 쿼리 처리를 실행합니다.
- 데이터 이동 또는 복잡한 ETL 파이프라인 없이 트랜잭션, 제품, 클릭스트림 데이터 세트를 조인합니다.
- Gemini를 사용하여 비즈니스 통계를 도출하고 Lakehouse에서 맞춤설정된 마케팅 아웃리치를 생성합니다.
Codelab 시작
단계별 Codelab을 시작합니다.
다음 단계
- Lakehouse 개념에 대해 자세히 알아봅니다.
- 원격 데이터를 쿼리하는 방법을 알아봅니다.
- 지원되는 리전 및 기능을 확인합니다.