Você pode usar um conector do BigQuery para ativar o acesso programático de leitura e gravação ao BigQuery. Essa é a forma ideal para processar dados armazenados no BigQuery. O acesso à linha de comando não é exposto. O conector do BigQuery é uma biblioteca que permite que aplicativos Spark e Hadoop processem dados do BigQuery e gravem dados no BigQuery usando a terminologia nativa.
Preços
Ao usar o conector, as cobranças incluem taxas de uso do BigQuery. As seguintes cobranças específicas do serviço também podem ser aplicadas:
- Cloud Storage: o conector faz o download de dados em um bucket do Cloud Storage antes ou durante a execução do job. Depois que o job for concluído, os dados serão excluídos do Cloud Storage. Esse armazenamento é cobrado de acordo com os preços do Cloud Storage. Para evitar cobranças em excesso, verifique sua conta do Cloud Storage e remova arquivos temporários desnecessários.
- API Storage Read: o conector lê dados de tabelas usando a API Storage Read para alcançar alta capacidade de processamento.
- Quando as solicitações são originadas do Serviço Gerenciado para Apache Spark sem servidor ou dos procedimentos armazenados do BigQuery para Apache Spark, os custos de leitura de streaming da API Storage Read são delegados ao conector sem custo financeiro adicional. As cobranças padrão de saída de rede ainda se aplicam se os dados forem lidos em várias regiões.
- Quando as solicitações se originam de cargas de trabalho do Apache Spark baseadas em cluster (como o Serviço gerenciado para Apache Spark em clusters ou o Apache Spark executado no Google Kubernetes Engine (GKE)), os preços padrão da API Storage Read são aplicados.
Conectores disponíveis
Os seguintes conectores do BigQuery estão disponíveis para uso no ecossistema do Hadoop:
- O conector do BigQuery para Spark adiciona uma fonte de dados do Spark, que permite que os DataFrames interajam diretamente com tabelas do BigQuery usando as operações
readewritedo Spark. - O conector do BigQuery para Hive adiciona um gerenciador de armazenamento, que permite que o Apache Hive interaja diretamente com as tabelas do BigQuery usando a sintaxe HiveQL.
O conector do BigQuery para Hadoop permite que mapeadores e redutores do Hadoop interajam com tabelas do BigQuery usando versões abstratas das classes InputFormat e OutputFormat.
Usar os conectores
Para começar a usar o conector do BigQuery, consulte os seguintes exemplos:
- exemplo do Spark
- exemplo do Java MapReduce
- Conectar o cluster do Serviço Gerenciado para Apache Spark ao BigQuery
A seguir
- Saiba mais sobre o BigQuery.
- Siga o exemplo do BigQuery para Spark.
- Saiba mais sobre o conector Hive BigQuery.
- Siga o exemplo do BigQuery para Java MapReduce.