Criar um cluster usando o Google Cloud console
Nesta página, mostramos como usar o Google Cloud console para criar um cluster do Serviço Gerenciado para Apache Spark, executar um job básico do Apache Spark no cluster e modificar o número de workers nele.
Antes de começar
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that you have the permissions required to complete this guide.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
Funções exigidas
Algumas funções do Identity and Access Management (IAM, na sigla em inglês) são necessárias para executar os exemplos nesta página. Dependendo das políticas da organização, essas funções já podem ter sido concedidas. Para verificar as concessões de funções, consulte Você precisa conceder funções?.
Para mais informações sobre a concessão de papéis, consulte Gerenciar o acesso a projetos, pastas e organizações.
Papéis do usuário
Para receber as permissões necessárias para criar um cluster do Serviço Gerenciado para Apache Spark, peça ao administrador para conceder a você as seguintes funções do IAM:
- Editor do Dataproc (
roles/dataproc.editor) no projeto - Usuário da conta de serviço (
roles/iam.serviceAccountUser) na conta de serviço padrão do Compute Engine
Papel de conta de serviço
Para garantir que a conta de serviço padrão do Compute Engine tenha as permissões necessárias para criar um cluster do Serviço Gerenciado para Apache Spark, peça ao administrador para conceder as seguintes funções do IAM à conta de serviço padrão do Compute Engine no projeto:
-
Todas:
worker do Dataproc (
roles/dataproc.worker)
Criar um cluster
No Google Cloud console, acesse a página Clusters do Serviço Gerenciado para Apache Spark.
Clique em Criar cluster.
Na caixa de diálogo Criar cluster do Dataproc, clique em Criar na linha Cluster no Compute Engine.
No campo Nome do cluster, insira
example-cluster.Nas listas Região e Zona, selecione uma região e uma zona.
Selecione uma região (por exemplo,
us-east1oueurope-west1) para isolar recursos, como instâncias de máquina virtual (VM) e locais de armazenamento de metadados e do Cloud Storage usados pelo Serviço Gerenciado para Apache Spark, na região. Para mais informações, consulte Regiões e zonas disponíveis e Região do clusterPara todas as outras opções, use as configurações padrão.
Para criar o cluster, clique em Criar.
O novo cluster aparece em uma lista na página Clusters. O status é Em provisionamento até que o cluster esteja pronto para uso, e depois muda para Em execução. O provisionamento do cluster pode levar alguns minutos.
Enviar um job do Spark
Envie um job do Spark que estima um valor de Pi:
- No menu de navegação do Serviço Gerenciado para Apache Spark, clique em Jobs.
Na página Jobs, clique em Enviar job e faça o seguinte:
- No campo código da tarefa, use a configuração padrão ou forneça um ID que seja exclusivo para seu Google Cloud projeto.
- No menu suspenso Cluster, selecione
example-cluster. - Em Tipo de serviço, selecione Spark.
- No campo Classe principal ou jar, insira
org.apache.spark.examples.SparkPi. No campo Arquivos JAR, insira
file:///usr/lib/spark/examples/jars/spark-examples.jar. Esse jar de amostra já vem instalado no cluster. Para jobs personalizados, especifique um caminho do Cloud Storage. Consulte Enviar um job.No campo Argumentos, insira
1000para definir o número de tarefas.Ele gera pontos x e y em um plano de coordenadas que modela um círculo dentro de um quadrado unitário. O argumento de entrada (
1000) determina o número de pares x-y a serem gerados. Quanto mais pares gerados, maior a precisão da estimativa. Essa estimativa usa nós de worker do Serviço Gerenciado para Apache Spark para paralelizar o cálculo. Para mais informações, consulte Estimativa de Pi usando o método de Monte Carlo (em inglês) e JavaSparkPi.java no GitHub (em inglês).Clique em Enviar.
O job é exibido na página Detalhes do job. O status do job é Em execução ou Iniciando e, depois de enviado, muda para Concluído.
Para evitar a rolagem na saída, clique em Quebra de linha: desativada. A saída é semelhante a esta:
Pi is roughly 3.1416759514167594
Para conferir os detalhes do job, clique na guia Configuração.
Atualize um cluster
Atualize o cluster mudando o número de instâncias de worker:
- No menu de navegação do Serviço Gerenciado para Apache Spark, clique em Clusters.
- Na lista de clusters, clique em
example-cluster. Na página Detalhes do cluster, clique na guia Configuração.
As configurações do cluster são exibidas.
Clique em Editar.
No campo Nós de trabalho, insira
5.Clique em Salvar.
Seu cluster foi atualizado. Para reduzir o número de nós de trabalho ao valor original, siga o mesmo procedimento.
Limpar
Para evitar cobranças na conta do Google Cloud pelos recursos usados nesta página, siga as etapas abaixo.
- Para excluir o cluster, na página Detalhes do cluster de
example-cluster, clique em Excluir. - Para confirmar que você quer excluir o cluster, clique em Excluir.
A seguir
Siga este guia de início rápido usando outras ferramentas:
Aprenda a criar regras de firewall robustas ao criar um projeto
Aprenda a gravar e executar um job do Spark Scala.