Neste tutorial, mostramos como executar o ajuste supervisionado (SFT) em um cluster da Unidade de Processamento de Tensor (TPUs) v6e de vários hosts usando o MaxText e o Cluster Toolkit. Você usa o Cluster Toolkit para executar uma carga de trabalho de treinamento de vários hosts e exportar os resultados de volta para o formato do Hugging Face para veiculação.
Objetivos
- Instale o Cluster Toolkit e as dependências dele.
- Implante um cluster do Cluster Toolkit.
- Converter um modelo do Hugging Face para o formato MaxText.
- Execute uma carga de trabalho de treinamento de SFT na TPU.
- Converta o modelo refinado de volta para o formato do Hugging Face para veiculação.
Custos
Neste documento, você vai usar os seguintes componentes faturáveis do Google Cloud:
Para gerar uma estimativa de custo baseada na projeção de uso deste tutorial, use a calculadora de preços.
Ao concluir as tarefas descritas neste documento, é possível evitar o faturamento contínuo excluindo os recursos criados. Para mais informações, consulte Limpar.
Antes de começar
Você precisa de um token de acesso do Hugging Face para usar este tutorial. Você pode se inscrever em uma conta sem custo financeiro no Hugging Face. Depois de criar uma conta, gere um token de acesso:
- Na página Bem-vindo ao Hugging Face, clique no avatar da sua conta e selecione Tokens de acesso.
- Na página Tokens de acesso, clique em Criar novo token.
- Selecione o tipo de token Leitura e insira um nome para ele.
- Seu token de acesso vai aparecer. Salve o token em um local seguro.
- No site do Hugging Face, aceite o contrato de licença do modelo que você planeja treinar. Este tutorial usa o modelo
gemma4-31b.
Para conseguir as permissões necessárias a fim de concluir o tutorial, peça ao administrador para conceder a você os seguintes papéis do IAM no projeto:
-
Para concluir este tutorial:
- Administrador da TPU (
roles/tpu.admin) - Usuário da conta de serviço (
roles/iam.serviceAccountUser) - Editor do Compute (
roles/compute.editor) - Administrador do Storage (
roles/storage.admin)
- Administrador da TPU (
Para mais informações sobre a concessão de papéis, consulte Gerenciar o acesso a projetos, pastas e organizações.
Também é possível conseguir as permissões necessárias usando papéis personalizados ou outros papéis predefinidos.
Configurar as variáveis de ambiente
Configure as variáveis de ambiente executando o seguinte script:
Substitua:
- YOUR_PROJECT_ID: o ID do seu projeto do Google Cloud .
- YOUR_REGION: a região em que você quer implantar o cluster.
- YOUR_ZONE: a zona em que você quer implantar o cluster.
- YOUR_RESERVATION_NAME: o nome da sua reserva.
- YOUR_HF_TOKEN: seu token de acesso do Hugging Face.
- YOUR_BUCKET_NAME: um nome exclusivo global para um bucket do Cloud Storage.
Instalar dependências do Cluster Toolkit
Para concluir este tutorial em um cliente ou estação de trabalho Linux ou macOS, siga as etapas relevantes em Instalar dependências na documentação do Cluster Toolkit.
Se você estiver usando o Cloud Shell, pule esta seção.
Instalar o Cluster Toolkit
Instale o pacote pré-criado do Cluster Toolkit seguindo as instruções em Instalar o Cluster Toolkit.
Criar um cluster do Cluster Toolkit
Para criar e implantar um cluster do Cluster Toolkit com 32 chips de TPU v6e, siga estas etapas:
Crie um bucket do Cloud Storage:
Por padrão, a conta de serviço do pool de nós do cluster não tem as permissões necessárias para gravar no bucket do Cloud Storage. Para permitir que a conta de serviço do pool de nós grave no bucket do Cloud Storage, conceda a ela o papel
Storage Admin. Para conceder essa função, edite o arquivogke-tpu-v6e-advanced.yamlatualizando o módulonode_pool_service_account:Implante o cluster do Cluster Toolkit usando o blueprint
gke-tpu-v6e-advanced.yamle transmitindo as variáveis necessárias com a flag--vars:
Converter o modelo para o formato MaxText
Para treinar o modelo no formato MaxText, é preciso convertê-lo do formato Hugging Face para o formato MaxText.
Para simplificar os comandos subsequentes, configure o projeto, o cluster e o local padrão:
Para converter o modelo do formato Hugging Face para o formato MaxText e armazená-lo no bucket do Cloud Storage, execute o seguinte script:
Para verificar o status do job de conversão, execute o seguinte comando:
Iniciar a carga de trabalho de treinamento
Depois que o processo de conversão for concluído, inicie a carga de trabalho do SFT executando o seguinte comando:
Para verificar o status do job de treinamento, execute o seguinte comando:
Converter o modelo treinado de volta para o formato do Hugging Face
Depois que a carga de trabalho de treinamento for concluída, converta o modelo de volta para o formato do Hugging Face:
Para verificar o status do job de conversão, execute o seguinte comando:
Limpar
Para evitar cobranças extras, exclua os recursos criados durante este tutorial.
A seguir
- Para mais informações sobre o Cloud TPU, consulte Introdução ao Cloud TPU.
- Para detalhes da arquitetura e da configuração da TPU
v6e-32, consulte TPU v6e.