Use este documento para identificar a infraestrutura de acelerador ideal para suas cargas de trabalho de inteligência artificial (IA) e machine learning (ML) com base no estágio do ciclo de vida, como prototipagem em pequena escala, inferência em tempo real e treinamento distribuído em massa. O Hipercomputador de IA organiza as ofertas de aceleradores em duas categorias: GPUs gerais e GPUs em cluster.
Infraestrutura de GPU
O Hipercomputador de IA oferece duas categorias distintas de GPUs. Cada categoria tem um modelo de gerenciamento distinto que determina como o sistema processa eventos do ciclo de vida, gerencia a manutenção e otimiza a rede para sua carga de trabalho:
Modelo de gerenciamento de GPU geral
O modelo de gerenciamento de GPU geral foi projetado para cargas de trabalho que priorizam a independência de recursos e a alta disponibilidade. Esse modelo usa o plano de gerenciamento padrão Google Cloud , oferecendo uma experiência familiar para equipes que já usam o Compute Engine ou o GKE.
Manutenção:assíncrona. As instâncias individuais são atualizadas de forma independente. Em uma frota de disponibilização de vários nós, um evento de manutenção em um nó não afeta a disponibilidade de outros, permitindo que o tráfego seja redirecionado para nós íntegros sem interromper todo o job.
Principais casos de uso:recomendado para tarefas convencionais, como inferência em tempo real, disponibilização do modelo, prototipagem em pequena escala e ambientes de desenvolvimento em que a escala de supercomputação não é necessária.
Série de máquinas de GPU geral
As seguintes séries de máquinas são GPUs gerais:
- G2 (L4)
- G4 (RTX PRO 6000)
- A2 (A100)
- N1+T4
- A3 Edge
- A3 High (1, 2 ou 4 GPUs)
Para informações técnicas sobre cada uma das máquinas de GPU geral, consulte Tipos de máquinas com GPU.
Modelo de gerenciamento de GPU em cluster
O modelo de gerenciamento de GPU em cluster é um ambiente de supercomputação projetado para treinamento distribuído em grande escala. Os recursos são gerenciados como um sistema único e fortemente acoplado usando uma pilha de GPU em cluster.
Manutenção:coordenada. Esse modelo coordena eventos de manutenção para oferecer suporte a cargas de trabalho fortemente acopladas. Para treinamento distribuído, é possível usar a manutenção sincronizada, em que as atualizações são aplicadas a todos os nós simultaneamente. Essa abordagem impede que as reinicializações de nós interrompam os jobs e maximiza o goodput. Esse modelo também oferece notificações de manutenção de 90 dias.
Principais casos de uso:projetado para treinar modelos de base de exaescala com trilhões de parâmetros ou executar simulações complexas de computação de alto desempenho (HPC), como descoberta de medicamentos e dobramento de proteínas.
Série de máquinas de GPU em cluster
As seguintes séries de máquinas são GPUs em cluster:
- A4X
- A4 (Blackwell)
- A3 Ultra
- A3 Mega
- A3 High (8 GPUs)
Para informações técnicas sobre cada uma das máquinas de GPU em cluster, consulte Tipos de máquinas com GPU.
Matriz de recursos
Compare as características técnicas e operacionais dos modelos de gerenciamento de GPU geral e GPU em cluster:
| Característica | Modelo de gerenciamento de GPU geral | Modelo de gerenciamento de GPU em cluster |
|---|---|---|
| Principais casos de uso | Inferência, disponibilização do modelo, prototipagem e desenvolvimento | Treinamento distribuído em grande escala e HPC |
| Manutenção | Assíncrona:as atualizações de nós independentes permitem que o tráfego seja redirecionado sem interromper os jobs | Coordenada:oferece suporte a atualizações coordenadas (sincronizadas) em todo o cluster para manter os nós sincronizados e maximizar o goodput |
| Hardware de destino | G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge e A3 High (1, 2 ou 4 GPUs) | A4X, A4 (Blackwell), A3 Ultra, A3 Mega e A3 High (8 GPUs) |
| Rede | Rede VPC padrão em interfaces gVNIC (com exceção do A3 Edge, que usa GPUDirect-TCPX em várias VPCs) | Tecidos especializados de baixa latência (RDMA, RoCE, TCPX ou NVIDIA NVLink) |
| Pilha de gerenciamento | Plano padrão Google Cloud (Compute Engine ou GKE) | Pilha de gerenciamento especializada (por exemplo, Cluster Director) |
| Confiabilidade | Reparo automático de nós padrão e tempo de atividade no nível do pod | Suíte de recursos e recuperação especializada |
Matriz de decisão
Use esta matriz para identificar quais famílias de hardware estão alinhadas à sua intenção de carga de trabalho específica:
| Se a carga de trabalho envolver... | Infraestrutura de GPU recomendada | Série de máquinas recomendada |
|---|---|---|
| Prototipagem e desenvolvimento | GPUs gerais | G2, G4, A2, N1+T4, A3 Edge |
| Inferência em tempo real (< 100 bilhões de parâmetros) | GPUs gerais | G2, G4, A2, N1+T4, A3 Edge |
| Inferência em várias GPUs | GPUs em cluster | A3, A4 |
| Treinamento e inferência em grande escala | GPUs em cluster | A4, A3 |
| Treinamento em grande escala (> 500 bilhões de parâmetros) e inferência desagregada | GPUs em cluster | A4X Max, A4X, A4 |
Para uma árvore de decisão detalhada que mapeia arquiteturas de modelo diretamente para hardware, consulte Escolher um acelerador.
Depois de estabelecer esses critérios principais, escolha uma plataforma de orquestração. Essa escolha depende da preferência da sua equipe por gerenciamento automatizado ou controle granular sobre o sistema operacional e os drivers.
A seguir
- Para selecionar um orquestrador e uma opção de implantação, consulte Escolher um orquestrador e uma opção de implantação.
- Para implantar cargas de trabalho de inferência ou executar treinamento em grande escala, consulte Tutoriais do Hipercomputador de IA.
- Para otimizar a eficiência do sistema, consulte Receitas de otimização de goodput.