Usa este documento para identificar la infraestructura de aceleradores óptima para tus cargas de trabajo de inteligencia artificial (IA) y aprendizaje automático (AA) según la etapa del ciclo de vida, como la creación de prototipos a pequeña escala, la inferencia en tiempo real y el entrenamiento distribuido masivo. AI Hypercomputer organiza las ofertas de aceleradores en dos categorías: GPU generales y GPU en clúster.
Infraestructura de GPU
AI Hypercomputer ofrece dos categorías distintas de GPU. Cada categoría tiene un modelo de administración distinto que determina cómo el sistema controla los eventos del ciclo de vida, administra el mantenimiento y optimiza las redes para tu carga de trabajo:
Modelo de administración de GPU generales
El modelo de administración de GPU generales está diseñado para cargas de trabajo que priorizan la independencia de los recursos y la alta disponibilidad. Este modelo usa el plano de administración estándar Google Cloud , lo que proporciona una experiencia familiar para los equipos que ya usan Compute Engine o GKE.
Mantenimiento: asíncrono. Las instancias individuales se actualizan de forma independiente. En una flota de entrega de varios nodos, un evento de mantenimiento en un nodo no afecta la disponibilidad de otros, lo que permite que el tráfico se redireccione a nodos en buen estado sin detener todo el trabajo.
Casos de uso principales: se recomienda para tareas convencionales, como la inferencia en tiempo real, la entrega de modelos, la creación de prototipos a pequeña escala y los entornos de desarrollo en los que no se requiere una escala de supercomputación.
Series de máquinas de GPU generales
Las siguientes series de máquinas son GPU generales:
- G2 (L4)
- G4 (RTX PRO 6000)
- A2 (A100)
- N1+T4
- A3 Edge
- A3 High (1, 2 o 4 GPU)
Para obtener información técnica sobre cada una de las máquinas de GPU generales, consulta Tipos de máquinas de GPU.
Modelo de administración de GPU en clúster
El modelo de administración de GPU en clúster es un entorno de clase de supercomputación diseñado para el entrenamiento distribuido a gran escala. Los recursos se administran como un solo sistema con acoplamiento estrecho mediante una pila de GPU en clúster.
Mantenimiento: coordinado. Este modelo coordina los eventos de mantenimiento para admitir cargas de trabajo con acoplamiento estrecho. Para el entrenamiento distribuido, puedes usar el mantenimiento sincronizado, en el que las actualizaciones se aplican en todos los nodos de forma simultánea. Este enfoque evita que los reinicios de nodos detengan los trabajos y maximiza el rendimiento útil. Este modelo también ofrece notificaciones de mantenimiento de 90 días.
Casos de uso principales: diseñado para entrenar modelos fundamentales de exaescala con billones de parámetros o ejecutar simulaciones complejas de computación de alto rendimiento (HPC), como el descubrimiento de fármacos y el plegamiento de proteínas.
Series de máquinas de GPU en clúster
Las siguientes series de máquinas son GPU en clúster:
- A4X
- A4 (Blackwell)
- A3 Ultra
- A3 Mega
- A3 High (8 GPU)
Para obtener información técnica sobre cada una de las máquinas de GPU en clúster, consulta Tipos de máquinas de GPU.
Matriz de capacidades
Compara las características técnicas y operativas de los modelos de administración de GPU generales y GPU en clúster:
| Característica | Modelo de administración de GPU generales | Modelo de administración de GPU en clúster |
|---|---|---|
| Casos de uso principales | Inferencia, entrega de modelos, creación de prototipos y desarrollo | Entrenamiento distribuido a gran escala y HPC |
| Mantenimiento | Asíncrono: Las actualizaciones de nodos independientes permiten que el tráfico se redireccione sin detener los trabajos. | Coordinado: Admite actualizaciones coordinadas (sincronizadas) en todo el clúster para mantener los nodos sincronizados y maximizar el rendimiento útil. |
| Hardware de destino | G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge y A3 High (1, 2 o 4 GPU) | A4X, A4 (Blackwell), A3 Ultra, A3 Mega y A3 High (8 GPU) |
| Redes | Redes de VPC estándar a través de interfaces gVNIC (con la excepción de A3 Edge, que usa GPUDirect-TCPX en varias VPC) | Telas especializadas de baja latencia (RDMA, RoCE, TCPX o NVIDIA NVLink) |
| Pila de administración | Plano estándar Google Cloud (Compute Engine o GKE) | Pila de administración especializada (por ejemplo, Cluster Director) |
| Confiabilidad | Reparación automática de nodos estándar y tiempo de actividad a nivel de pod | Paquete especializado de recursos y recuperación |
Matriz de decisiones
Usa esta matriz para identificar qué familias de hardware se alinean con tu intención de carga de trabajo específica:
| Si tu carga de trabajo incluye lo siguiente... | Infraestructura de GPU recomendada | Serie de máquinas recomendada |
|---|---|---|
| Creación de prototipos y desarrollo | GPU generales | G2, G4, A2, N1+T4, A3 Edge |
| Inferencia en tiempo real (parámetros < 100 mil millones) | GPU generales | G2, G4, A2, N1+T4, A3 Edge |
| Inferencia en varias GPU | GPU en clúster | A3, A4 |
| Entrenamiento e inferencia a gran escala | GPU en clúster | A4, A3 |
| Entrenamiento a gran escala (parámetros > 500 mil millones) e inferencia desagregada | GPU en clúster | A4X Max, A4X, A4 |
Para obtener un árbol de decisiones detallado que asigne arquitecturas de modelos directamente al hardware, consulta Elige un acelerador.
Después de establecer estos criterios principales, elige una plataforma de organización. Esta elección depende de la preferencia de tu equipo por la administración automatizada o el control detallado sobre el sistema operativo y los controladores.
¿Qué sigue?
- Para seleccionar un organizador y una opción de implementación, consulta Elige un organizador y una opción de implementación.
- Para implementar cargas de trabajo de inferencia o ejecutar entrenamiento a gran escala, consulta los instructivos de AI Hypercomputer.
- Para optimizar la eficiencia del sistema, consulta Recetas de optimización de rendimiento útil.