En este instructivo, se muestra cómo organizar un entorno de entrenamiento distribuido para el aprendizaje por refuerzo (RL) en Google Kubernetes Engine (GKE). Usas Ray y el framework de NVIDIA NeMo RL para configurar un entorno de entrenamiento distribuido y ajustar un modelo.
En este instructivo, se explica la canalización de entrenamiento de la optimización de políticas relativas al grupo (GRPO) en GKE con Ray y NeMo RL. El GRPO es un algoritmo de aprendizaje por refuerzo diseñado para mejorar la capacidad de razonamiento de un modelo. Este algoritmo eficiente en cuanto a la memoria simplifica el proceso de RL, ya que elimina el Critic, o modelo de valor, y usa un cálculo relativo basado en grupos.
Antes de ejecutar este instructivo, completa el instructivo Ajusta y escala el aprendizaje por refuerzo con Verl en GKE. En este instructivo, se usa la misma configuración del clúster que en el instructivo sobre el ajuste y el escalamiento del RL con Verl.
Fondo
En las siguientes secciones, se proporciona una breve descripción general de los conceptos que se usan en este instructivo.
Aprendizaje por refuerzo (RL)
El RL enseña a los modelos a través de la experiencia, la exploración y la retroalimentación, en lugar de la imitación estática. Si bien el entrenamiento previo le enseña a un modelo qué decir, el aprendizaje por refuerzo con retroalimentación humana (RLHF) le enseña a ser útil, seguro y lógico. El RL sirve como puente entre un modelo base y un modelo ajustado para un caso de uso especializado.
Para obtener más información, consulta ¿Qué es el aprendizaje por refuerzo?
Optimización de políticas relativas al grupo (GRPO)
GRPO, un algoritmo popularizado por DeepSeek, ofrece una alternativa eficiente en cuanto a la memoria a la optimización de políticas proximales (PPO) para la alineación de LLM, ya que quita el modelo de Critic. En lugar de una red de críticos, GRPO genera un grupo de respuestas para la misma instrucción y usa la recompensa promedio de ese grupo como referencia.
Para obtener más información, consulta GRPO.
NVIDIA NeMo RL
NeMo RL es la biblioteca de código abierto posterior al entrenamiento de NVIDIA diseñada para el RL escalable. Como parte del ecosistema más amplio del framework de NeMo, NeMo RL permite realizar experimentos a pequeña escala en una sola GPU y también implementaciones de varios nodos en miles de GPUs.
Para obtener más información, consulta NVIDIA NeMo RL.
Conjunto de datos de GSM8k
En este instructivo, usarás el conjunto de datos GSM8k, que contiene 8,500 problemas matemáticos de alta calidad y lingüísticamente diversos para estudiantes de primaria.
Con GSM8k y GRPO, el modelo genera un grupo de n respuestas diferentes para el mismo problema. El GRPO compara estas respuestas con el promedio del grupo. El modelo recibe más recompensas por las rutas que son coherentes, correctas y lógicas en comparación con el resto del grupo. Con el tiempo, el modelo aprende que articular sus pasos con claridad es la forma más confiable de maximizar la recompensa, lo que reduce de manera efectiva la recompensa por las respuestas de bajo rendimiento.
Para obtener más información, consulta GSM8k.
Objetivos
En este instructivo, se muestra cómo configurar RL en GKE con NeMo RL. Para ello, completa los siguientes pasos:
- Prepara tu entorno.
- Configura un clúster de GKE con GPU B200 o H200.
- Configura KubeRay para administrar un clúster de Ray distribuido.
- Usa Managed Lustre para el almacenamiento de alto rendimiento.
- Ejecuta un trabajo de entrenamiento de GRPO que use NeMo RL.
Antes de comenzar
-
Instala Google Cloud CLI.
-
Configura gcloud CLI para usar tu identidad federada.
Para obtener más información, consulta Accede a la gcloud CLI con tu identidad federada.
-
Para inicializar gcloud CLI, ejecuta el siguiente comando:
gcloud init -
Crea o selecciona un Google Cloud proyecto.
Roles necesarios para seleccionar o crear un proyecto
- Selecciona un proyecto: Para seleccionar un proyecto, no se requiere un rol de IAM específico. Puedes seleccionar cualquier proyecto en el que se te haya otorgado un rol.
-
Crear un proyecto: Para crear un proyecto, necesitas el rol de Creador de proyectos (
roles/resourcemanager.projectCreator), que contiene el permisoresourcemanager.projects.create. Obtén más información para otorgar roles.
-
Crea un proyecto de Google Cloud :
gcloud projects create PROJECT_ID
Reemplaza
PROJECT_IDpor un nombre para el proyecto Google Cloud que estás creando. -
Selecciona el proyecto Google Cloud que creaste:
gcloud config set project PROJECT_ID
Reemplaza
PROJECT_IDpor el nombre de tu proyecto de Google Cloud .
-
Verifica que la facturación esté habilitada para tu proyecto de Google Cloud .
Habilita las APIs necesarias:
Roles necesarios para habilitar las APIs
Para habilitar APIs, necesitas el permiso
serviceusage.services.enable. Si creaste el proyecto, es probable que ya tengas este permiso a través del rol de propietario (roles/owner). De lo contrario, puedes obtener este permiso a través del rol de administrador de Service Usage (roles/serviceusage.serviceUsageAdmin). Obtén más información para otorgar roles.gcloud services enable container.googleapis.com
storage.googleapis.com compute.googleapis.com -
Otorga roles a tu cuenta de usuario. Ejecuta el siguiente comando una vez para cada uno de los siguientes roles de IAM:
roles/container.admin, roles/iam.serviceAccountAdmin, roles/storage.admingcloud projects add-iam-policy-binding PROJECT_ID --member="user:USER_IDENTIFIER" --role=ROLE
Reemplaza lo siguiente:
PROJECT_ID: ID del proyectoUSER_IDENTIFIER: Es el identificador de tu cuenta de usuario de cuenta. Para obtener ejemplos, consulta Representa a los usuarios del grupo de personal en políticas de IAM.ROLE: Es el rol de IAM que otorgas a tu cuenta de usuario.
- Crea una cuenta de Hugging Face, si todavía no la tienes.
- Asegúrate de tener un token de Hugging Face con
read access. - Crea una cuenta de Weights & Biases (Wandb) si no tienes una.
- Crea una clave de API de Wandb.
- Asegúrate de que tu proyecto Google Cloud tenga suficiente cuota para las GPU B200 y H200. Para obtener más información, consulta Planifica la cuota de GPU y Cuota de GPU.
Prepara el entorno
En este instructivo, usarás Cloud Shell.
Ve a la consola deGoogle Cloud .
En la parte superior de la Google Cloud ventana de la consola, haz clic en el botón Activar Cloud Shell.
Configura las siguientes variables de entorno:
Reemplaza los siguientes valores:
YOUR_REGION: Es la región de Compute Engine para el plano de control del clúster de GKE.YOUR_NODE_ZONE: Es la zona de tus nodos. Selecciona una zona en la que estén disponibles las GPUs NVIDIA B200 o H200.YOUR_CLUSTER_NAME: Es el nombre del clúster de GKE.YOUR_GPU_TYPE: es el acelerador que reservaste en la reserva de capacidad de Compute Engine. Debe ser uno de los siguientes valores:nvidia-b200: NVIDIA B200 (180 GB)nvidia-h200-141gb: NVIDIA H200 (141 GB)
YOUR_MACHINE_TYPE: Es el tipo de máquina que se usará:- Para las GPU NVIDIA B200 (180 GB), usa
a4-highgpu-8go una versión posterior. - Para las GPU NVIDIA H200 (141 GB), usa
a3-ultragpu-8go una versión posterior.
- Para las GPU NVIDIA B200 (180 GB), usa
YOUR_RESERVATION_NAME: Es el nombre de tu reserva de GPU.CHOSEN_LUSTRE_NAME: Es el nombre de tu instancia de Lustre.YOUR_HF_TOKEN: Tu token de Hugging Face.YOUR_WANDB_API_KEY: Es tu clave de API de Wandb.
Crea las siguientes variables de entorno para la red:
Reemplaza los siguientes valores:
NETWORK_NAME: Es el nombre de la red para GKE.GVNIC_NAME: Es el prefijo del nombre de la red de gVNIC. Puedes usar el prefijo que quieras.RDMA_NAME: Es el prefijo de la red de acceso directo a la memoria (RDMA) remota. Puedes usar el prefijo que quieras.
Configura la infraestructura
En esta sección, crearás redes de VPC y un clúster de GKE.
Crear red de VPC
Crea una red de VPC para la interfaz de gVNIC:
Crea una red de VPC y subredes para RDMA que incluya ocho subredes para ocho GPUs:
Crea el clúster de GKE
Puedes configurar NeMo RL en un clúster de GKE Standard.
Crea un clúster estándar:
Obtén credenciales para el clúster:
Crea el grupo de nodos de GPU:
Instala el instalador de RDMA de NCCL:
Configura las asignaciones de red
Guarda el siguiente manifiesto como
network-mapping.yaml:Aplica el manifiesto
Prepara el almacenamiento
En esta sección, crearás una instancia de Managed Lustre, que aprovisiona el almacenamiento de alto rendimiento necesario para tu carga de trabajo de RL.
Asigna un rango de direcciones IP para el acceso privado a servicios:
Conecta el intercambio de tráfico:
Crea una instancia de Managed Lustre:
Accede a una instancia de Managed Lustre existente con el controlador CSI de Managed Lustre.
Extrae la dirección IP de la instancia de Managed Lustre.
Inspecciona el manifiesto de
lustre-pv.yaml.Aplica el manifiesto
Inspecciona el manifiesto de
lustre-pvc.yaml.Aplica el manifiesto
Implementa RayCluster
En esta sección, clonarás el repositorio de muestra, prepararás los manifiestos y, luego, implementarás el clúster de Ray:
Clona el repositorio de ejemplo:
Navega hasta el directorio de trabajo:
Inspecciona el manifiesto
values.yaml:Reemplaza
NCCL_TUNER_CONFIG_PATHcon cualquiera de los siguientes valores, según el acelerador que uses en este instructivo:- NVIDIA B200 (180 GB):
/usr/local/gib/configs/tuner_config_a4.txtpb - NVIDIA H200 (141 GB):
/usr/local/gib/configs/tuner_config_a3u.txtpb
En este manifiesto, el nodo principal administra el trabajo y aloja el panel de Ray. Los nodos trabajadores ejecutan los trabajos de entrenamiento.
- NVIDIA B200 (180 GB):
Implementa el clúster de Ray:
En este instructivo, usarás dos nodos de trabajo. Si quieres cambiar la cantidad de nodos trabajadores, cambia el valor de
REPLICA_COUNT.Verifica que los nodos trabajadores y principales se estén ejecutando:
El resultado es similar a lo siguiente:
NAME READY STATUS RESTARTS AGE ray-cluster-kuberay-head-sw7dp 2/2 Running 0 33h ray-cluster-kuberay-worker-grp-0-worker-gkbxw 2/2 Running 0 33h ray-cluster-kuberay-worker-grp-0-worker-kdg62 2/2 Running 0 33hVerifica que el clúster de Ray esté en ejecución:
El resultado es similar a lo siguiente:
NAME NAMESPACE DESIRED WORKERS AVAILABLE WORKERS CPUS GPUS TPUS MEMORY CONDITION STATUS AGE ray-cluster-kuberay default 2 2 618 17 0 1573741824k RayClusterProvisioned ready 33h
Inicia el trabajo de GRPO
Una vez que tu clúster de Ray esté listo, puedes enviar un trabajo de Ray a tu clúster de Ray en ejecución en GKE. NeMo RL descarga automáticamente el modelo durante la ejecución del trabajo de entrenamiento de RL.
Para enviar un trabajo de Ray, inicia una sesión interactiva para ejecutar el trabajo.
Para establecer una conexión local con tu clúster de Ray, ejecuta este comando:
Este comando inicia el reenvío de puertos entre tu máquina local y el nodo principal de Ray en tu clúster de GKE. Ten en cuenta que tu terminal estará ocupada mientras esta sesión esté activa. Para continuar, abre otra instancia de terminal.
En una terminal independiente, navega a
kubernetes-engine-samples/ai-ml/nemo-rl-on-gke/nemoRL/gemma3-27b-ity edita el archivogemma3-27b-gsm8k.sh:Reemplaza los siguientes valores en el archivo
gemma3-27b-gsm8k.sh:YOUR_WANDB_API_KEY: Es tu clave de API de WandB.YOUR_HF_TOKEN: Tu token de Hugging Face.
En este archivo, puedes ver la configuración para ejecutar un trabajo con el modelo gemma3-27b-it en el conjunto de datos GSM8k. Para completar el canal de entrenamiento del GRPO, este script define los siguientes parámetros:
num_prompts_per_step: 16ynum_generations_per_prompt: 32: El modelo Gemma3-27b-it genera un grupo grande de respuestas para cada instrucción. En esta configuración, el modelo produce 512 respuestas en total (16 × 32 = 512).policy.generation.colocated.enabled=False: Este parámetro inhabilita la función de generación colocada, lo que significa que el modelo no genera respuestas en el mismo nodo que el proceso de entrenamiento. En el RL estándar, las mismas GPUs controlan el entrenamiento y la generación. En esta configuración de NeMo RL, dedicas nodos específicos (administrados con el parámetropolicy.generation.colocated.resources) exclusivamente a la inferencia de vLLM, mientras que el resto del clúster se enfoca en las matemáticas de entrenamiento de alta exigencia. Al separar estas cargas de trabajo, evitas la contención de recursos entre los búferes de entrenamiento que requieren mucha memoria y las cargas de trabajo de inferencia que requieren mucho procesamiento.
Para enviar el trabajo, ejecuta el siguiente comando:
Cuando el trabajo se está ejecutando, el resultado muestra los resultados del entrenamiento, la sincronización y las métricas de rendimiento.
Supervisa el estado del trabajo de GRPO
Una vez que Ray finaliza el trabajo, NeMo RL almacena los puntos de control en la ruta de acceso configurada.
Para verificar el resultado del trabajo de GRPO, crea una sesión de SSH en el contenedor
ray-head:Instala la utilidad de árbol apt en la terminal del contenedor
ray-head:Enumera la estructura de directorios del contenedor
ray-head:El resultado es similar a lo siguiente:
root@ray-cluster-kuberay-worker-grp-0-worker-gkbxw:/opt/nemo-rl# tree /data/nemo_rl_gemma3_27b_3_17/ /data/nemo_rl_gemma3_27b_3_17/ `-- step_10 |-- config.yaml |-- policy | |-- optimizer | | |-- __0_0.distcp | | |-- __10_0.distcp | | |-- __11_0.distcp | | |-- __12_0.distcp | | |-- __13_0.distcp | | |-- __14_0.distcp | | |-- __15_0.distcp | | |-- __1_0.distcp | | |-- __2_0.distcp | | |-- __3_0.distcp | | |-- __4_0.distcp | | |-- __5_0.distcp | | |-- __6_0.distcp | | |-- __7_0.distcp | | |-- __8_0.distcp | | `-- __9_0.distcp | |-- tokenizer | | |-- chat_template.jinja | | |-- special_tokens_map.json | | |-- tokenizer.json | | `-- tokenizer_config.json | `-- weights | |-- __0_0.distcp | |-- __10_0.distcp | |-- __11_0.distcp | |-- __12_0.distcp | |-- __13_0.distcp | |-- __14_0.distcp | |-- __15_0.distcp | |-- __1_0.distcp | |-- __2_0.distcp | |-- __3_0.distcp | |-- __4_0.distcp | |-- __5_0.distcp | |-- __6_0.distcp | |-- __7_0.distcp | |-- __8_0.distcp | `-- __9_0.distcp |-- train_dataloader.pt `-- training_info.json 6 directories, 39 files
Realiza una limpieza
Para evitar que se apliquen cargos a tu Google Cloud cuenta por los recursos usados en este instructivo, borra los recursos individuales o el proyecto que los contiene.
Borra recursos
Borra tu clúster de Slurm:
Borra tu clúster de GKE:
Borra tu sistema de archivos Lustre:
Borra el intercambio de tráfico entre VPC:
Borra el rango de direcciones IP privadas de Lustre:
Borra las subredes de RDMA y gVNIC:
Borra las reglas de firewall y las redes:
Borra tu proyecto
Borra un Google Cloud proyecto:
gcloud projects delete PROJECT_ID