Panoramica dei tutorial sui workload AI

Per aiutarti a eseguire workload di AI/ML proof-of-concept (POC), questa pagina fornisce un overview dei tutorial di AI Hypercomputer che descrivono l'intero processo di deployment dei modelli di AI comuni sui Google Cloud prodotti.

Questi tutorial sono progettati per ML engineer, ricercatori, amministratori e operatori di piattaforme e specialisti di dati e AI. Per utilizzare questi tutorial in modo efficace, devi avere una conoscenza di base dei concetti di machine learning e competenze con i Google Cloud servizi. L'esperienza con il deployment e la gestione dei modelli di AI ti aiuta anche a comprendere questi contenuti.

Categorie di tutorial

I tutorial sui workload di AI sono organizzati nelle seguenti categorie:

Esegui l'inferenza con vLLM su GKE

Questi tutorial descrivono come eseguire il deployment e pubblicare modelli linguistici di grandi dimensioni (LLM) per l'inferenza utilizzando il framework di pubblicazione vLLM su Google Kubernetes Engine (GKE). Imparerai a utilizzare le funzionalità di orchestrazione dei container di GKE per workload di inferenza efficienti. Questi tutorial trattano l'accesso ai modelli utilizzando Hugging Face, la configurazione dei cluster GKE (ad esempio in modalità Autopilot), la gestione delle credenziali e il deployment dei container vLLM per l'interazione con LLM come Gemma 3, Llama 4 e Qwen3.

Esegui il fine-tuning

Questi tutorial descrivono come eseguire il fine-tuning degli LLM per attività specifiche su vari Google Cloud tipi di cluster, tra cui GKE e Slurm. Ad esempio, puoi eseguire il fine-tuning di Gemma 3 su cluster GKE multi-nodo e multi-GPU (ad esempio utilizzando istanze VM A4 con GPU NVIDIA B200 ) e cluster Slurm. Creerai immagini VM personalizzate, configurerai reti RDMA ed eseguirai job di fine-tuning distribuiti con librerie come Hugging Face Accelerate e FSDP. Alcuni tutorial trattano anche l'utilizzo di framework come Ray per le attività correlate alla visione.

Esegui l'addestramento

Questi tutorial descrivono come addestrare o pre-addestrare gli LLM su cluster ad alte prestazioni. Ad esempio, imparerai a pre-addestrare modelli come Qwen2 su cluster Slurm multi-nodo e multi-GPU con macchine virtuali A4. Esegui il deployment dei cluster Slurm utilizzando il Google Cloud Cluster Toolkit, crei immagini VM personalizzate , configuri istanze Filestore condivise, configuri la rete RDMA ad alta velocità ed esegui job di pre-addestramento distribuiti con Hugging Face Accelerate.

Passaggi successivi

Esplora i tutorial di AI Hypercomputer: