AI 工作负载教程概览

为帮助您运行概念验证 (POC) AI/机器学习工作负载,本页面简要介绍了 AI Hypercomputer 教程,这些教程介绍了在 Google Cloud 产品上部署常见 AI 模型的完整过程。

这些教程专为机器学习 (ML) 工程师、研究人员、平台管理员和运维人员以及数据和 AI 专家而设计。如需有效使用这些 教程,您应该对机器学习 概念有基本的了解,并熟练掌握 Google Cloud 服务。部署和管理 AI 模型的经验也有助于您理解此内容。

教程类别

AI 工作负载教程分为以下几类:

在 GKE 上使用 vLLM 运行推理

这些教程介绍了如何使用 Google Kubernetes Engine (GKE) 上的 vLLM 服务框架部署和提供大语言模型 (LLM) 以进行推理。您将学习使用 GKE 的容器编排功能来处理高效的推理工作负载。这些教程涵盖了使用 Hugging Face 访问模型、设置 GKE 集群(例如,在 Autopilot 模式下)、处理凭据以及部署 vLLM 容器以与 Gemma 3、Llama 4 和 Qwen3 等 LLM 进行交互。

运行微调

这些教程介绍了如何针对各种 Google Cloud 集群类型(包括 GKE 和 Slurm)中的特定任务微调 LLM。例如,您可以在多节点和多 GPU GKE 集群(例如,使用具有 NVIDIA B200 GPU 的 A4 虚拟机实例)和 Slurm 集群上微调 Gemma 3。您将创建自定义虚拟机映像、配置 RDMA 网络,并使用 Hugging Face Accelerate 和 FSDP 等库执行分布式微调作业。一些教程还介绍了如何使用 Ray 等框架来处理与视觉相关的任务。

运行训练

这些教程介绍了如何在高性能集群上训练或预训练 LLM。例如,您将学习在具有 A4 虚拟机的多节点 和多 GPU Slurm 集群上预训练 Qwen2 等模型。您可以使用 Google Cloud Cluster Toolkit 部署 Slurm 集群、创建自定义虚拟机映像、配置共享 Filestore 实例、配置高速 RDMA 网络,并使用 Hugging Face Accelerate 运行分布式预训练作业。

后续步骤

探索 AI Hypercomputer 教程: