GKE 上的 AI/机器学习编排文档
Google Kubernetes Engine (GKE) 提供了一个统一的平台来编排整个 AI/机器学习生命周期。它可为您提供强大的功能和灵活性,以加速训练、推理和智能体工作负载,从而简化基础设施并开始交付成果。GKE 先进的编排功能可提供:
- 硬件加速器:大规模访问和管理您训练和推理所需的高性能 GPU 和 TPU。
- 堆栈灵活性:与您已经熟悉并信任的分布式计算、数据处理和模型部署框架集成。
- 托管式 Kubernetes 的简易性:充分利用托管式平台的优势,自动执行整个 AI/机器学习生命周期的任务、实现扩缩并提升安全性,同时保持灵活性。
探索我们的博客、教程和最佳实践,了解 GKE 如何优化您的 AI/机器学习工作负载。如需详细了解优势和可用功能,请参阅 GKE 上的 AI/机器学习工作负载简介概览。
立获300美元免费赠金
Google Cloud新用户首次注册即可获得300美元赠金。此外,无论新老用户,均可免费使用20多款产品,积累动手实践经验。
立获300美元免费赠金
Google Cloud新用户首次注册即可获得300美元赠金。此外,无论新老用户,均可免费使用20多款产品,积累动手实践经验。
文档资源
管理 AI 基础设施和加速器
- 概念
- 概念
- 概念
- 最佳做法
- 最佳做法
- 最佳做法
- 快速入门
- 视频
- 视频
大规模训练 AI 模型
- 快速入门
- 教程
- 教程
- 教程
- 教程
- 快速入门
- 操作方法
- 教程
部署 AI 模型以进行推理
- 最佳做法
- 概念
- 最佳做法
- 操作方法
- 快速入门
- 教程
- 教程
- 教程
- 教程
- 教程
相关资源
使用 Cloud Storage 和 GKE 优化 AI 和机器学习工作负载
了解如何在 GKE 上使用 Cloud Storage FUSE 优化 AI 和机器学习工作负载的性能。
使用 Managed Lustre 和 GKE 优化 AI 和机器学习工作负载
了解如何在 GKE 上使用 Managed Lustre 优化 AI 和机器学习工作负载的性能。
使用智能体沙盒隔离 AI 代码执行
了解如何在 GKE 上安装和运行智能体沙盒控制器,以及如何在集群上部署沙盒环境以测试不受信任的 shell 命令。
将开源 Kata Containers 与 GKE Agent Sandbox 搭配使用
了解如何在 GKE 上将开源 Kata Containers 与 Agent Sandbox 搭配使用,以隔离不受信任的代码执行。
使用智能体开发套件 (ADK) 和自托管 LLM 在 GKE 上部署智能体 AI 应用
了解如何使用智能体开发套件 (ADK) 和 vLLM 在 GKE 上部署和管理容器化的智能体 AI 应用,以通过 Llama 3.1 实现可扩缩的推理。
使用智能体开发套件 (ADK) 和 Agent Platform 在 GKE 上部署智能体 AI 应用
了解如何使用智能体开发套件 (ADK) 和 Agent Platform 在 GKE 上部署和管理容器化的智能体 AI 应用,以通过 Gemini 2.0 Flash 实现可伸缩的推理。
通过 Optimum TPU 使用 GKE 中的 TPU 应用开源模型
了解如何通过来自 Hugging Face 的 Optimum TPU 服务框架,使用 GKE 中的张量处理单元 (TPU) 部署 LLM。
通过经济高效且高可用性的 GPU 预配策略在 GKE 上部署 LLM
了解如何使用 DWS Flex-start 优化 GKE 上 LLM 服务工作负载的费用。
利用 Hyperdisk ML 加快 AI/机器学习数据加载速度
了解如何使用 Hyperdisk ML 简化和加速在 GKE 上加载 AI/机器学习模型权重的操作。
通过 JetStream 和 PyTorch 使用 GKE 上的 TPU 应用 LLM
了解如何通过 JetStream 和 PyTorch 使用 GKE 中的张量处理单元 (TPU) 提供 LLM。
使用 GKE 中的 GPU 优化 LLM 推理的最佳实践
了解如何使用 vLLM 和文本生成推理 (TGI) 服务框架,通过 GKE 中的 GPU 优化 LLM 推理性能的最佳实践。
在 GKE 上使用 NVIDIA GPU Operator 管理 GPU 堆栈
了解何时使用 NVIDIA GPU Operator 以及如何在 GKE 上启用 NVIDIA GPU Operator。
为 TPU 上的 LLM 工作负载配置自动扩缩
了解如何使用 GKE Pod 横向自动扩缩器 (HPA) 来设置自动扩缩基础设施,以使用单主机 JetStream 部署 Gemma LLM。
使用 TPU 在 GKE 上通过 Stable Diffusion 模型部署 Ray Serve 应用
了解如何使用 TPU、Ray Serve 和 Ray Operator 插件在 GKE 上部署和提供 Stable Diffusion 模型。
使用 GKE 为 GPU 上的 LLM 工作负载配置自动扩缩
了解如何使用 GKE Pod 横向自动扩缩器 (HPA) 设置自动扩缩基础设施,以通过 Hugging Face 文本生成接口 (TGI) 服务框架部署 Gemma LLM。
在 A3 Mega 虚拟机上使用 Megatron-LM 训练 Llama2
了解如何在 A3 Mega 上运行基于容器的 Megatron-LM PyTorch 工作负载。
通过 GKE 中的多个 GPU 提供 LLM
了解如何将 GKE 与多个 NVIDIA L4 GPU 搭配使用,以提供 Llama 2 70B 或 Falcon 40B。
使用 Ray 在 L4 GPU 上部署 LLM
了解如何在 GKE 中使用 Ray 框架提供 Falcon 7b、Llama2 7b、Falcon 40b 或 Llama2 70b。
使用 JobSet 和 Kueue 编排 TPU 多切片工作负载
了解如何使用 JobSet 和 Kueue 在 GKE 上的多个 TPU 切片上编排 Jax 工作负载。
使用 NVIDIA 数据中心 GPU 管理器 (DCGM) 监控 GKE 上的 GPU 工作负载
了解如何使用 NVIDIA 数据中心 GPU 管理器 (DCGM) 观察 GKE 上的 GPU 工作负载。
快速入门:在 GKE Standard 集群上使用 GPU 训练模型
本快速入门介绍如何使用 GKE 中的 GPU 部署训练模型,并将预测结果存储在 Cloud Storage 中。
在 GKE 上运行大规模机器学习
此视频介绍了 GKE 如何帮助解决大规模训练 AI 模型的常见挑战,以及在 GKE 上训练和提供大规模机器学习模型的最佳做法。
具有 GPU 加速功能的 TensorFlow on GKE Autopilot
本博文是有关创建、执行和清理支持 Tensorflow 的 Jupiter 笔记本的分步指南。
在 GKE 上使用命名空间配额共享实现 Job 排队系统
本教程使用 Kueue 介绍如何实现 Job 排队系统,以及如何配置 GKE 上不同命名空间之间的工作负载资源和配额共享。
使用 GKE 和 Cloud Storage 构建 RAG 聊天机器人
本教程介绍如何将基于检索增强生成的大语言模型应用与上传到 Cloud Storage 存储桶的 PDF 文件集成。
使用 BigQuery、Cloud Run 和 Gemma 在 GKE 上分析数据
本教程介绍了如何利用 BigQuery 进行数据存储和处理、利用 Cloud Run 进行请求处理,以及利用 Gemma LLM 进行数据分析和预测,从而在 GKE 上分析大型数据集。
在 GKE 上进行 AI/机器学习推理的数据加载最佳实践
了解如何在 Google Kubernetes Engine 上缩短机器学习应用的数据加载时间。
节省 GPU 费用:为 GKE 推理工作负载提供更智能的自动扩缩
了解如何微调 GKE 的 Pod 横向自动扩缩器以实现最高效率,从而优化 GPU 推理费用。
在 GKE 上使用 NVIDIA NIM 微服务高效地提供经过优化的 AI 模型
了解如何在 GKE 上轻松部署先进的 NVIDIA NIM 微服务,并加速您的 AI 工作负载。
使用 GKE 上的新 Ray Operator 加速生产环境中的 Ray
了解 GKE 上的 Ray Operator 如何简化 AI/机器学习生产部署,提升性能和可伸缩性。
针对 GKE 中的 GPU 最大限度地提高 LLM 服务吞吐量 - 实用指南
了解如何针对 GKE 中的 GPU 最大限度地提高大语言模型 (LLM) 服务吞吐量,包括基础设施决策和模型服务器优化。
借助 NVIDIA GPU 在 Kubernetes 上使用 JAX 进行机器学习
了解如何在 GKE 上使用 NVIDIA GPU 运行 JAX 多 GPU 多节点应用。
LiveX AI 利用在 GKE 和 NVIDIA AI 上训练和提供服务的 AI 代理,降低客户服务成本
LiveX AI 如何使用 GKE 构建 AI 代理,以提高客户满意度并降低费用。
使用 GKE 和 Cloud SQL 且支持 RAG 的生成式 AI 应用的基础设施
使用 GKE、Cloud SQL、Ray、Hugging Face 和 LangChain 运行具有检索增强生成 (RAG) 功能的生成式 AI 应用的参考架构。
在专利搜索领域进行创新:IPRally 如何借助 GKE 和 Ray 利用 AI
IPRally 如何使用 GKE 和 Ray 构建一个可伸缩的高效机器学习平台,以便更快且更准确地进行专利搜索。
Google Cloud 上的 Gemma 性能深入剖析
在 Cloud GPU 和 Cloud TPU 上利用 Gemma,在 GKE 上提高推理和训练效率。
GKE 上的 Gemma 深入探究:提供开放型生成式 AI 模型的新创新技术
使用出色的 Gemma 开放模型构建可移植且可自定义的 AI 应用,并将其部署到 GKE 上。
如何保护 Ray on Google Kubernetes Engine
应用安全数据分析和安全加固技术以使用 Ray on GKE 训练 AI/机器学习工作负载。
借助 GKEE 上的 NVIDIA NeMo 框架加速您的生成式 AI 之旅
使用 GKE 和 NVIDIA NeMo 框架训练生成式 AI 模型。
借助 Google Kubernetes Engine 使用权重和偏差简化 MLOps
将 Weights & Biases 与 GKE 搭配使用,简化模型开发和部署流程。
在全托管式 GKE 上运行 AI,现在提供了新的计算选项、价格和资源预留
借助 GKE Autopilot,为 AI/机器学习工作负载提供了更好的 GPU 支持和更高的性能,并降低了价格。
Ordaōs Bio 如何利用 GKE 上的生成式 AI
Ordaōs Bio 是领先的生物医学研究和发现 AI 加速器之一,正在寻找肿瘤和慢性炎症疾病新型免疫疗法的解决方案。
GKE 来自一家由 ML 驱动的成长型初创公司
硅谷初创公司 Moloco 如何利用 GKE 和 TensorFlow 企业版的强大功能来增强其机器学习 (ML) 基础架构。