本文档介绍了如何通过提示 Compute Advisor(一种由 Gemini 提供支持的 AI 赋能的界面)来规划和设计 GPU 实例或集群。如需详细了解在创建集群之前或创建集群时必须配置的组件,请参阅规划和创建 AI 基础设施。
Compute Advisor 可帮助您评估硬件选项、估算部署费用,以及查看集群的推荐配置。 为了量身定制建议,Compute Advisor 会通过检查您的配额限制、现有预留、承诺使用折扣 (CUD)、默认区域和可用区以及任何资源位置限制条件来评估您的Google Cloud 项目。借助 Compute Advisor 规划,您可以在创建或修改集群之前,为工作负载实现最佳配置。
限制
在 Google Cloud 控制台中提示 Compute Advisor 时,您无法直接创建、修改或删除资源。
准备工作
当您使用 Google Cloud 控制台访问 Google Cloud 服务和 API 时,无需设置身份验证。
所需的角色
如需获得访问 Gemini 并向其发出提示所需的权限,请让您的管理员为您授予项目的 Cluster Director Viewer (roles/hypercomputecluster.viewer) IAM 角色。
如需详细了解如何授予角色,请参阅管理对项目、文件夹和组织的访问权限。
此预定义角色包含访问 Gemini 并向其发出提示所需的权限。如需查看所需的确切权限,请展开所需权限部分:
所需权限
如需访问 Gemini 并向其提问,您需要具备以下权限:
-
如需查看集群列表,请执行以下操作:
hypercomputecluster.clusters.list
在 Google Cloud 控制台中访问 Compute Advisor
如需在 Google Cloud 控制台中访问 Compute Advisor,请完成以下步骤:
在 Google Cloud 控制台中,前往 Compute Advisor 页面。
页面准备就绪后,您可以查看以下内容:
上图所示的界面元素如下:
“对话记录”侧边栏:显示您最近的对话。您可以按如下方式与此面板互动:
如要发起新对话,请点击发起新聊天。
如需继续最近的对话,请在最近的聊天部分中点击相应对话。
如需查看所有对话的列表,请点击查看全部。在我的历史记录页面上,您可以查看过往对话的详细信息并继续对话,也可以删除不再需要的对话。
快速操作提示卡片:一组卡片,每张卡片都包含一个提示示例。如果您点击某个卡片, Google Cloud 控制台会自动在提示框中填充示例提示。
提示框:您可以在此字段中输入和提交提示。如需提交提示,请点击提交提示。
提示 Compute Advisor
提交提示后,Compute Advisor 会开始生成回答。系统会显示一个窗格, Google Cloud 控制台会在该窗格中显示对您提示的回答,如以下屏幕截图所示:
根据您的提示,回答窗格包含以下元素:
情境化依据:Compute Advisor 会自动评估项目情境,以提供高度量身定制的建议,包括配额限制、现有预留、CUD、默认区域和可用区,以及任何资源位置限制。
交互式代码段:Compute Advisor 会生成 gcloud 命令、REST API 方法或 Terraform 资源。您可以复制并粘贴这些代码段,也可以在 Cloud Shell 中运行它们。
可视化画布:Compute Advisor 会将建议整理成结构化表格并进行并排比较。此视图有助于您评估产品功能和架构方法。它还可为您的使用场景提供实现方案。
以下部分概述了编写提示的最佳实践,以及在创建或修改集群之前可以使用的示例提示。
提示方面的最佳实践
为了从 Compute Advisor 获得最准确且可据以采取行动的建议,我们建议您以与代码块相同的方式构建提示。这种方法通过使用清晰的参数声明、角色定义、具体指令和明确的输出格式来引导生成式 AI。
在提示 Compute Advisor 时,请考虑以下最佳实践:
专注于设计和规划:我们建议您不要提示 Compute Advisor 对集群错误进行问题排查。如需解决这些错误,请改为参阅排查创建、更新和删除计算实例时的问题。
指定角色或身份:声明 Compute Advisor 要扮演的目标角色或身份,例如 IT 管理员、AI 研究员或平台工程师。这种方法可指导生成的建议的语气、深度和专业程度。
提供明确的编号指令:将目标分解为具体的、分步的问题或任务。这种方法可规范 Compute Advisor 的推理过程,并有助于确保 Compute Advisor 满足您的所有要求。
定义特定的输出格式:明确说明您希望建议采用哪种格式,例如分步说明、Markdown 比较表格或可直接使用的 gcloud 代码块。
利用自动上下文接地:您无需在提示中添加默认区域或可用区、可用配额、CUD 或资源位置限制。Compute Advisor 可以访问您 Google Cloud 项目中的这些信息。
迭代式优化设计:您可以发送新提示,修改或扩展 Compute Advisor 生成的回答。例如,您可以让助理在部署方案中添加网络建议,或修改存储空间要求,而无需开始新的对话。
示例提示
以下是一些可用于帮助您设计和优化集群的提示示例:
集群拓扑和放置策略:如需确定高性能 AI 工作负载的最佳部署模型和展示位置策略,请使用如下提示:
Act as an AI researcher. I need to design a GPU cluster topology in Cluster Director to train a foundation large language model that maximizes ML goodput and secures accelerator capacity. Please provide the following: 1. A comparison of clustered GPU machine series across available regions. 2. An explanation of how compact placement policies and workload policies reduce network latency and boost goodput. 3. The optimal configuration for future reservations in AI Hypercomputer to secure capacity for this workload. Format the comparison as a Markdown table, and provide the deployment steps as a ready-to-use gcloud code block.配置模型和费用优化:如需评估配置模型并降低批处理费用,请使用如下提示:
Act as an IT administrator. I need to select the most cost-effective consumption option to run large fault-tolerant AI batch jobs on clusters in Cluster Director without data loss. Please provide the following: 1. A cost and availability comparison of Flex-start VMs against Spot VMs for AI workloads. 2. An explanation of how atomic allocation in Flex-start VMs provisions all accelerator nodes at the exact same time. 3. A cluster configuration with checkpoint storage to save model state before Compute Engine reclaims a Spot VM. Format the comparison as a Markdown table, and provide the configuration steps to complete in the Google Cloud console.
后续步骤
如需查看如何在 AI Hypercomputer 中获取容量和配额,请参阅容量概览。
如需比较加速器选项并选择合适的 GPU 系列,请参阅在通用 GPU 和集群 GPU 之间进行选择。
如需选择工具并创建集群,请参阅部署选项概览。