使用 Gemini 设计和优化 GKE 集群

本文档介绍了如何通过向 Gemini 发出提示来规划和设计您的 集群 。

Compute Advisor 是控制台中由 Gemini 提供支持的 AI 赋能界面,可帮助您评估硬件选项、估算 部署费用,以及查看集群的推荐配置。 Google Cloud 为了定制建议,Gemini 会检查您的配额限制、现有预留、 承诺使用折扣 (CUD)默认区域和可用区以及任何 资源位置限制,从而评估您的 Google Cloud 项目。 通过使用 Gemini 帮助您进行规划,您可以在创建或修改 GKE 集群之前为工作负载找到 最佳配置。

如需详细了解在创建 GKE 集群之前或创建时必须配置的组件,请参阅GKE 概览

限制

在 Google Cloud 控制台中向 Gemini 发出提示时,您无法使用 Gemini 创建、修改或删除资源。

准备工作

当您使用 Google Cloud 控制台访问 Google Cloud 服务 和 API 时,无需设置身份验证。

所需角色

如需获得访问 Gemini 并向其发出提示所需的权限,请让您的管理员为您授予项目的Kubernetes Engine Cluster Viewer (roles/container.clusterViewer) IAM 角色。如需详细了解如何授予角色,请参阅管理对项目、文件夹和组织的访问权限

此预定义角色可提供 访问 Gemini 并向其发出提示所需的权限。如需查看所需的确切权限,请展开所需权限部分:

所需权限

如需访问 Gemini 并向其发出提示,您需要拥有以下权限:

  • 如需查看集群列表: container.clusters.list

您也可以使用自定义角色或其他预定义角色来获取这些权限。

在 Google Cloud 控制台中访问 Gemini

如需在 Google Cloud 控制台中访问 Gemini,请完成以下 步骤:

  1. 在 Google Cloud 控制台中,前往概览页面。

    前往概览

  2. 使用 Compute Advisor 设计基础架构 部分中,您可以查看以下内容:

    Compute Advisor 页面的屏幕截图以及构成该页面的界面元素。

    上图中的界面元素如下:

    • 快速操作提示卡片:一组卡片,每张卡片都包含一个示例 提示。如果您点击一张卡片, Google Cloud 控制台会自动 在提示框中填充示例提示。

    • 提示框:您可以在此字段中输入和提交提示。如需提交提示,请点击提交提示

    • 查看之前的对话:借助此功能,您可以查看过去对话的详细信息并继续对话,或者删除不再需要的话题(如果不再需要)。

    • 对话记录侧边栏:显示您最近的聊天记录。只有在您从概览 页面开始发出提示后,此面板才会显示。 您可以按如下方式与此面板互动:

      • 如需开始新对话,请点击发起新聊天

      • 如需继续最近的对话,请在最近的聊天 部分中点击该对话。

      • 如需查看所有对话的列表,请点击查看全部 。在我的记录 页面上,您可以查看过去对话的详细信息并继续对话,或者删除不再需要的对话。

向 Gemini 发出提示

提交提示后,Gemini 会开始生成回答。 系统会显示一个窗格, Google Cloud 控制台会在该窗格中显示对您的提示的回答 ,如以下屏幕截图所示:

提交提示后的 Compute Advisor 页面屏幕截图。

根据您的提示,回答窗格包含以下元素:

  • 情境基础:Gemini 会自动评估您的 项目情境,以提供高度定制的建议,包括配额 限制、现有预留、CUD、默认区域和可用区以及任何 资源位置限制。

  • 互动式代码段:Gemini 会生成 gcloud 命令、REST API 方法或 Terraform 资源。您可以复制并粘贴这些代码段,或在 Cloud Shell 中运行它们。

  • 可视化画布:Gemini 会将建议整理成 结构化表格和并排比较。此视图有助于您评估产品功能和架构方法。它还为您的使用场景提供了实现方案。

以下部分概述了撰写提示的最佳实践,以及 您在创建或修改 GKE 集群之前可以使用的示例提示。

关于提示的最佳实践

为了从 Gemini 获得最准确且可操作的建议,我们建议您以与代码块相同的方式构建提示。这种方法通过使用明确的参数声明、角色定义、具体说明和明确的输出格式来指导生成式 AI。

向 Gemini 发出提示时,请考虑以下最佳实践:

  • 专注于设计和规划:我们建议您不要向 Gemini 发出提示来排查 GKE 集群 错误。如需解决这些错误,请参阅 排查 GKE 问题

  • 指定人设或角色:声明 Gemini 要采用的目标角色或人设,例如 IT 管理员、AI 研究员或平台工程师。这种方法可以指导生成的建议的语气、深度和专业程度。

  • 提供明确的编号说明:将您的目标分解为 具体的、分步的问题或任务。这种方法可以构建 Gemini 的推理过程,并有助于确保 Gemini 满足您的所有要求。

  • 定义特定的输出格式:明确说明您希望 建议的格式,例如分步说明、Markdown 比较表或可直接使用的 gcloud 代码 块。

  • 利用自动情境基础:您无需在提示中添加 默认区域或可用区、可用配额、CUD 或资源位置 限制。Gemini 可以在您的 Google Cloud 项目中访问此 信息。

  • 以迭代方式优化设计:您可以通过发送新提示来修改或扩展 Gemini 生成的回答 。例如,您可以要求助理将网络建议添加到部署方案中,或修改存储要求,而无需开始新对话。

示例提示

以下是一些示例提示,可帮助您设计和优化 GKE 集群:

  • 集群拓扑和节点池配置:如需确定工作负载的最佳 GKE 模式、机器类型和节点池配置,请使用如下提示:

    Act as a cloud architect. I need to design a GKE cluster topology for a
    scalable microservices application that requires both GPU nodes for AI
    inference and CPU nodes for general-purpose APIs.
    
    Please provide the following:
    1. A comparison of running this workload on GKE Autopilot versus GKE Standard.
    2. Recommendations for GKE machine types for the GPU node pool.
    3. The optimal autoscaling and auto-provisioning settings.
    
    Format the comparison as a Markdown table, and provide the cluster creation
    steps as a ready-to-use gcloud CLI command.
    
  • 预配模型和费用优化:如需评估预配 模型并优化批处理工作负载的资源利用率, 请使用如下提示:

    Act as an IT administrator. I need to design a cost-optimized GKE cluster
    to run large-scale batch processing workloads that are fault-tolerant.
    
    Please provide the following:
    1. A cost and reliability comparison of using Spot VMs versus standard VMs
       in GKE node pools.
    2. An explanation of how to configure Kueue for queueing training jobs.
    3. A manifest snippet configuration to deploy the workloads onto Spot VM nodes.
    
    Format the comparison as a Markdown table, and provide the manifest as a
    ready-to-use code block.
    

后续步骤