优化数据和存储以实现可持续发展

Last reviewed 2026-01-28 UTC

Google Cloud Well-Architected Framework 可持续性核心中的这一原则提供了相关建议,可帮助您优化存储资源的能效和碳足迹。 Google Cloud

原则概览

存储的数据并非被动资源。在数据的整个生命周期内,都会消耗能源并产生碳排放。每 GB 存储的数据都需要持续供电、冷却和管理的物理基础设施。如需实现可持续的云架构,请将数据视为有价值但环境成本高昂的资产,并优先考虑主动数据治理。

您在数据保留、质量和位置方面的决策有助于大幅降低云费用和能源消耗。尽量减少存储的数据,优化存储数据的位置和方式,并实施自动删除和归档策略。减少数据杂乱有助于提高系统性能,并从根本上减少数据的长期环境足迹。

建议

如需优化数据生命周期和存储资源以实现可持续性,请考虑以下各部分中的建议。

优先处理高价值数据

未使用的、重复的或过时的存储数据会继续消耗能源来为底层基础设施供电。如需减少与存储相关的碳足迹,请使用以下技术。

识别并消除重复数据

制定政策,以防止在 多个 Google Cloud 项目或服务中不必要地复制数据集。使用 BigQuery 数据集Cloud Storage 存储分区等中央数据存储库作为单一事实来源,并授予对这些存储库的适当访问权限。

移除影子数据和暗数据

暗数据是指效用或所有者未知的数据。影子数据是指未经授权的数据副本。扫描存储系统,并使用 Knowledge Catalog等数据发现和编目解决方案查找暗数据 和影子数据。 定期审核这些发现,并实施相应流程来归档或删除暗数据和影子数据。

尽量减少 AI 工作负载的数据量

仅存储模型训练和服务所需的特征和处理后的数据。尽可能使用数据抽样、聚合和合成数据生成等技术来实现模型性能,而无需依赖大量原始数据集。

集成数据质量检查

在数据注入时,使用 Managed Service for Apache SparkDataflow或 Knowledge Catalog 等服务实现自动数据验证和数据清理流水线。 低质量的数据会导致存储空间浪费。如果日后将这些数据用于分析或 AI 训练,还会导致不必要的能源消耗。

审核数据的价值密度

定期审核日志和 IoT 流等大数据集。确定是否可以汇总、聚合或下采样任何数据,以保持所需的信息密度并减少物理存储量。

严格评估备份需求

评估是否需要备份可以轻松重新生成的数据。 此类数据的示例包括中间 ETL 结果、临时缓存以及从稳定、永久来源派生的训练数据。仅保留唯一或重新创建成本高昂的数据的备份。

优化存储生命周期管理

自动执行存储生命周期,以便在数据效用下降时,将数据移至节能存储类别或停用数据(视情况而定)。 使用以下技术。

选择合适的 Cloud Storage 存储类别

使用对象生命周期管理功能,根据访问频率自动将 Cloud Storage 中的数据转移到低碳存储 类别。

  • 仅对当前生产模型等正在使用的数据集使用 Standard 存储空间。
  • 将较旧的 AI 训练数据集或访问频率较低的备份等数据转移到 Nearline 或 Coldline 存储空间。
  • 如需长期保留,请使用 Archive Storage,该存储空间经过优化,可大规模提高能效。

实施严格的数据生命周期政策

为日志文件、临时模型工件和过时的中间结果等非必要数据定义明确的自动存留时间 (TTL) 政策。 使用生命周期规则在指定期限后自动删除此类数据。

强制执行资源标记

强制对所有 Cloud Storage 存储分区、BigQuery 数据集和永久性磁盘使用一致的资源标记和标签。创建指示数据所有者、数据用途和保留期限的标记。使用 Organization Policy Service 限制条件,确保将保留期限等必需标记应用于资源。借助标记,您可以自动执行生命周期管理、创建精细的 FinOps 报告并生成碳排放报告。

合理调整计算存储空间规模并取消预配

定期审核附加到 Compute Engine 实例的永久性磁盘,并确保磁盘未过度预配。仅在备份需要时使用快照。删除旧的、未使用的快照。对于数据库,请使用数据保留政策来减小底层永久性磁盘的大小。

优化存储格式

对于为分析工作负载提供服务的存储,请优先使用 Parquet 或优化的 Avro 等压缩列式格式,而不是 JSON 或 CSV 等基于行的格式。列式存储可显著减少物理磁盘空间需求并提高读取效率。这种优化有助于减少相关计算和 I/O 操作的能源消耗。

优化区域性和数据移动

数据的物理位置和移动会影响网络资源的消耗以及存储所需的能源。使用以下技术优化数据区域性。

选择低碳存储区域

根据您的合规性要求,将数据存储在 Google Cloud 无碳能源 (CFE) 百分比较高或电网 碳强度较低的区域 。使用 资源位置 组织政策限制条件,限制在高碳 区域中创建存储分区。如需了解区域的 CFE 和碳强度 数据 Google Cloud ,请参阅区域的 无碳能源 Google Cloud

尽量减少复制

仅在满足强制性灾难恢复 (DR) 或高可用性 (HA) 要求时,才跨区域复制数据。跨区域和多区域复制操作会显著增加数据的能源成本和碳足迹。

优化数据处理位置

如需减少网络数据传输的能源消耗,请在与数据源相同的区域中部署计算密集型工作负载,例如 AI 训练和 BigQuery 处理。

为合作伙伴和客户优化数据移动

如需跨云服务、位置和提供商移动大量数据, 请鼓励合作伙伴和客户使用 Storage Transfer Service 或数据共享 API。避免批量数据转储。对于公共数据集,请使用 请求者付费 存储分区将数据传输和处理费用以及环境 影响转移给最终用户。