AlphaGenome

视频时长:30 分钟

AlphaGenome 是 Google DeepMind 开发的一款前沿深度学习模型。旨在解读人类基因组的功能性调控代码。该模型能够以单碱基分辨率分析大规模 DNA 序列(最多 100 万个碱基对),预测遗传变异如何影响分子和生物学机制,例如基因表达、染色质可及性和 RNA 剪接。

本文档介绍了如何部署和使用 AlphaGenome,以及使用该模型的硬件和部署要求。

硬件和部署要求

由于 AlphaGenome 具有深度架构和 1 MB 上下文窗口,因此该模型对硬件和内存有严格的要求。本部分涵盖以下内容:

支持的虚拟机和 GPU 配置

AlphaGenome 至少需要一个节点,并且可以使用配备 NVIDIA A100 或 H100 加速器的特定机器类型部署到 Agent Platform 端点。

Agent Platform 端点可无缝扩展。如果需要额外容量来处理增加的请求量,管理员可以配置自动扩缩功能,以便根据需要持续添加节点。如需了解详情,请参阅使用自动扩缩功能扩缩推理节点

支持的加速器和机器类型

管理员必须从以下支持的机器类型中进行选择,这些机器类型可提供所需的 80 GB GPU 内存:

  • NVIDIA H100 (80 GB)a3-highgpu-1ga3-highgpu-2ga3-highgpu-4ga3-highgpu-8g
  • NVIDIA A100 (80 GB)a2-ultragpu-1ga2-ultragpu-2ga2-ultragpu-4ga2-ultragpu-8g
  • NVIDIA H100 Mega (80 GB)a3-megagpu-8g

如需了解详细规范,请参阅为推理配置计算资源

配额要求

在部署之前,管理员必须确保 Google Cloud 项目在目标区域中分配了足够的 GPU 服务配额:

  • aiplatform.googleapis.com/custom_model_serving_nvidia_h100_gpus
  • aiplatform.googleapis.com/custom_model_serving_nvidia_a100_gpus
  • compute.googleapis.com/gpus_per_gpu_family

部署 AlphaGenome

AlphaGenome 可作为自行部署的模型从 Model Garden 中获取。如需详细了解如何预配端点基础架构并将模型部署到 Google Cloud 项目,请参阅从 Model Garden 部署开放模型

使用 AlphaGenome

用户可以使用 Python SDK 或 REST API 以编程方式与已部署的 AlphaGenome 端点进行交互。

如需查看完整的 API 参考文档、参数定义和详细的架构,请参阅 AlphaGenome 官方文档

前提条件和身份验证

对已部署端点的访问权限使用 Google Cloud Identity and Access Management 进行管理。确保执行环境(例如本地终端、虚拟机或 Colab)已通过具有 Agent Platform User (roles/aiplatform.user) 角色的凭据(服务账号或最终用户凭据)进行身份验证。

用法

Python

安装 SDK

AlphaGenome Cloud SDK 的 Wheel 文件可在 GoogleCloudPlatform GitHub 代码库中找到。您可以通过运行以下命令下载 Wheel 文件:

# Download the whl file using - 
wget -q https://github.com/GoogleCloudPlatform/vertex-ai-samples/raw/main/notebooks/community/alphagenome/whl/alphagenome_cloud_sdk-0.4.2.11-py3-none-any.whl

# Install the whl file
pip install alphagenome_cloud_sdk-0.4.2.11-py3-none-any.whl

初始化客户端

您必须先初始化客户端,然后才能使用模型:

from alphagenome.models import dna_client
from alphagenome_cloud_sdk.models import dna_client_http

# Create the HTTP client pointing to the Agent Platform endpoint.
# The `service_account` parameter is optional and only required if you are 
# choosing to authenticate via service account impersonation.
dna_model = dna_client_http.create_http_client(
    vertex_ai_url=vertex_ai_url,
    # service_account=service_account  # Uncomment to use service account impersonation
)

预测 DNA 序列的轨道

使用 predict_sequence 预测原始 DNA 字符串的基因组模态:

# Pad a synthetic sequence to 1 MB using 'N' for unknown/padding bases
padded_sequence = 'GATTACA'.center(dna_client.SEQUENCE_LENGTH_1MB, 'N')

output = dna_model.predict_sequence(
    sequence=padded_sequence,
    requested_outputs=[
        dna_client.OutputType.CAGE,   # Transcription Start Sites
        dna_client.OutputType.DNASE,  # Chromatin Accessibility
    ],
    ontology_terms=[
        'UBERON:0002048',             # Lung tissue ontology term
    ]
)

# Access prediction values (shape: sequence_length, num_tracks)
dnase_signals = output.dnase.values
dnase_metadata = output.dnase.metadata

预测参考基因组区间的轨道

使用 predict_interval 直接从参考基因组中的特定染色体区域预测模态:

from alphagenome.data.genome import Interval

# Define a genomic interval and resize it to the 1Mb context window
interval = Interval(
    chromosome='chr19',
    start=40991281,
    end=41018398,
    strand='.',
    name='CYP2B6'
).resize(dna_client.SEQUENCE_LENGTH_1MB)

output = dna_model.predict_interval(
    interval=interval,
    requested_outputs=[dna_client.OutputType.RNA_SEQ],
    ontology_terms=['UBERON:0001114']  # Right liver lobe
)

对变体效应(计算机模拟诱变)进行评分

使用 score_variant 比较参考 (REF) 序列的预测表达与替代 (ALT) 突变序列的预测表达:

from alphagenome.data import genome
from alphagenome.models import variant_scorers

# Define the genetic variant
variant = genome.Variant(
    chromosome='chr22',
    position=36201698,
    reference_bases='A',
    alternate_bases='C',
)

# Select the variant scoring method for RNA-Seq
variant_scorer = variant_scorers.RECOMMENDED_VARIANT_SCORERS['RNA_SEQ']

# Execute the scoring
variant_scores = dna_model.score_variant(
    interval=variant.reference_interval.resize(dna_client.SEQUENCE_LENGTH_1MB),
    variant=variant,
    variant_scorers=[variant_scorer],
    fix_negative_strand=True
)

# Output is returned as an AnnData object containing raw and quantile scores
print("Scores shape:", variant_scores[0].X.shape)

REST

客户端可以使用标准 REST 客户端工具(例如 curl)查询已部署的端点:

# Set your base endpoint URL
export ENDPOINT_URL="https://<your-endpoint-url>"

# (Optional) If you choose to impersonate a service account, set this variable
# export SERVICE_ACCOUNT="your-service-account-email@your-project.iam.gserviceaccount.com"

# Generate an OAuth2 access token using your current credentials
# If using service account impersonation, append: --impersonate-service-account=$SERVICE_ACCOUNT
export TOKEN=$(gcloud auth print-access-token)

curl -X POST \
  -H "Authorization: Bearer $TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/alphagenome-003",
    "instances": [
      {
        "request_type": "predict_interval",
        "data": {
          "interval": {
            "chromosome": "chr19",
            "start": "40480552",
            "end": "41529128",
            "strand": "STRAND_UNSTRANDED"
          },
          "organism": "ORGANISM_HOMO_SAPIENS",
          "requestedOutputs": ["OUTPUT_TYPE_ATAC"]
        }
      }
    ]
  }' \
  ${ENDPOINT_URL}:streamRawPredict

请注意,AlphaGenome 端点需要在基本端点网址后附加 streamRawPredict 操作。

价格

AlphaGenome 需要付费订阅。如需了解 AlphaGenome 价格,请与 Google Cloud 销售专家联系,或与您的 Google Cloud客户支持团队合作。

您需要负责支付用于托管模型的基础设施费用,包括 Agent Platform 端点和部署模型的 GPU 实例。如需了解详情,请参阅Agent Platform 价格

限制

AlphaGenome 具有以下限制:

  • 仅限研究用途:AlphaGenome 是一款研究工具,不适用于临床诊断用途,也未获准用于临床诊断用途。
  • 1 MB 上下文范围:无法在单个预测查询中捕获距离超过 1 MB 的基因组相互作用。
  • 不支持微调:不支持在私有训练数据集上对 AlphaGenome 基础模型进行微调。该模型仅可用于推理。

科学参考目录

为了支持科学界和开发者社区,下表列出了 AlphaGenome 的主要参考资料、文献和资源:

资源类型 标题和链接 说明
经过同行评审的文章 利用 AlphaGenome 推进调控变异效应预测,Nature(2026 年 1 月) 详细介绍模型架构、评估和性能基准的主要科学出版物。
预印版文章 AlphaGenome:利用统一的 DNA 序列模型推进了监管变异效应预测,bioRxiv(2025 年 7 月) 同行评审前的初始手稿。
通知 AlphaGenome:利用 AI 更好地了解基因组,Google DeepMind 博客(2025 年 6 月) 概述该模型对基因组学影响的高级发布博文。
API 文档 AlphaGenome 文档 Python SDK 和 HTTP API 架构的技术文档。
视频演示 AlphaGenome:利用 AI 更好地了解基因组 视频演示,简要介绍了模型功能和基本互动流程。(视频时长:30 分钟)
快速入门笔记本 AlphaGenome 快速入门 Colab 笔记本 一个笔记本,其中提供了 SDK 初始化和变体效应评分的可执行示例。

支持与反馈

您可以通过以下方式获取 AlphaGenome 支持:

  • 基因组学科学和模型输出支持:如需讨论生物学、模型预测、可解释性,或与 Google DeepMind 互动,请访问 alphagenomecommunity.com,加入 AlphaGenome 和 EDM 公共社区论坛。
  • 基础设施和平台支持:如果您有关于Google Cloud 配额、加速器、客户端库问题、结算等方面的问题,请与您的客户支持团队联系,或向标准Google Cloud 支持团队提交工单。