AlphaGenome 是 Google DeepMind 开发的一款前沿深度学习模型。旨在解读人类基因组的功能性调控代码。该模型能够以单碱基分辨率分析大规模 DNA 序列(最多 100 万个碱基对),预测遗传变异如何影响分子和生物学机制,例如基因表达、染色质可及性和 RNA 剪接。
本文档介绍了如何部署和使用 AlphaGenome,以及使用该模型的硬件和部署要求。
硬件和部署要求
由于 AlphaGenome 具有深度架构和 1 MB 上下文窗口,因此该模型对硬件和内存有严格的要求。本部分涵盖以下内容:
支持的虚拟机和 GPU 配置
AlphaGenome 至少需要一个节点,并且可以使用配备 NVIDIA A100 或 H100 加速器的特定机器类型部署到 Agent Platform 端点。
Agent Platform 端点可无缝扩展。如果需要额外容量来处理增加的请求量,管理员可以配置自动扩缩功能,以便根据需要持续添加节点。如需了解详情,请参阅使用自动扩缩功能扩缩推理节点。
支持的加速器和机器类型
管理员必须从以下支持的机器类型中进行选择,这些机器类型可提供所需的 80 GB GPU 内存:
- NVIDIA H100 (80 GB):
a3-highgpu-1g、a3-highgpu-2g、a3-highgpu-4g、a3-highgpu-8g - NVIDIA A100 (80 GB):
a2-ultragpu-1g、a2-ultragpu-2g、a2-ultragpu-4g、a2-ultragpu-8g - NVIDIA H100 Mega (80 GB):
a3-megagpu-8g
如需了解详细规范,请参阅为推理配置计算资源。
配额要求
在部署之前,管理员必须确保 Google Cloud 项目在目标区域中分配了足够的 GPU 服务配额:
aiplatform.googleapis.com/custom_model_serving_nvidia_h100_gpusaiplatform.googleapis.com/custom_model_serving_nvidia_a100_gpuscompute.googleapis.com/gpus_per_gpu_family
部署 AlphaGenome
AlphaGenome 可作为自行部署的模型从 Model Garden 中获取。如需详细了解如何预配端点基础架构并将模型部署到 Google Cloud 项目,请参阅从 Model Garden 部署开放模型。
使用 AlphaGenome
用户可以使用 Python SDK 或 REST API 以编程方式与已部署的 AlphaGenome 端点进行交互。
如需查看完整的 API 参考文档、参数定义和详细的架构,请参阅 AlphaGenome 官方文档。
前提条件和身份验证
对已部署端点的访问权限使用 Google Cloud Identity and Access Management 进行管理。确保执行环境(例如本地终端、虚拟机或 Colab)已通过具有 Agent Platform User (roles/aiplatform.user) 角色的凭据(服务账号或最终用户凭据)进行身份验证。
用法
Python
安装 SDK
AlphaGenome Cloud SDK 的 Wheel 文件可在 GoogleCloudPlatform GitHub 代码库中找到。您可以通过运行以下命令下载 Wheel 文件:
# Download the whl file using -
wget -q https://github.com/GoogleCloudPlatform/vertex-ai-samples/raw/main/notebooks/community/alphagenome/whl/alphagenome_cloud_sdk-0.4.2.11-py3-none-any.whl
# Install the whl file
pip install alphagenome_cloud_sdk-0.4.2.11-py3-none-any.whl
初始化客户端
您必须先初始化客户端,然后才能使用模型:
from alphagenome.models import dna_client
from alphagenome_cloud_sdk.models import dna_client_http
# Create the HTTP client pointing to the Agent Platform endpoint.
# The `service_account` parameter is optional and only required if you are
# choosing to authenticate via service account impersonation.
dna_model = dna_client_http.create_http_client(
vertex_ai_url=vertex_ai_url,
# service_account=service_account # Uncomment to use service account impersonation
)
预测 DNA 序列的轨道
使用 predict_sequence 预测原始 DNA 字符串的基因组模态:
# Pad a synthetic sequence to 1 MB using 'N' for unknown/padding bases
padded_sequence = 'GATTACA'.center(dna_client.SEQUENCE_LENGTH_1MB, 'N')
output = dna_model.predict_sequence(
sequence=padded_sequence,
requested_outputs=[
dna_client.OutputType.CAGE, # Transcription Start Sites
dna_client.OutputType.DNASE, # Chromatin Accessibility
],
ontology_terms=[
'UBERON:0002048', # Lung tissue ontology term
]
)
# Access prediction values (shape: sequence_length, num_tracks)
dnase_signals = output.dnase.values
dnase_metadata = output.dnase.metadata
预测参考基因组区间的轨道
使用 predict_interval 直接从参考基因组中的特定染色体区域预测模态:
from alphagenome.data.genome import Interval
# Define a genomic interval and resize it to the 1Mb context window
interval = Interval(
chromosome='chr19',
start=40991281,
end=41018398,
strand='.',
name='CYP2B6'
).resize(dna_client.SEQUENCE_LENGTH_1MB)
output = dna_model.predict_interval(
interval=interval,
requested_outputs=[dna_client.OutputType.RNA_SEQ],
ontology_terms=['UBERON:0001114'] # Right liver lobe
)
对变体效应(计算机模拟诱变)进行评分
使用 score_variant 比较参考 (REF) 序列的预测表达与替代 (ALT) 突变序列的预测表达:
from alphagenome.data import genome
from alphagenome.models import variant_scorers
# Define the genetic variant
variant = genome.Variant(
chromosome='chr22',
position=36201698,
reference_bases='A',
alternate_bases='C',
)
# Select the variant scoring method for RNA-Seq
variant_scorer = variant_scorers.RECOMMENDED_VARIANT_SCORERS['RNA_SEQ']
# Execute the scoring
variant_scores = dna_model.score_variant(
interval=variant.reference_interval.resize(dna_client.SEQUENCE_LENGTH_1MB),
variant=variant,
variant_scorers=[variant_scorer],
fix_negative_strand=True
)
# Output is returned as an AnnData object containing raw and quantile scores
print("Scores shape:", variant_scores[0].X.shape)
REST
客户端可以使用标准 REST 客户端工具(例如 curl)查询已部署的端点:
# Set your base endpoint URL
export ENDPOINT_URL="https://<your-endpoint-url>"
# (Optional) If you choose to impersonate a service account, set this variable
# export SERVICE_ACCOUNT="your-service-account-email@your-project.iam.gserviceaccount.com"
# Generate an OAuth2 access token using your current credentials
# If using service account impersonation, append: --impersonate-service-account=$SERVICE_ACCOUNT
export TOKEN=$(gcloud auth print-access-token)
curl -X POST \
-H "Authorization: Bearer $TOKEN" \
-H "Content-Type: application/json" \
-d '{
"model": "google/alphagenome-003",
"instances": [
{
"request_type": "predict_interval",
"data": {
"interval": {
"chromosome": "chr19",
"start": "40480552",
"end": "41529128",
"strand": "STRAND_UNSTRANDED"
},
"organism": "ORGANISM_HOMO_SAPIENS",
"requestedOutputs": ["OUTPUT_TYPE_ATAC"]
}
}
]
}' \
${ENDPOINT_URL}:streamRawPredict
请注意,AlphaGenome 端点需要在基本端点网址后附加 streamRawPredict 操作。
价格
AlphaGenome 需要付费订阅。如需了解 AlphaGenome 价格,请与 Google Cloud 销售专家联系,或与您的 Google Cloud客户支持团队合作。
您需要负责支付用于托管模型的基础设施费用,包括 Agent Platform 端点和部署模型的 GPU 实例。如需了解详情,请参阅Agent Platform 价格。
限制
AlphaGenome 具有以下限制:
- 仅限研究用途:AlphaGenome 是一款研究工具,不适用于临床诊断用途,也未获准用于临床诊断用途。
- 1 MB 上下文范围:无法在单个预测查询中捕获距离超过 1 MB 的基因组相互作用。
- 不支持微调:不支持在私有训练数据集上对 AlphaGenome 基础模型进行微调。该模型仅可用于推理。
科学参考目录
为了支持科学界和开发者社区,下表列出了 AlphaGenome 的主要参考资料、文献和资源:
| 资源类型 | 标题和链接 | 说明 |
|---|---|---|
| 经过同行评审的文章 | 利用 AlphaGenome 推进调控变异效应预测,Nature(2026 年 1 月) | 详细介绍模型架构、评估和性能基准的主要科学出版物。 |
| 预印版文章 | AlphaGenome:利用统一的 DNA 序列模型推进了监管变异效应预测,bioRxiv(2025 年 7 月) | 同行评审前的初始手稿。 |
| 通知 | AlphaGenome:利用 AI 更好地了解基因组,Google DeepMind 博客(2025 年 6 月) | 概述该模型对基因组学影响的高级发布博文。 |
| API 文档 | AlphaGenome 文档 | Python SDK 和 HTTP API 架构的技术文档。 |
| 视频演示 | AlphaGenome:利用 AI 更好地了解基因组 | 视频演示,简要介绍了模型功能和基本互动流程。(视频时长:30 分钟) |
| 快速入门笔记本 | AlphaGenome 快速入门 Colab 笔记本 | 一个笔记本,其中提供了 SDK 初始化和变体效应评分的可执行示例。 |
支持与反馈
您可以通过以下方式获取 AlphaGenome 支持:
- 基因组学科学和模型输出支持:如需讨论生物学、模型预测、可解释性,或与 Google DeepMind 互动,请访问 alphagenomecommunity.com,加入 AlphaGenome 和 EDM 公共社区论坛。
- 基础设施和平台支持:如果您有关于Google Cloud 配额、加速器、客户端库问题、结算等方面的问题,请与您的客户支持团队联系,或向标准Google Cloud 支持团队提交工单。