Last reviewed 2025-12-12 UTC
本文档提供了使用 AI 根据音频输入生成播客的应用的概要架构。
本文档的目标受众群体包括为媒体和营销行业构建和管理云端生成式 AI 应用的架构师、开发者和管理员。本文档假定您对 生成式 AI有基础了解。
本文档的 部署 部分提供了涉及多模态输入和输出格式的生成式 AI 工作负载的代码示例。
架构
下图展示了播客制作应用在 中的架构 Google Cloud。该应用使用 AI 根据音频文件(例如体育赛事的特邀评论)生成播客。
该架构展示了以下流程:
- 用户将音频文件上传到 Cloud Storage 存储桶。
- Eventarc 触发 Cloud Run 服务。
- Cloud Run 服务将音频文件发送到 Speech-to-Text。
- Speech-to-Text 生成音频文件的时间戳转写内容。
Cloud Run 服务将转写内容发送到 Gemini API,并提示生成播客脚本。
例如,提示可以是根据评论中的某些关键字生成一段 15 分钟的体育赛事精彩集锦播客脚本。
Gemini 生成播客脚本草稿。
Cloud Run 服务将脚本草稿发送给用户。
用户审核并修改脚本草稿,然后将最终脚本发送到 Text-to-Speech。
Text-to-Speech 生成播客音频文件。
使用的产品
此示例架构使用以下 Google Cloud 产品:
- Speech-to-Text:一种 API,使用 Google 的语音识别技术将音频转写为文本。
- Gemini Enterprise Agent Platform:一个综合性平台, 可让您构建、扩缩、治理和优化企业级 AI 智能体。
- Text-to-Speech:一种 API,可根据文本创建自然发音的合成人类语音。
- Cloud Storage:适用于各种数据类型的费用低廉且不受限制的对象存储区。数据可从 内部和外部访问 Google Cloud,并且 跨位置进行复制以实现冗余。
- Cloud Run:一个无服务器计算平台,可让您直接在 Google 可伸缩的基础设施之上运行 容器。
- Eventarc:一种无服务器解决方案,可异步路由由事件触发的消息。
部署
如需试用 Google Cloud 产品来处理涉及 多模态输入和输出格式(例如音频和文本)的工作负载,请尝试以下 代码示例:
后续步骤
- 探索更多生成式 AI 架构指南。
- 如需简要了解中特定于 AI 和机器学习工作负载的架构原则和建议,请参阅 Well-Architected Framework 中的 AI 和机器学习视角 。 Google Cloud
- 如需查看更多参考架构、图表和最佳实践,请浏览 Cloud 架构中心。
贡献者
作者: Kumar Dhanagopal | 跨产品解决方案开发者
其他贡献者:
- Amina Mansour | Cloud Platform 评估团队主管
- Megan O'Keefe | 开发者技术推广工程师
- Samantha He | 技术文档工程师
- Shir Meir Lador | 开发者关系工程经理