Gemini 2.5 Flash(支持 Gemini Live API)

带有 Gemini Live API 原生音频的 Gemini 2.5 Flash 具有我们针对 Gemini Live API 的先进原生音频功能。除了标准 Gemini Live API 功能之外,此模型还包括:

  • 增强的音质:体验大幅提升的音质,仿佛在与真人对话。
  • 增强的语音质量和适应性:Gemini Live API 原生音频提供更丰富、更自然的语音互动,支持 24 种语言30 种高清语音
  • 推出主动音频:(预览版)启用主动音频后,模型仅在相关时做出回答。该模型仅针对定向到设备的查询主动生成文本转写和音频回答,不会回答非定向到设备的查询。
  • 推出共情对话:使用 Gemini Live API 原生音频的模型可以理解用户的情感表达并做出适当响应,从而实现更细致的对话。
  • 改进了打断功能:即使在嘈杂的环境中,也能更自然、更可靠地打断 Gemini。
  • 强大的函数调用:我们提高了触发率,使 Gemini 能够成功执行您定义的函数,从而支持您的应用场景。
  • 准确的转写:音频转文字的转写准确性已得到显著提升。为了获得更好的结果,您可以提供语言提示,引导模型使用正确的语言。如需了解详情,请参阅为会议启用音频转写功能
  • 顺畅的多语言支持:您可以使用多种语言与 Gemini 对话,它会毫不费力地在这些语言之间切换,无需任何预配置。语言不再是障碍。

如需详细了解 Gemini Live API,请参阅:

在 Agent Studio 中试用 查看价格

模型 ID gemini-live-2.5-flash-native-audio
模态
文本 输入和输出
图片 仅限输入
音频 输入和输出
视频 仅限输入
token 数量上限 上下文窗口 128K
输出词元数上限 64K
并发会话数上限 1000
功能
工具
使用选项
技术规范 图片
  • 每个提示的图片数量上限: 3,000
  • 内嵌数据或通过控制台直接上传的每个文件的文件大小上限: 7 MB
  • Google Cloud Storage 中每个文件的文件大小上限: 30 MB
  • 支持的 MIME 类型:
    image/pngimage/jpegimage/webpimage/heicimage/heif
视频
  • 标准分辨率:768 x 768
  • 支持的 MIME 类型:
    video/x-flvvideo/quicktimevideo/mpegvideo/mpegsvideo/mpgvideo/mp4video/webmvideo/wmvvideo/3gpp
音频
  • 对话时长上限:默认时长为 10 分钟,可延长
  • 所需的音频输入格式:原始 16 位 PCM 音频,采样率 16kHz,小端序
  • 所需的音频输出格式:原始 16 位 PCM 音频,采样率 24kHz,小端序
  • 支持的 MIME 类型:
    audio/x-aacaudio/flacaudio/mp3audio/m4aaudio/mpegaudio/mpgaaudio/mp4audio/oggaudio/pcmaudio/wavaudio/webm
参数默认值
  • 开始语音识别的灵敏度:低
  • 结束语音识别的灵敏度:高
  • 前缀内边距:0
  • 上下文大小上限:128,000
支持的区域

模型可用性

  • 美国:us-central1us-east1us-east4us-east5us-south1us-west1us-west4
  • 欧洲:europe-central2europe-north1europe-southwest1europe-west1europe-west4europe-west8
版本
  • gemini-live-2.5-flash-native-audio
    • 发布阶段:正式版
    • 发布日期:2025 年 12 月 12 日
    • 退役日期:2026 年 12 月 13 日
安全控制 在线预测
  • 数据驻留
  • CMEK
  • VPC-SC
  • AXT
如需了解详情,请参阅安全控制