Gemini 2.5 Flash(支持 Gemini Live API 原生音频)具有我们针对 Gemini Live API的先进原生音频功能。除了标准 Gemini Live API 功能之外,此模型还包括:
- 增强的音质: 体验大幅提升的音质,仿佛在与真人对话。
- 增强的语音质量和适应性: Gemini Live API 原生音频提供更丰富、更自然的语音互动,支持 30 种高清语音,涵盖 24 种语言。
- 推出 主动音频: (预览版)启用主动音频后,模型仅在相关时做出回答。该模型仅针对定向到设备的查询主动生成文本转写和音频回答 ,不会回答非定向到设备的查询 。
- 推出共情对话: 使用 Gemini Live API 原生音频的模型可以理解用户的情感表达并做出适当响应,从而实现更细致的 对话。
- 改进了打断功能: 即使在嘈杂的环境中,也能更自然、更可靠地打断 Gemini。
- 强大的函数调用: 我们提高了触发率, 使 Gemini 能够成功执行您定义的函数, 从而支持您的应用场景。
- 准确的转写: 音频转文字 的转写准确性已得到显著提升。为了获得更好的结果,您可以 提供语言提示,引导模型使用正确的 语言。如需了解详情,请参阅 为会话启用音频转写。
- 顺畅的多语言支持: 您可以使用 多种语言与 Gemini 对话,它会毫不费力地在这些语言之间切换,无需 任何预配置。语言不再是障碍。
如需详细了解 Gemini Live API,请参阅:
| 模型 ID | gemini-live-2.5-flash-native-audio |
|
|---|---|---|
| 模态 |
|
|
| token 数量上限 | 上下文窗口 | 128K |
| 输出词元数上限 | 64K | |
| 并发会话数上限 | 1000 | |
| 功能 |
|
|
| 工具 | ||
| 使用选项 |
|
|
| 技术规范 | 图片 |
|
| 视频 |
|
|
| 音频 |
|
|
| 参数默认值 |
|
|
| 支持的区域 |
|
|
| 版本 |
|
|
| 安全控制 | 在线预测 |
|
| 如需了解详情,请参阅安全控制。 | ||