Google发布Gemini实时语音模型:语音智能体开始边聊边调用工具
作者: CBISMB
责任编辑: 宫建强
来源: Google官方博客
时间: 2026-09-21 09:59
浏览: 0
点赞: 0
收藏: 0

语音智能体开始边聊边调用工具。实时语音应用正在从“听写加回答”走向能够保持对话、读取视觉信息并在后台执行任务的完整交互系统。
9月15日,Google面向开发者发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,并进一步介绍Gemini 3.5 Transcribe。相关模型通过Gemini API和Google AI Studio提供,目标场景包括客服、培训、辅助操作、实时字幕和音频分析。
工具调用不再强制打断对话
Gemini 3.8 Live支持异步函数调用:智能体可以在后台请求API或工具,同时继续向用户输出语音。它还可以结合实时视觉输入理解用户“说了什么、看到了什么”,并增强确认码、理赔编号等字母数字混合信息的识别。
Google称,新模型覆盖97种以上语言,并支持把实时音频与结构化数据逐步合并。Extended Thinking版本加入可配置思考能力,适合多步骤推理;但复杂推理也会带来更高时延和成本,开发者需要在即时反馈与任务深度之间做取舍。
转写模型瞄准专业词汇和混合语言
Gemini 3.5 Transcribe支持85种以上语言,可自动处理一句话内或多句话之间的语言切换。开发者还能提供最多1000个词的自定义词表,引导模型识别行业术语、公司名称和专有名词。
官方披露,该模型的平均词错误率为流式4.0%、非流式2.6%。它还提供智能转写模式,可整理格式、处理自我修正并去除部分口头填充词;通过Interactions API处理音频文件时,最长可达1小时,并可输出时间戳与说话人标签。上述指标来自Google披露,实际效果仍会受到语言、口音、噪声和专业词表影响。
编辑观察:真实上线要先解决四类边界
实时语音最容易让演示看起来“像真人”,但企业上线时更应检查四项基础能力:用户能否随时打断,工具调用前是否确认高风险操作,转写与录音如何获得授权并设置保存期限,以及网络抖动时系统如何降级。
客服或业务办理场景还应把“听懂了”与“执行正确”分开评估。团队可分别测量转写准确率、首字响应时间、任务完成率、工具调用失败率和人工接管率,并为姓名、地址、金额、验证码等关键字段增加复述确认。语音智能体真正的门槛,不只是声音自然,而是每一次后台动作都可核对、可停止、可追溯。
配图为AIcent原创AI生成实景风格示意图,非官方新闻现场照片,不使用第三方新闻图片。
参考来源:Google官方博客(2026年9月15日)。正文为基于官方消息的中文整理,编辑观察与事实披露分开呈现。






京公网安备:11010502051901号