Google发布Gemini实时语音模型:语音智能体开始边聊边调用工具

作者: CBISMB

责任编辑: 宫建强

来源: Google官方博客

时间: 2026-09-21 09:59

浏览: 0

点赞: 0

收藏: 0

原创AI生成实景风格示意图

语音智能体开始边聊边调用工具。实时语音应用正在从“听写加回答”走向能够保持对话、读取视觉信息并在后台执行任务的完整交互系统。

9月15日,Google面向开发者发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,并进一步介绍Gemini 3.5 Transcribe。相关模型通过Gemini API和Google AI Studio提供,目标场景包括客服、培训、辅助操作、实时字幕和音频分析。

工具调用不再强制打断对话

Gemini 3.8 Live支持异步函数调用:智能体可以在后台请求API或工具,同时继续向用户输出语音。它还可以结合实时视觉输入理解用户“说了什么、看到了什么”,并增强确认码、理赔编号等字母数字混合信息的识别。

Google称,新模型覆盖97种以上语言,并支持把实时音频与结构化数据逐步合并。Extended Thinking版本加入可配置思考能力,适合多步骤推理;但复杂推理也会带来更高时延和成本,开发者需要在即时反馈与任务深度之间做取舍。

转写模型瞄准专业词汇和混合语言

Gemini 3.5 Transcribe支持85种以上语言,可自动处理一句话内或多句话之间的语言切换。开发者还能提供最多1000个词的自定义词表,引导模型识别行业术语、公司名称和专有名词。

官方披露,该模型的平均词错误率为流式4.0%、非流式2.6%。它还提供智能转写模式,可整理格式、处理自我修正并去除部分口头填充词;通过Interactions API处理音频文件时,最长可达1小时,并可输出时间戳与说话人标签。上述指标来自Google披露,实际效果仍会受到语言、口音、噪声和专业词表影响。

编辑观察:真实上线要先解决四类边界

实时语音最容易让演示看起来“像真人”,但企业上线时更应检查四项基础能力:用户能否随时打断,工具调用前是否确认高风险操作,转写与录音如何获得授权并设置保存期限,以及网络抖动时系统如何降级。

客服或业务办理场景还应把“听懂了”与“执行正确”分开评估。团队可分别测量转写准确率、首字响应时间、任务完成率、工具调用失败率和人工接管率,并为姓名、地址、金额、验证码等关键字段增加复述确认。语音智能体真正的门槛,不只是声音自然,而是每一次后台动作都可核对、可停止、可追溯。

配图为AIcent原创AI生成实景风格示意图,非官方新闻现场照片,不使用第三方新闻图片。

参考来源:Google官方博客(2026年9月15日)。正文为基于官方消息的中文整理,编辑观察与事实披露分开呈现。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。
地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 商务内容合作QQ:2291221 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除

京ICP备:2022009079号-2

京公网安备:11010502051901号

ICP证:京B2-20230255