谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking:语音智能体登顶 Artificial Analysis 语音质量榜
9 月 15 日谷歌同时上线两款实时语音模型,Extended Thinking 版以 82.6 登顶 Artificial Analysis 语音质量指数,τ-Voice 任务完成率 68.6%。
2026 年 9 月 15 日,Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,称这是其迄今最先进的两款实时对话模型,并宣布即日起通过 Gemini API、Google Workspace 与 Gemini 应用开始推送。两款模型分别面向规模化与高复杂度任务,后者可在对话进行中于后台完成多步推理与工具调用。
两款模型的分工
- Gemini 3.8 Live:官方描述为“面向规模与成本效率构建”,兼顾对话智能、流畅对话与视觉接地(visual grounding)。
- Gemini 3.8 Live Extended Thinking:面向高复杂度任务,具备更强的智能与多步推理;它“边推理边说话”,用“让我查一下……”这类早期口头提示确认收到请求,并以实时进度旁白讲解后台多步任务。
- 3.8 Live 以近乎实时的方式处理视觉输入,可在对话中自动检测并在 97 种支持语言之间切换,同时在后台执行工具与 API 调用而不打断对话。
官方列出的成绩
Google 在公告中给出的数字集中在语音智能体类基准上:
- Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上取得综合第一,得分 82.6;在 τ-Voice 的智能体任务完成率上为 68.6%,在 Sierra 的 τ-Voice-banking 基准上为 35.1%;Big Bench Audio 得分 97.7%。
- Gemini 3.8 Live 在 Speech Agent Arena 排名第二,官方称其在用户偏好度上表现突出。
- 在 ServiceNow 用于评估语音智能体的 EVA-Bench 上,Google 称两款模型在复杂工作流上推进了准确率与对话质量之间的帕累托前沿,并注明该测试是在 Gemini Enterprise Agent Platform 的 Live API 上运行。
关于价格,公告只称 Extended Thinking “保持与其他前沿模型相比极具竞争力的价位”,未公布每 token 或每分钟的具体数字。
在哪里能用
3.8 Live 与 3.8 Live Extended Thinking 都自 9 月 15 日起开始推送:开发者在 Gemini API 与 Google AI Studio 可用;企业侧在 Gemini Enterprise 中为私有预览,并将进入 Gemini Enterprise for Customer Experience;普通用户可在 Search Live 使用 3.8 Live,在 Gemini Live 使用 Extended Thinking,Workspace 侧对应 Docs Live、Gmail Live 与 Keep Live,其中 Docs 面向 Google AI Pro 与 Ultra 订阅者,Gmail 与 Keep 面向所有 Google AI 订阅者。
生态与合作方包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等开发平台,以及 Salesforce、Genspark 与 Lumeris 等公司。
可核验性与后续
所有由我们 AI 产品生成的音频都带有 SynthID 水印。——Google 公告
Google 说明其音频输出统一嵌入不可感知的 SynthID 水印以便识别 AI 生成内容,并引导读者查阅随发布的模型卡了解安全与责任细节。值得关注的是官方尚未披露的部分:具体定价、延迟数字,以及 EVA-Bench 之外的第三方复现结果。
AI Tools Daily 是中英双语新闻室,追踪 AI 工具发布、产品更新与行业趋势。 编辑准则 · 提交更正