Google 发布 Gemini 3.8 Live 与 Extended Thinking:语音模型开始边说边推理、后台调用工具

行业动态

Google 发布 Gemini 3.8 Live 与 Extended Thinking:语音模型开始边说边推理、后台调用工具

栏目:行业动态

摘要

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款实时语音模型分别面向高效对话与复杂多步推理,可结合视觉上下文、后台调用工具并持续保持自然交流,现已陆续进入 Gemini API、AI Studio、Search Live、Gemini Live 与 Workspace。

本文目录

Google于2026年9月15日发布 Gemini 3.8 Live和 Gemini 3.8 Live Extended Thinking,两款模型都面向实时语音交互,但定位有所不同:3.8 Live更强调低延迟、规模化部署和成本效率,Extended Thinking则针对复杂任务加入更强的多步推理能力。Google希望把语音 AI从“实时聊天”推进到可以持续理解上下文、处理视觉输入、调用工具并完成复杂任务的实时智能体。

Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 官方发布主视觉

图片来源:Google

两款模型分别解决什么问题

Gemini 3.8 Live面向需要快速、自然对话的场景,能够在近实时处理中结合语音、视觉上下文和语言理解。它支持在一次对话中自动识别并切换97种语言,同时可以在不中断交流的情况下执行工具和 API调用,用户提出任务后,模型可以先回应并继续对话,让后台任务并行完成。

Gemini 3.8 Live Extended Thinking则进一步面向复杂工作流。它可以一边推理一边说话,在执行多步骤任务时通过语音持续反馈当前进度,而不是长时间沉默等待全部计算完成。Google展示的场景包括根据草图和实时语音反馈生成 React组件、协调多步骤预订和异步函数调用,以及通过自然语言完成较复杂的业务规划任务。

更强的语音智能体能力

Google公布的测试结果显示,Gemini 3.8 Live Extended Thinking在 Artificial Analysis Speech to Speech Quality Index中获得82.6分;在代理任务测试 τ-Voice和 Sierra τ-Voice-banking中分别达到68.6% 和35.1%,Big Bench Audio得分为97.7%。Google还表示,两款模型在 ServiceNow EVA-Bench上兼顾了复杂任务完成能力和对话体验。

Gemini 3.8 Live 系列 EVA-Bench 评测图

图片来源:Google

这些成绩的重点不只是语音识别或语音生成质量,而是语音交互和任务执行开始合并。模型需要听懂用户、理解实时画面、调用外部工具,同时继续维持自然交流,这也是 Google将其定位为生产级语音智能体基础模型的原因。

开发者、企业和普通用户如何使用

两款模型已经开始通过 Gemini API和 Google AI Studio向开发者推出。Gemini 3.8 Live同时进入 Gemini Enterprise私有预览,并在 Search Live中面向普通用户开放;Extended Thinking也进入 Gemini Enterprise私有预览,并计划扩展到面向客户体验的企业产品和 Google Workspace商业用户。

普通用户方面,Gemini 3.8 Live Extended Thinking正在 Gemini Live中上线。Google AI Pro和 Ultra用户可在 Workspace的 Docs中使用相关能力,Gmail和 Keep则面向 Google AI订阅用户提供。Google还表示,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel和 Vision Agents等开发平台正在通过 Gemini Live API支持相关语音应用开发。

实时语音模型正在从聊天走向执行

这次更新最明显的变化,是实时模型开始同时承担对话、推理和执行三种角色。过去语音助手往往需要在用户说完后完成识别、推理、调用工具,再返回结果;Gemini 3.8 Live系列尝试把这些过程并行化,让模型在后台执行任务时仍保持交流,并在复杂任务中持续解释进展。

Google同时表示,其 AI产品生成的音频都会加入 SynthID水印,用于帮助识别 AI生成内容。随着实时语音模型逐渐进入搜索、办公软件和企业工作流,语音交互的竞争重点也正在从“回答得快不快”转向“能否在不中断对话的情况下可靠完成任务”。

© 2026 DGNEWLIVE 保留所有权利.