Google 发布 Gemini 3.5 Transcribe:新一代语音转文字模型支持实时转写与智能整理

行业动态

Google 发布 Gemini 3.5 Transcribe:新一代语音转文字模型支持实时转写与智能整理

栏目:行业动态

摘要

Google 发布 Gemini 3.5 Transcribe,新模型面向实时与录音语音转文字,支持 85+ 语言、说话人分离、词级时间戳、自定义词汇与智能整理,并通过 Gemini API 向开发者开放。

本文目录

Google发布 Gemini 3.5 Transcribe:新一代语音转文字模型支持实时转写与智能整理

Google于2026年8月26日发布 Gemini 3.5 Transcribe,这是一款专门面向语音转文字任务的新模型。它建立在 Gemini的音频理解能力之上,重点解决传统语音识别在背景噪声、专业术语、多语言切换和口语停顿等场景中的准确率与可读性问题,并开始通过 Gemini API、Google AI Studio和 Gemini Enterprise Agent Platform向开发者提供。

Gemini 3.5 Transcribe 官方发布配图

图片来源:Google

两种模型形态,分别覆盖实时与录音场景

Gemini 3.5 Transcribe提供实时流式和预录音频两种使用方式。实时场景使用 `gemini-3.5-transcribe-live`,通过 Live API提供双向连续流式转写,Google将其定位于语音助手、实时字幕和其他交互式语音应用;录音文件则使用 `gemini-3.5-transcribe`,通过 Interactions API处理会议录音、电话记录和其他已有音频。

Google表示,实时版本的目标是实现亚秒级延迟。对于预录音频,模型可以直接输出说话人归属和词级时间戳,减少后续再做说话人分离、时间对齐的处理成本。

支持85+ 语言,并能处理语言切换

根据 Google的开发者文档,Gemini 3.5 Transcribe可以自动识别85个以上语言和地区变体,不需要开发者预先指定单一语言。模型也支持一句话内部或不同句子之间的语言切换,这对于跨语言会议、客服录音和包含大量英文术语的中文语音更实用。

它还支持自定义词汇提示。开发者最多可以提供1,000个短语,让模型在识别专业术语、缩写、产品名和人名时提高命中率。对于医疗、金融、技术支持或企业内部知识场景,这类能力往往比单纯提升平均识别率更有实际价值。

不只做逐字稿,还提供 Smart transcription

Gemini 3.5 Transcribe提供 `verbatim` 和 `smart` 两种转写模式。默认的 `verbatim` 会尽量保留原始口语,包括“嗯”“呃”等填充词、重复、停顿和说到一半重新开始的内容,适合需要忠实记录原话的场景。

`smart` 模式则更强调可读性。它会自动清理口语中的填充词和重复表达,处理说话者在句中进行的自我纠正,同时完成标点、大小写、日期、金额和数字格式化。对于采访整理、会议纪要、客服质检和内容生产,这意味着模型输出可以更接近直接可用的文本,而不是一份仍需大量人工清洗的原始逐字稿。

说话人分离和词级时间戳成为内置能力

Gemini 3.5 Transcribe可以识别多个说话人并为语音片段分配不同标签,同时输出每个单词的起止时间。Google DeepMind的产品页面显示,预录音频转写目前支持最多三位说话人的时间戳和归属信息。

这类能力过去通常需要组合多个 ASR、说话人分离和时间对齐组件。现在它被整合到同一个模型接口里,对需要生成字幕、会议记录、播客转录和通话分析的开发者来说,整体流程会更简单。

Google公布的基准结果优于 Chirp 3

Google将 Gemini 3.5 Transcribe与上一代语音转写模型 Chirp 3进行了对比。官方公布的 FLEURS多语言基准结果显示,流式模式的词错误率(WER)为5.50%,非流式模式为5.04%。Google还引用 Artificial Analysis的测量结果称,相比 Chirp 3,最终转写结果的生成时间提升约70%。

这些数字反映的是特定测试集和测试条件下的结果,真实业务中的准确率仍会受到录音质量、说话人重叠、专业词汇和环境噪声影响。Google目前将3.5 Transcribe标记为 Preview,生产环境采用时仍需要针对自己的音频数据做验证。

从“听写工具”走向语音交互基础设施

Gemini 3.5 Transcribe的变化不只是把语音识别做得更准,而是把语言检测、说话人分离、时间戳、专业词汇偏置和文本整理放进同一套接口中。Google也已经把这类能力扩展到 Gboard、Gemini应用、Chrome等产品,并通过 Live API面向实时语音应用开放。

对于开发者来说,它更像是一层可以直接接入语音 Agent、实时字幕、会议处理和通话分析系统的基础能力。尤其是在需要多语言、低延迟和结构化输出的场景里,Gemini 3.5 Transcribe与传统只返回原始文本的语音识别服务已经有了明显区别。

© 2026 DGNEWLIVE 保留所有权利.