谷歌推出Gemini 3.5 Transcribe语音转文字模型
2026年8月26日,谷歌DeepMind推出了Gemini 3.5 Transcribe,这是其最新的语音转文字模型,专为精确、智能的实时转录而设计。该模型将原始音频转换为准确、精炼、格式化的文本,能够处理背景噪音、复杂术语和言语不流畅的清理。它支持多说话人识别和词级时间戳,并支持实时语言切换。与前代Chirp 3相比,最终转录时间缩短了70%,在FLEURS基准上,流式模式的词错误率(WER)为5.50%,非流式模式为5.04%。该模型可通过Google AI Studio和Gemini Enterprise Agent Platform中的Gemini API获得,并已集成到Gboard、Antigravity、Gemini应用和Chrome等谷歌产品中。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel和Vision Agents等开发者平台支持使用该模型构建语音驱动界面。vivo、Intellitek Health和Lingopal等公司提供了积极反馈。
已知信息
该模型可通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform中使用。
▤ 1 来源›
在FLEURS上,其流式模式的词错误率(WER)为5.50%,非流式模式为5.04%。
▤ 1 来源›
该模型是一款语音转文本模型,与Chirp 3相比,在准确性和延迟方面有所改进。
▤ 1 来源›
它已集成到Google产品中,如Gboard、Antigravity、Gemini应用和Chrome。
▤ 1 来源›
Google DeepMind 于2026年8月26日发布了Gemini 3.5 Transcribe。
▤ 1 来源›
它支持多说话人归属和词级时间戳。
▤ 1 来源›
最终转录时间缩短了70%。
▤ 1 来源›
谷歌DeepMind宣布推出Gemini 3.5 Transcribe,这是一款新的语音转文字模型,具有更高的准确性、更低的延迟和更强的多语言支持,现通过Gemini API向开发者提供。
已核实 · 1 来源实时报道
查看全部评论 0
在长期保留的讨论串中讨论此事件;实时聊天保持独立。
暂无评论,来发起讨论吧。