DoseFix 直播
0票数
人工智能·美国·已确认

谷歌推出Gemini 3.5 Transcribe语音转文字模型

美国·
DoseFix Editorial多来源综合报道

2026年8月26日,谷歌DeepMind推出了Gemini 3.5 Transcribe,这是其最新的语音转文字模型,专为精确、智能的实时转录而设计。该模型将原始音频转换为准确、精炼、格式化的文本,能够处理背景噪音、复杂术语和言语不流畅的清理。它支持多说话人识别和词级时间戳,并支持实时语言切换。与前代Chirp 3相比,最终转录时间缩短了70%,在FLEURS基准上,流式模式的词错误率(WER)为5.50%,非流式模式为5.04%。该模型可通过Google AI Studio和Gemini Enterprise Agent Platform中的Gemini API获得,并已集成到Gboard、Antigravity、Gemini应用和Chrome等谷歌产品中。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel和Vision Agents等开发者平台支持使用该模型构建语音驱动界面。vivo、Intellitek Health和Lingopal等公司提供了积极反馈。

自动翻译 · EN
1 来源
美国

已知信息

该模型可通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform中使用。

1 来源

在FLEURS上,其流式模式的词错误率(WER)为5.50%,非流式模式为5.04%。

1 来源

该模型是一款语音转文本模型,与Chirp 3相比,在准确性和延迟方面有所改进。

1 来源

它已集成到Google产品中,如Gboard、Antigravity、Gemini应用和Chrome。

1 来源

Google DeepMind 于2026年8月26日发布了Gemini 3.5 Transcribe。

1 来源

它支持多说话人归属和词级时间戳。

1 来源

最终转录时间缩短了70%。

1 来源
Gemini 3.5 Transcribe发布

谷歌DeepMind宣布推出Gemini 3.5 Transcribe,这是一款新的语音转文字模型,具有更高的准确性、更低的延迟和更强的多语言支持,现通过Gemini API向开发者提供。

已核实 · 1 来源

实时报道

查看全部
Gemini 3.5 Transcribe发布本地声音 · 美国
已核实

评论 0

在长期保留的讨论串中讨论此事件;实时聊天保持独立。

请保持文明,并区分观点与已核实信息。

暂无评论,来发起讨论吧。

谷歌推出Gemini 3.5 Transcribe语音转文字模型 | DoseFix