DoseFix EN VIVO
0votos
IA·Estados Unidos·CONFIRMADO

Google presenta Gemini 3.5 Transcribe, modelo de voz a texto

Estados Unidos·
DoseFix EditorialSíntesis de múltiples fuentes

El 26 de agosto de 2026, Google DeepMind presentó Gemini 3.5 Transcribe, su último modelo de voz a texto diseñado para la transcripción en tiempo real precisa e inteligente. El modelo convierte audio sin procesar en texto preciso, pulido y formateado, manejando ruido de fondo, jerga compleja y limpieza de disfluencias. Ofrece atribución de múltiples hablantes y marcas de tiempo a nivel de palabra, y admite cambios de idioma en vivo. En comparación con su predecesor Chirp 3, mejora el tiempo hasta la transcripción final en un 70% y logra una tasa de error de palabra (WER) del 5,50% en modo streaming y del 5,04% en modo no streaming en el punto de referencia FLEURS. El modelo está disponible a través de la API de Gemini en Google AI Studio y la Plataforma Gemini Enterprise Agent, y está integrado en superficies de Google como Gboard, Antigravity, la aplicación Gemini y Chrome. Plataformas de desarrolladores como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents admiten la creación de interfaces controladas por voz con él. Empresas como vivo, Intellitek Health y Lingopal han proporcionado comentarios positivos.

Traducción automática · EN
1 fuentes
Estados Unidos

Lo que sabemos

Está disponible a través de la API de Gemini en Google AI Studio y en la Plataforma Gemini Enterprise Agent.

1 fuentes

Logra un WER del 5.50% en modo streaming y del 5.04% en modo no streaming en FLEURS.

1 fuentes

El modelo es un modelo de voz a texto con precisión y latencia mejoradas en comparación con Chirp 3.

1 fuentes

Está integrado en productos de Google como Gboard, Antigravity, la aplicación Gemini y Chrome.

1 fuentes

Google DeepMind anunció Gemini 3.5 Transcribe el 26 de agosto de 2026.

1 fuentes

Admite atribución de múltiples hablantes y marcas de tiempo a nivel de palabra.

1 fuentes

El tiempo hasta la transcripción final mejora en un 70%.

1 fuentes
Lanzamiento de Gemini 3.5 Transcribe

Google DeepMind anunció Gemini 3.5 Transcribe, un nuevo modelo de voz a texto con mayor precisión, menor latencia y mejor soporte multilingüe, ya disponible para desarrolladores a través de la API de Gemini.

Verificado · 1 fuentes

Reportes en vivo

Ver todo
Lanzamiento de Gemini 3.5 TranscribeVoz local · Estados Unidos
Verificado

Comentarios 0

Debate este evento en hilos permanentes. El chat en vivo es independiente.

Mantén un diálogo respetuoso y distingue opinión de información verificada.

Aún no hay comentarios. Inicia la conversación.

Google presenta Gemini 3.5 Transcribe, modelo de voz a texto | DoseFix