DoseFix EN DIRECT
0votes
IA·États-Unis·CONFIRMÉ

Google présente Gemini 3.5 Transcribe, son modèle de reconnaissance vocale

États-Unis·
DoseFix EditorialSynthèse multisource

Le 26 août 2026, Google DeepMind a présenté Gemini 3.5 Transcribe, son dernier modèle de reconnaissance vocale conçu pour une transcription en temps réel précise et intelligente. Le modèle convertit l'audio brut en texte précis, soigné et formaté, en gérant le bruit de fond, le jargon complexe et le nettoyage des disfluences. Il offre l'attribution à plusieurs locuteurs et des horodatages au niveau du mot, et prend en charge les changements de langue en direct. Par rapport à son prédécesseur Chirp 3, il améliore le temps de transcription finale de 70 % et atteint un taux d'erreur de mots (WER) de 5,50 % en mode streaming et de 5,04 % en mode non-streaming sur le benchmark FLEURS. Le modèle est disponible via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent, et est intégré dans les surfaces Google telles que Gboard, Antigravity, l'application Gemini et Chrome. Les plateformes de développement telles que Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents prennent en charge la création d'interfaces vocales avec ce modèle. Des entreprises comme vivo, Intellitek Health et Lingopal ont fourni des retours positifs.

Traduit automatiquement · EN
1 sources
États-Unis

Ce que nous savons

Il est disponible via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent.

1 sources

Il atteint un WER de 5,50 % en mode streaming et de 5,04 % en mode non-streaming sur FLEURS.

1 sources

Le modèle est un modèle de reconnaissance vocale avec une précision et une latence améliorées par rapport à Chirp 3.

1 sources

Il est intégré dans les produits Google comme Gboard, Antigravity, l'application Gemini et Chrome.

1 sources

Google DeepMind a annoncé Gemini 3.5 Transcribe le 26 août 2026.

1 sources

Il prend en charge l'attribution multi-locuteurs et les horodatages au niveau du mot.

1 sources

Le temps jusqu'à la transcription finale s'améliore de 70 %.

1 sources
Transparence des sources

Ouvrez une source pour vérifier sa langue, quand DoseFix l’a reçue et les affirmations soutenues.

Google DeepMind Blog

Intelligent transcription with Gemini 3.5 Transcribe

deepmind.google · EN · Publié · Reçu
Indépendante

Rapports en direct

Tout voir
Sortie de Gemini 3.5 TranscribeVoix locale · États-Unis
Vérifié

Commentaires 0

Discutez de cet événement dans des fils persistants. Le direct reste séparé.

Restez courtois et distinguez les opinions des informations vérifiées.

Aucun commentaire. Lancez la discussion.