DoseFix EN DIRECT
0votes
IA·États-Unis·CONFIRMÉ

Google présente Gemini 3.5 Transcribe, son modèle de reconnaissance vocale

États-Unis·
DoseFix EditorialSynthèse multisource

Le 26 août 2026, Google DeepMind a présenté Gemini 3.5 Transcribe, son dernier modèle de reconnaissance vocale conçu pour une transcription en temps réel précise et intelligente. Le modèle convertit l'audio brut en texte précis, soigné et formaté, en gérant le bruit de fond, le jargon complexe et le nettoyage des disfluences. Il offre l'attribution à plusieurs locuteurs et des horodatages au niveau du mot, et prend en charge les changements de langue en direct. Par rapport à son prédécesseur Chirp 3, il améliore le temps de transcription finale de 70 % et atteint un taux d'erreur de mots (WER) de 5,50 % en mode streaming et de 5,04 % en mode non-streaming sur le benchmark FLEURS. Le modèle est disponible via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent, et est intégré dans les surfaces Google telles que Gboard, Antigravity, l'application Gemini et Chrome. Les plateformes de développement telles que Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents prennent en charge la création d'interfaces vocales avec ce modèle. Des entreprises comme vivo, Intellitek Health et Lingopal ont fourni des retours positifs.

Traduit automatiquement · EN
1 sources
États-Unis

Ce que nous savons

Il est disponible via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent.

1 sources

Il atteint un WER de 5,50 % en mode streaming et de 5,04 % en mode non-streaming sur FLEURS.

1 sources

Le modèle est un modèle de reconnaissance vocale avec une précision et une latence améliorées par rapport à Chirp 3.

1 sources

Il est intégré dans les produits Google comme Gboard, Antigravity, l'application Gemini et Chrome.

1 sources

Google DeepMind a annoncé Gemini 3.5 Transcribe le 26 août 2026.

1 sources

Il prend en charge l'attribution multi-locuteurs et les horodatages au niveau du mot.

1 sources

Le temps jusqu'à la transcription finale s'améliore de 70 %.

1 sources
Sortie de Gemini 3.5 Transcribe

Google DeepMind a annoncé Gemini 3.5 Transcribe, un nouveau modèle de reconnaissance vocale offrant une meilleure précision, une latence réduite et une prise en charge multilingue améliorée, désormais disponible pour les développeurs via l'API Gemini.

Vérifié · 1 sources

Rapports en direct

Tout voir
Sortie de Gemini 3.5 TranscribeVoix locale · États-Unis
Vérifié

Commentaires 0

Discutez de cet événement dans des fils persistants. Le direct reste séparé.

Restez courtois et distinguez les opinions des informations vérifiées.

Aucun commentaire. Lancez la discussion.

Google présente Gemini 3.5 Transcribe, son modèle de reconnaissance vocale | DoseFix