Google présente Gemini 3.5 Transcribe, son modèle de reconnaissance vocale
Le 26 août 2026, Google DeepMind a présenté Gemini 3.5 Transcribe, son dernier modèle de reconnaissance vocale conçu pour une transcription en temps réel précise et intelligente. Le modèle convertit l'audio brut en texte précis, soigné et formaté, en gérant le bruit de fond, le jargon complexe et le nettoyage des disfluences. Il offre l'attribution à plusieurs locuteurs et des horodatages au niveau du mot, et prend en charge les changements de langue en direct. Par rapport à son prédécesseur Chirp 3, il améliore le temps de transcription finale de 70 % et atteint un taux d'erreur de mots (WER) de 5,50 % en mode streaming et de 5,04 % en mode non-streaming sur le benchmark FLEURS. Le modèle est disponible via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent, et est intégré dans les surfaces Google telles que Gboard, Antigravity, l'application Gemini et Chrome. Les plateformes de développement telles que Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents prennent en charge la création d'interfaces vocales avec ce modèle. Des entreprises comme vivo, Intellitek Health et Lingopal ont fourni des retours positifs.
Ce que nous savons
Il est disponible via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent.
▤ 1 sources›
Il atteint un WER de 5,50 % en mode streaming et de 5,04 % en mode non-streaming sur FLEURS.
▤ 1 sources›
Le modèle est un modèle de reconnaissance vocale avec une précision et une latence améliorées par rapport à Chirp 3.
▤ 1 sources›
Il est intégré dans les produits Google comme Gboard, Antigravity, l'application Gemini et Chrome.
▤ 1 sources›
Google DeepMind a annoncé Gemini 3.5 Transcribe le 26 août 2026.
▤ 1 sources›
Il prend en charge l'attribution multi-locuteurs et les horodatages au niveau du mot.
▤ 1 sources›
Le temps jusqu'à la transcription finale s'améliore de 70 %.
▤ 1 sources›
Google DeepMind a annoncé Gemini 3.5 Transcribe, un nouveau modèle de reconnaissance vocale offrant une meilleure précision, une latence réduite et une prise en charge multilingue améliorée, désormais disponible pour les développeurs via l'API Gemini.
Vérifié · 1 sourcesRapports en direct
Tout voirCommentaires 0
Discutez de cet événement dans des fils persistants. Le direct reste séparé.
Aucun commentaire. Lancez la discussion.