Google stellt Sprach-zu-Text-Modell Gemini 3.5 Transcribe vor
Am 26. August 2026 stellte Google DeepMind Gemini 3.5 Transcribe vor, sein neuestes Sprach-zu-Text-Modell für präzise und intelligente Echtzeit-Transkription. Das Modell wandelt rohes Audio in genauen, formatierten Text um und bewältigt Hintergrundgeräusche, komplexen Fachjargon und die Bereinigung von Sprachfehlern. Es bietet Sprecherzuordnung bei mehreren Sprechern und Wort-Zeitstempel und unterstützt Live-Sprachwechsel. Im Vergleich zu seinem Vorgänger Chirp 3 verbessert es die Zeit bis zur endgültigen Transkription um 70% und erreicht eine Wortfehlerrate (WER) von 5,50% im Streaming-Modus und 5,04% im Nicht-Streaming-Modus beim FLEURS-Benchmark. Das Modell ist über die Gemini-API in Google AI Studio und der Gemini Enterprise Agent Platform verfügbar und in Google-Oberflächen wie Gboard, Antigravity, der Gemini-App und Chrome integriert. Entwicklerplattformen wie Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents unterstützen die Erstellung sprachgesteuerter Schnittstellen damit. Unternehmen wie vivo, Intellitek Health und Lingopal haben positives Feedback gegeben.
Was wir wissen
Es ist über die Gemini-API in Google AI Studio und der Gemini Enterprise Agent Platform verfügbar.
▤ 1 Quellen›
Es erreicht eine WER von 5,50 % im Streaming-Modus und 5,04 % im Nicht-Streaming-Modus auf FLEURS.
▤ 1 Quellen›
Das Modell ist ein Sprach-zu-Text-Modell mit verbesserter Genauigkeit und Latenz im Vergleich zu Chirp 3.
▤ 1 Quellen›
Es ist in Google-Produkte wie Gboard, Antigravity, die Gemini-App und Chrome integriert.
▤ 1 Quellen›
Google DeepMind kündigte Gemini 3.5 Transcribe am 26. August 2026 an.
▤ 1 Quellen›
Es unterstützt die Zuordnung mehrerer Sprecher und Wort-Zeitstempel.
▤ 1 Quellen›
Die Zeit bis zur endgültigen Transkription verbessert sich um 70 %.
▤ 1 Quellen›
Google DeepMind hat Gemini 3.5 Transcribe angekündigt, ein neues Sprach-zu-Text-Modell mit verbesserter Genauigkeit, geringerer Latenz und besserer Mehrsprachigkeit, das Entwicklern jetzt über die Gemini-API zur Verfügung steht.
Verifiziert · 1 QuellenLive-Berichte
Alle ansehenKommentare 0
Diskutiere dieses Ereignis in dauerhaften Threads. Der Live-Chat bleibt getrennt.
Noch keine Kommentare. Starte die Diskussion.