DoseFix LIVE
0Stimmen
KI·Vereinigte Staaten·BESTÄTIGT

Google stellt Sprach-zu-Text-Modell Gemini 3.5 Transcribe vor

Vereinigte Staaten·
DoseFix EditorialSynthese aus mehreren Quellen

Am 26. August 2026 stellte Google DeepMind Gemini 3.5 Transcribe vor, sein neuestes Sprach-zu-Text-Modell für präzise und intelligente Echtzeit-Transkription. Das Modell wandelt rohes Audio in genauen, formatierten Text um und bewältigt Hintergrundgeräusche, komplexen Fachjargon und die Bereinigung von Sprachfehlern. Es bietet Sprecherzuordnung bei mehreren Sprechern und Wort-Zeitstempel und unterstützt Live-Sprachwechsel. Im Vergleich zu seinem Vorgänger Chirp 3 verbessert es die Zeit bis zur endgültigen Transkription um 70% und erreicht eine Wortfehlerrate (WER) von 5,50% im Streaming-Modus und 5,04% im Nicht-Streaming-Modus beim FLEURS-Benchmark. Das Modell ist über die Gemini-API in Google AI Studio und der Gemini Enterprise Agent Platform verfügbar und in Google-Oberflächen wie Gboard, Antigravity, der Gemini-App und Chrome integriert. Entwicklerplattformen wie Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents unterstützen die Erstellung sprachgesteuerter Schnittstellen damit. Unternehmen wie vivo, Intellitek Health und Lingopal haben positives Feedback gegeben.

Automatisch übersetzt · EN
1 Quellen
Vereinigte Staaten

Was wir wissen

Es ist über die Gemini-API in Google AI Studio und der Gemini Enterprise Agent Platform verfügbar.

1 Quellen

Es erreicht eine WER von 5,50 % im Streaming-Modus und 5,04 % im Nicht-Streaming-Modus auf FLEURS.

1 Quellen

Das Modell ist ein Sprach-zu-Text-Modell mit verbesserter Genauigkeit und Latenz im Vergleich zu Chirp 3.

1 Quellen

Es ist in Google-Produkte wie Gboard, Antigravity, die Gemini-App und Chrome integriert.

1 Quellen

Google DeepMind kündigte Gemini 3.5 Transcribe am 26. August 2026 an.

1 Quellen

Es unterstützt die Zuordnung mehrerer Sprecher und Wort-Zeitstempel.

1 Quellen

Die Zeit bis zur endgültigen Transkription verbessert sich um 70 %.

1 Quellen
Quellentransparenz

Öffne jede Quelle, um Sprache, den Empfangszeitpunkt bei DoseFix und gestützte Aussagen zu prüfen.

Google DeepMind Blog

Intelligent transcription with Gemini 3.5 Transcribe

deepmind.google · EN · Veröffentlicht · Empfangen
Unabhängig

Live-Berichte

Alle ansehen
Veröffentlichung von Gemini 3.5 TranscribeLokale Stimme · Vereinigte Staaten
Verifiziert

Kommentare 0

Diskutiere dieses Ereignis in dauerhaften Threads. Der Live-Chat bleibt getrennt.

Bleib respektvoll und trenne Meinungen von verifizierten Informationen.

Noch keine Kommentare. Starte die Diskussion.

Google stellt Sprach-zu-Text-Modell Gemini 3.5 Transcribe vor | DoseFix