Google、音声認識モデル「Gemini 3.5 Transcribe」を発表
2026年8月26日、Google DeepMindは、正確でインテリジェントなリアルタイム文字起こしのために設計された最新の音声認識モデル「Gemini 3.5 Transcribe」を発表しました。このモデルは、生の音声を正確で洗練された整形済みテキストに変換し、背景ノイズ、複雑な専門用語、言い淀みの除去を処理します。複数話者の識別と単語レベルのタイムスタンプをサポートし、ライブでの言語切り替えにも対応しています。前モデルのChirp 3と比較して、最終文字起こしまでの時間が70%短縮され、FLEURSベンチマークでストリーミングモードでは5.50%、非ストリーミングモードでは5.04%の単語誤り率(WER)を達成しています。このモデルは、Google AI StudioとGemini Enterprise Agent PlatformのGemini APIを通じて利用可能で、Gboard、Antigravity、Geminiアプリ、ChromeなどのGoogle製品に統合されています。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsなどの開発者プラットフォームは、このモデルを使用した音声駆動型インターフェースの構築をサポートしています。vivo、Intellitek Health、Lingopalなどの企業からも肯定的なフィードバックが寄せられています。
判明していること
Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformで利用可能である。
▤ 1 ソース›
FLEURSにおいて、ストリーミングモードで5.50%、非ストリーミングモードで5.04%のWERを達成している。
▤ 1 ソース›
このモデルは音声認識モデルであり、Chirp 3と比較して精度とレイテンシが改善されている。
▤ 1 ソース›
Gboard、Antigravity、Geminiアプリ、ChromeなどのGoogle製品に統合されている。
▤ 1 ソース›
Google DeepMindは、2026年8月26日にGemini 3.5 Transcribeを発表した。
▤ 1 ソース›
複数話者の属性識別と単語レベルのタイムスタンプをサポートしている。
▤ 1 ソース›
最終文字起こしまでの時間が70%改善される。
▤ 1 ソース›
Google DeepMindは、精度、遅延、多言語対応が改善された新しい音声認識モデル「Gemini 3.5 Transcribe」を発表しました。このモデルは、Gemini APIを通じて開発者に提供されます。
検証済み · 1 ソースライブレポート
すべて見るコメント 0
この出来事を保存されるスレッドで議論できます。ライブチャットとは別です。
まだコメントはありません。会話を始めましょう。