DoseFix ライブ
0
AI·アメリカ合衆国·確認済み

Google、音声認識モデル「Gemini 3.5 Transcribe」を発表

アメリカ合衆国·
DoseFix Editorial複数情報源の統合記事

2026年8月26日、Google DeepMindは、正確でインテリジェントなリアルタイム文字起こしのために設計された最新の音声認識モデル「Gemini 3.5 Transcribe」を発表しました。このモデルは、生の音声を正確で洗練された整形済みテキストに変換し、背景ノイズ、複雑な専門用語、言い淀みの除去を処理します。複数話者の識別と単語レベルのタイムスタンプをサポートし、ライブでの言語切り替えにも対応しています。前モデルのChirp 3と比較して、最終文字起こしまでの時間が70%短縮され、FLEURSベンチマークでストリーミングモードでは5.50%、非ストリーミングモードでは5.04%の単語誤り率(WER)を達成しています。このモデルは、Google AI StudioとGemini Enterprise Agent PlatformのGemini APIを通じて利用可能で、Gboard、Antigravity、Geminiアプリ、ChromeなどのGoogle製品に統合されています。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsなどの開発者プラットフォームは、このモデルを使用した音声駆動型インターフェースの構築をサポートしています。vivo、Intellitek Health、Lingopalなどの企業からも肯定的なフィードバックが寄せられています。

自動翻訳 · EN
1 ソース
アメリカ合衆国

判明していること

Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformで利用可能である。

1 ソース

FLEURSにおいて、ストリーミングモードで5.50%、非ストリーミングモードで5.04%のWERを達成している。

1 ソース

このモデルは音声認識モデルであり、Chirp 3と比較して精度とレイテンシが改善されている。

1 ソース

Gboard、Antigravity、Geminiアプリ、ChromeなどのGoogle製品に統合されている。

1 ソース

Google DeepMindは、2026年8月26日にGemini 3.5 Transcribeを発表した。

1 ソース

複数話者の属性識別と単語レベルのタイムスタンプをサポートしている。

1 ソース

最終文字起こしまでの時間が70%改善される。

1 ソース
ソースの透明性

任意のソースを開いて、原文言語、DoseFixが受信した日時、裏付けとなる主張を確認できます。

Google DeepMind Blog

Intelligent transcription with Gemini 3.5 Transcribe

deepmind.google · EN · 公開 · 受信日時
独立

ライブレポート

すべて見る
Gemini 3.5 Transcribe リリースローカルボイス · アメリカ合衆国
検証済み

コメント 0

この出来事を保存されるスレッドで議論できます。ライブチャットとは別です。

礼節を保ち、意見と確認済み情報を区別してください。

まだコメントはありません。会話を始めましょう。