DoseFix 라이브
0
AI·미국·확인됨

Google, 음성-텍스트 변환 모델 Gemini 3.5 Transcribe 공개

미국·
DoseFix Editorial다중 출처 종합

2026년 8월 26일, Google DeepMind는 최신 음성-텍스트 변환 모델인 Gemini 3.5 Transcribe를 발표했습니다. 이 모델은 정확하고 지능적인 실시간 전사를 위해 설계되었으며, 원시 오디오를 정확하고 세련된 형식의 텍스트로 변환하고, 배경 소음, 복잡한 전문 용어, 비유창성 정리를 처리합니다. 또한 다중 화자 식별 및 단어 수준 타임스탬프를 지원하며, 실시간 언어 전환을 지원합니다. 이전 모델인 Chirp 3와 비교하여 최종 전사 시간이 70% 개선되었으며, FLEURS 벤치마크에서 스트리밍 모드에서 5.50%, 비스트리밍 모드에서 5.04%의 단어 오류율(WER)을 달성했습니다. 이 모델은 Google AI Studio 및 Gemini Enterprise Agent Platform의 Gemini API를 통해 제공되며, Gboard, Antigravity, Gemini 앱, Chrome과 같은 Google 제품에 통합되었습니다. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents와 같은 개발자 플랫폼은 이를 사용하여 음성 기반 인터페이스를 구축할 수 있습니다. vivo, Intellitek Health, Lingopal과 같은 기업들은 긍정적인 피드백을 제공했습니다.

자동 번역 · EN
1 소스
미국

알려진 사실

Google AI Studio 및 Gemini Enterprise Agent Platform의 Gemini API를 통해 제공됩니다.

1 소스

FLEURS에서 스트리밍 모드의 WER은 5.50%, 비스트리밍 모드의 WER은 5.04%를 달성합니다.

1 소스

이 모델은 Chirp 3에 비해 정확도와 지연 시간이 개선된 음성-텍스트 변환 모델입니다.

1 소스

Gboard, Antigravity, Gemini 앱, Chrome과 같은 Google 제품에 통합됩니다.

1 소스

Google DeepMind는 2026년 8월 26일에 Gemini 3.5 Transcribe를 발표했습니다.

1 소스

다중 화자 속성 및 단어 수준 타임스탬프를 지원합니다.

1 소스

최종 전사까지의 시간이 70% 개선됩니다.

1 소스
Gemini 3.5 Transcribe 출시

Google DeepMind가 Gemini 3.5 Transcribe를 발표했습니다. 이 새로운 음성-텍스트 변환 모델은 향상된 정확도, 지연 시간, 다국어 지원을 제공하며, Gemini API를 통해 개발자에게 제공됩니다.

검증됨 · 1 소스

라이브 보도

모두 보기
Gemini 3.5 Transcribe 출시현지 목소리 · 미국
검증됨

댓글 0

지속되는 스레드에서 이 사건을 토론하세요. 실시간 채팅과는 별도입니다.

서로 존중하고 의견과 검증된 정보를 구분해 주세요.

아직 댓글이 없습니다. 대화를 시작하세요.

Google, 음성-텍스트 변환 모델 Gemini 3.5 Transcribe 공개 | DoseFix