גוגל מציגה את מודל התמלול Gemini 3.5 Transcribe
ב-26 באוגוסט 2026, Google DeepMind הציגה את Gemini 3.5 Transcribe, מודל התמלול העדכני ביותר שלה, שנועד לתמלול מדויק וחכם בזמן אמת. המודל ממיר אודיו גולמי לטקסט מדויק, מעוצב ומסודר, תוך טיפול ברעשי רקע, ז'רגון מורכב וניקוי שיבושי דיבור. הוא תומך בייחוס דוברים מרובים ובחותמות זמן ברמת מילה, ומאפשר מעבר שפה חי. בהשוואה לקודמו Chirp 3, הוא משפר את זמן התמלול הסופי ב-70% ומשיג שיעור שגיאות מילים (WER) של 5.50% במצב סטרימינג ו-5.04% במצב לא-סטרימינג במדד FLEURS. המודל זמין דרך Gemini API ב-Google AI Studio וב-Gemini Enterprise Agent Platform, ומשולב במוצרי גוגל כמו Gboard, Antigravity, אפליקציית Gemini ו-Chrome. פלטפורמות פיתוח כמו Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel ו-Vision Agents תומכות בבניית ממשקים מבוססי קול באמצעותו. חברות כמו vivo, Intellitek Health ו-Lingopal סיפקו משוב חיובי.
מה ידוע
הוא זמין דרך Gemini API ב-Google AI Studio וב-Gemini Enterprise Agent Platform.
▤ 1 מקורות›
הוא משיג 5.50% WER במצב סטרימינג ו-5.04% במצב לא-סטרימינג על FLEURS.
▤ 1 מקורות›
המודל הוא מודל דיבור לטקסט עם דיוק משופר וזמן השהיה נמוך יותר בהשוואה ל-Chirp 3.
▤ 1 מקורות›
הוא משולב במוצרי גוגל כמו Gboard, Antigravity, אפליקציית Gemini ו-Chrome.
▤ 1 מקורות›
גוגל דיפマイ�ד הכריזה על Gemini 3.5 Transcribe ב-26 באוגוסט 2026.
▤ 1 מקורות›
הוא תומך בייחוס דוברים מרובים ובחותמות זמן ברמת מילה.
▤ 1 מקורות›
הזמן עד לתמלול הסופי משתפר ב-70%.
▤ 1 מקורות›
Google DeepMind הכריזה על Gemini 3.5 Transcribe, מודל חדש לתמלול דיבור לטקסט עם דיוק משופר, זמן השהיה נמוך יותר ותמיכה רב-לשונית רחבה, הזמין כעת למפתחים דרך Gemini API.
מאומת · 1 מקורותדיווחים חיים
הצג הכולתגובות 0
דונו באירוע בשרשורים קבועים. הצ׳אט החי נשאר נפרד.
עדיין אין תגובות. התחילו את השיחה.