Google DeepMind lancia la comprensione video agentica per i modelli Gemini
Google DeepMind ha annunciato il lancio della comprensione video agentica per i suoi modelli Gemini, inclusi Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. La funzionalità è disponibile tramite l'API Gemini in Google AI Studio e nella piattaforma Gemini Enterprise Agent. Utilizza strumenti video nativi per cercare, scansionare e ispezionare dinamicamente segmenti video, riducendo il consumo di token fino all'88%, i costi fino al 66% e migliorando l'accuratezza fino al 7% sui benchmark standard. La funzionalità è particolarmente utile per l'analisi di video di lunga durata. Verrà inoltre implementata nell'app Gemini e alimenterà la funzionalità 'Chiedi a YouTube' nei prossimi mesi.
Commenti 0
Discuti l’evento in thread permanenti. La chat dal vivo resta separata.
Cosa sappiamo
La funzionalità è disponibile tramite l'API Gemini in Google AI Studio e sulla Gemini Enterprise Agent Platform.
▤ 1 fonti›
La comprensione video agentica riduce il consumo di token fino all'88% e i costi fino al 66%.
▤ 1 fonti›
La funzionalità sarà distribuita nell'app Gemini e alimenterà la funzione 'Ask YouTube' di YouTube.
▤ 1 fonti›
Google DeepMind ha lanciato la comprensione video agentica per Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite.
▤ 1 fonti›
La precisione migliora fino al 7% sui benchmark standard di analisi video.
▤ 1 fonti›
Nessun costo aggiuntivo per la funzionalità; utilizza i prezzi standard dei token dell'API Gemini.
▤ 1 fonti›
Google DeepMind ha annunciato il lancio della comprensione video agentica per Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite, affermando una riduzione dei token fino all'88%, una riduzione dei costi del 66% e un miglioramento dell'accuratezza del 7%.
Verificato · 1 fonti
Nessun commento. Inizia la conversazione.