Gemini introduce una nuova modalità di analisi dei video basata sull’intelligenza artificiale agentica. La funzione consente di esaminare contenuti lunghi con maggiore efficienza, individuando cambiamenti di pochi istanti, seguendo movimenti e contando oggetti distinti all’interno delle registrazioni.
gemini migliora la comprensione dei video
Google ha esteso la funzione agentic video understanding ai modelli Gemini 3.7 Flash, Gemini 3.6 Flash e Gemini 3.5 Flash-Lite. Il sistema permette di caricare un video e sottoporlo all’analisi dell’intelligenza artificiale, con una riduzione dell’utilizzo dei token fino all’88% e un miglioramento dell’accuratezza che può arrivare al 7%.
un’analisi più efficiente dei contenuti
In precedenza, Gemini elaborava i video attraverso un metodo definito “statico”. La registrazione veniva suddivisa in singoli fotogrammi, con conseguenze su velocità di elaborazione e costi. Il nuovo approccio consente invece al modello di stabilire autonomamente quali parti osservare e con quale ritmo analizzarle.
Durante l’elaborazione, Gemini può scegliere se utilizzare i fotogrammi, l’audio oppure la trascrizione. Questa selezione permette di concentrare le risorse sugli elementi più rilevanti del contenuto, rendendo l’analisi più rapida e precisa anche nel caso di video particolarmente lunghi.
cosa può riconoscere gemini nei video
La nuova capacità amplia le possibilità di interpretazione delle registrazioni. Gemini è in grado di rilevare variazioni che durano meno di un secondo e di rispondere a domande complesse riferite a video della durata di diverse ore.
movimenti, oggetti e dettagli visivi
Il sistema può inoltre esaminare i video alla ricerca di imperfezioni visive, seguire i movimenti fisici e contare oggetti distinti. L’analisi non si limita quindi alla descrizione generale delle immagini, ma può concentrarsi su eventi specifici e su elementi che cambiano nel corso della registrazione.
- Individuazione di cambiamenti estremamente rapidi.
- Analisi di video della durata di più ore.
- Controllo di artefatti visivi.
- Monitoraggio dei movimenti fisici.
- Conteggio di oggetti distinti.
disponibilità dell’analisi video agentica
Al momento, l’agentic video understanding è accessibile attraverso la Gemini API in Google AI Studio e sulla Gemini Enterprise Agent Platform. La disponibilità all’interno dell’app Gemini è prevista prossimamente, ampliando l’accesso alla funzione anche al di fuori degli strumenti destinati agli sviluppatori e alle aziende.
integrazione con ask youtube
Google prevede inoltre di utilizzare questa tecnologia per alimentare la funzione Ask YouTube. L’integrazione potrebbe semplificare l’analisi dei video pubblicati sulla piattaforma, offrendo ai creator nuovi strumenti basati sulle capacità di comprensione dei contenuti di Gemini.







Lascia un commento