Google ha implementado un nuevo análisis de video basado en agentes en sus modelos Gemini, lo que permite una reducción en el uso de tokens de hasta 88 por ciento. Esta innovación se traduce en una disminución de costos de 66 por ciento y una mejora en la precisión del análisis. La función está disponible a través de la API de Gemini, facilitando la identificación de escenas específicas en videos largos, con planes de integración en la aplicación Gemini y YouTube en el futuro.
Los modelos más recientes, como Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, tienen la capacidad de detectar momentos de menos de un segundo, incluyendo cambios de estado y cortes que podrían pasar desapercibidos con un escaneo convencional. Este sistema innovador permite una edición de video automatizada más precisa, al poder rastrear escenas individuales en horas de grabación sin un consumo excesivo de tokens.
La nueva variante de análisis de video se aleja del procesamiento estático, que anteriormente operaba a un ritmo fijo de un cuadro por segundo. La tecnología ahora permite que el modelo decida de manera autónoma qué segmentos analizar y a qué velocidad, optimizando así el proceso de edición y análisis de contenido audiovisual.