Google presenta Gemini Omni 1.1 Flash: mayor control narrativo, vídeos de hasta 40 segundos y resolución 4K

Google lanza Gemini Omni 1.1 Flash, una actualización de su modelo multimodal de vídeo. La herramienta amplía la extensión de escenas hasta 40 segundos, introduce control por fotogramas clave y permite exportar secuencias en resolución 4K.

Guardar
Compartir
Imagen Ilustrativa de NexJournal.

    Google ha anunciado el lanzamiento oficial de Gemini Omni 1.1 Flash, la actualización más reciente de su arquitectura multimodal orientada a la generación y edición de contenido audiovisual. El modelo irrumpe en el sector para resolver una de las limitaciones históricas de la inteligencia artificial generativa de vídeo: la falta de continuidad temporal y el rápido deterioro de la coherencia visual en secuencias largas.

    La nueva versión está disponible para desarrolladores a través de la API de Gemini en Google AI Studio, así como para usuarios finales en la plataforma Google Flow y la aplicación móvil de Gemini.

    Extensión de escenas y control por fotogramas clave

    La principal novedad de Gemini Omni 1.1 Flash radica en su capacidad para procesar un contexto temporal amplio antes de calcular la siguiente secuencia. El modelo analiza hasta 10 segundos de vídeo previo para conservar con mayor fidelidad parámetros como la dirección de la luz, el comportamiento de la física, la textura de las superficies y la identidad de los personajes.

    Esta ventana de contexto permite extender escenas en tramos sucesivos hasta alcanzar un máximo de 40 segundos de duración continua, evitando que cada nuevo segmento parezca una toma independiente.

    Para aproximar la inteligencia artificial a los flujos de trabajo tradicionales de la industria del cine y la animación, Google ha incorporado el control por fotogramas de inicio y fin (primer y último fotograma):

    • Transiciones guiadas: Los creadores pueden subir dos imágenes fijas para definir cómo inicia y concluye un plano; el modelo genera el movimiento intermedio de forma fluida.
    • Movimientos de cámara precisos: Facilita la planificación de giros, desplazamientos y zooms sin perder la composición del escenario.
    • Edición conversacional: Mantiene el ajuste mediante lenguaje natural, permitiendo modificar elementos específicos de un clip ya generado mediante instrucciones escritas sin necesidad de procesar el renderizado desde cero.

    De borradores rápidos a exportación en resolución 4K

    En términos de rendimiento operativo, la herramienta introduce un flujo de producción por fases diseñado para optimizar los tiempos de computación y los costes en la nube.

    Los usuarios y desarrolladores pueden generar borradores rápidos en resolución 360p para evaluar encuadres, dinámicas de movimiento y variaciones de Promptsprompts. Una vez aprobado el borrador, el sistema permite escalar la secuencia a resoluciones profesionales de 1080p o 4K.

    Respecto al esquema tarifario para integraciones vía API:

    CONFIRMADO:

    • Calidad 1080p: Tiene un coste fijado en 0,15 dólares por segundo de vídeo generado.

    REPORTADO:

    • Calidad 4K: La documentación preliminar sitúa la tarifa en torno a los 0,30 dólares por segundo, aunque la cifra definitiva dependerá del volumen de procesamiento contratado en la nube.

    Integración en el ecosistema creativo y empresarial

    La tecnología de Google no se limitará al ecosistema propio. La compañía ha confirmado que Gemini Omni 1.1 Flash se integrará en herramientas de software de terceros, destacando su incorporación dentro de la suite Adobe Firefly y en Google Vids, la plataforma corporativa destinada a la creación automatizada de presentaciones y vídeos de empresa.

    Aunque la posibilidad de extender clips hasta 40 segundos y escalar a 4K representa un paso firme hacia la madurez de la IA audiovisual, el desafío técnico a medio plazo seguirá siendo verificar si el modelo puede sostener la coherencia estética en proyectos cinematográficos de mayor complejidad narrativa.