Google anunció Gemini Omni durante su evento anual I/O, posicionando el modelo como el siguiente salto más allá de sus generadores de video Nano Banana y Veo 3.1. En contraste con su predecesor, que limitaba a los usuarios a comandos y imágenes estáticas, Gemini Omni acepta una combinación de entradas - texto, imágenes, audio y incluso video raw - y produce videos pulidos basados en la amplia base de conocimientos de la empresa.
El lanzamiento comienza con Gemini Omni Flash, que ya está en vivo para los usuarios de la aplicación Gemini, Google Flow y YouTube Shorts. Los suscriptores de los niveles AI Plus, Pro y Ultra de Google pueden experimentar con la herramienta en todo el mundo, y la aplicación Create de YouTube comenzará a ofrecer la función esta semana.
Lo que distingue a Gemini Omni es su flujo de trabajo de edición conversacional. Los usuarios pueden subir un clip, luego pedirle al modelo que altere la escena, agregue nuevos personajes o cambie el ángulo de la cámara, todo a través de comandos de lenguaje natural. Cada instrucción se basa en la anterior, preservando la continuidad de personajes y objetos a lo largo de la edición. El sistema también afirma tener una comprensión más profunda de las fuerzas físicas - gravedad, energía cinética y dinámica de fluidos - para que las escenas generadas parezcan más realistas.
Más allá de la fidelidad visual, Google dice que el modelo combina el realismo fotográfico con el conocimiento contextual de la historia, la ciencia y la cultura. Esa combinación permite la creación de "historias significativas" y videos explicativos concisos que desglosan ideas complejas con ayuda visual. En el lanzamiento, la salida de audio estará limitada a referencias de voz, pero la empresa insinuó un futuro soporte para síntesis de habla completa.
Una de las características más personales permite a los usuarios generar un avatar digital que refleja su propia voz y apariencia. Al hablar al sistema, los usuarios pueden producir videos en los que aparecen como la estrella, una capacidad que plantea preocupaciones de privacidad. Google respondió con una promesa de hacer cumplir políticas claras que protejan contra el mal uso y de lanzar la tecnología de manera responsable.
Cada video creado con Gemini Omni llevará la marca de agua digital SynthID de Google, una firma invisible que confirma que el contenido fue generado por IA. La marca de agua está diseñada para ser robusta contra la manipulación, ofreciendo una forma de rastrear los medios sintéticos hasta su fuente.
Mientras que el marketing de Google resalta la capacidad del modelo para transformar metraje ordinario en momentos cinematográficos, la empresa reconoce que los generadores de video anteriores sufrieron de una apariencia de "valle inquietante" que desanimó a los usuarios. El motor de física mejorado y la integración de conocimientos de Gemini Omni están diseñados para cerrar esa brecha, aunque el rendimiento en el mundo real determinará si las afirmaciones se cumplen.
La estrategia de lanzamiento de Google apunta tanto a profesionales creativos como a usuarios casuales. Al incorporar la herramienta en plataformas existentes como YouTube Shorts, la empresa espera democratizar la producción de video de alta calidad. El movimiento también señala la ambición más amplia de Google de dominar el mercado de la IA generativa, donde los competidores están corriendo para ofrecer capacidades multimodales comparables.
Los observadores de la industria estarán atentos mientras Gemini Omni Flash llega a una audiencia más amplia. Si el modelo cumple con su promesa de creación y edición de video sin esfuerzo y de alta fidelidad, podría establecer un nuevo estándar para los medios sintéticos y cambiar la forma en que se produce contenido en línea.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.