Publi

Después del lanzamiento exitoso de un modelo de conversión de texto a imagen, un lanzamiento controvertido de un modelo de conversión de texto a música y un lanzamiento en gran medida desapercibido de un modelo de generación de texto, Stability AI acaba de anunciar el lanzamiento de Stable Video Diffusion, un texto herramienta de conversión a vídeo que tiene como objetivo hacerse un hueco en el naciente espacio del vídeo generativo.»Stable Video Diffusion [is] un modelo de difusión de video latente para la generación de texto a video e imagen a video de alta resolución y de última generación», explica Stability AI en el artículo de investigación del modelo, y agrega en el anuncio oficial: «Abarcando todas las modalidades Incluyendo imagen, lenguaje, audio, 3D y código, nuestro portafolio es un testimonio de la dedicación de Stability AI para amplificar la inteligencia humana. «Esta adaptabilidad, junto con la tecnología de código abierto, allana el camino para numerosas aplicaciones en publicidad, educación y entretenimiento. . Stable Video Diffusion, que ahora está disponible en una vista previa de la investigación, es capaz de «superar a los métodos basados ​​en imágenes con una fracción de su presupuesto informático», según los investigadores. Las capacidades técnicas de Stable Video Diffusion son impresionantes. «Los estudios de preferencia humana revelan que el «El modelo resultante supera a los modelos de imagen a vídeo de última generación», revela el artículo de investigación. Stability confía claramente en la superioridad del modelo a la hora de transformar imágenes estáticas en contenido de vídeo dinámico, afirmando que su modelo supera a los modelos cerrados en los estudios de preferencias del usuario. .Stability AI ha desarrollado dos modelos bajo el paraguas de Stable Video Diffusion: SVD y SVD-XT. El modelo SVD transforma imágenes fijas en vídeos de 576×1024 en 14 fotogramas, mientras que SVD-XT utiliza la misma arquitectura pero se extiende a 24 fotogramas. Ambos modelos ofrecen generación de vídeo a velocidades de fotogramas que van de tres a 30 fotogramas por segundo, situándose a la vanguardia de la tecnología de texto a vídeo de código abierto. En el campo en rápida evolución de la generación de vídeo con IA, Stable Video Diffusion compite con tecnologías innovadoras. Modelos como los desarrollados por Pika Labs, Runway y Meta. Emu Video, recientemente anunciado por este último, similar en su capacidad de conversión de texto a video, muestra un potencial significativo con su enfoque único para la edición de imágenes y la creación de videos, aunque con una limitación actual a videos con resolución de 512×512 píxeles. A pesar de sus logros tecnológicos, Stability AI es navegar a través de desafíos, incluidas consideraciones éticas sobre el uso de datos protegidos por derechos de autor en la capacitación en inteligencia artificial. La compañía enfatiza que el modelo «no está diseñado para aplicaciones comerciales o del mundo real en esta etapa», enfocándose en refinarlo en función de los comentarios de la comunidad y las preocupaciones de seguridad. A juzgar por el éxito de SD 1.5 y SDX, el software de código abierto más potente. Modelos para la generación de imágenes: esta nueva incursión en la escena de la generación de vídeo insinúa un futuro en el que las líneas entre lo imaginado y lo real no sólo serán borrosas, sino bellamente redibujadas. Editado por Ryan Ozawa.

Manténgase al tanto de las noticias sobre criptomonedas y reciba actualizaciones diarias en su bandeja de entrada.