Google pone la guinda a una semana ajetreada en el espacio de la IA generativa con el lanzamiento de Imagen 3, su nuevo modelo de conversión de texto a imagen. Este lanzamiento se basa en el éxito de Imagen 2, presentado en diciembre de 2023, que ya rivalizaba con pesos pesados de la industria como Dall-E 3 y MidJourney v5. Imagen 3, anunciado originalmente en mayo, cuenta con capacidades mejoradas para comprender y ejecutar indicaciones complejas, generar imágenes con detalles mejorados y una mejor adherencia a las indicaciones en comparación con su predecesor. Es bastante versátil y produce buenos resultados que van desde el fotorrealismo hasta el arte y las composiciones en 3D. «Imagen 3 es nuestro modelo de conversión de texto a imagen de mayor calidad, capaz de generar imágenes con un detalle aún mejor, una iluminación más rica y menos artefactos que distraigan que nuestros modelos anteriores», dijo Google en su anuncio oficial. Las mejoras de las indicaciones de Imagen 3 permiten a los usuarios describir las imágenes deseadas en lenguaje natural sin una ingeniería de indicaciones compleja. El entrenamiento del modelo también incorporó leyendas de imágenes más ricas, lo que le permitió capturar detalles matizados como ángulos de cámara específicos o composiciones e indicaciones de texto largas cuando fue necesario. El gigante tecnológico ha puesto especial énfasis en las capacidades mejoradas de representación de texto de Imagen 3. Aunque han mejorado notablemente, nuestras pruebas iniciales muestran que sus capacidades no están a la par con las de otros modelos como Dall-E 3, Auraflow o Flux.Generaciones de Imagen 3 y Grok 2 usando el mismo mensajeGoogle también ha enfatizado su compromiso con la seguridad y la responsabilidad en el desarrollo y despliegue de Imagen 3. La compañía implementó lo que describió como procesos de «filtrado y etiquetado de datos extensos» para minimizar el contenido dañino en los conjuntos de datos de entrenamiento del modelo. Además, Google dijo que realizó evaluaciones exhaustivas, incluidos ejercicios de equipo rojo, para identificar y corregir posibles vulnerabilidades. También es importante señalar que Imagen 3 integra SynthID, la herramienta de marca de agua de Google. SynthID incrusta una firma digital directamente en los píxeles de las imágenes generadas. Esta marca de agua es imperceptible para el ojo humano pero detectable por un software especializado, lo que proporciona un medio para identificar el contenido generado por IA. Actualmente, Imagen 3 está disponible a través de la plataforma ImageFX de Google y Vertex AI. De cara al futuro, Google planea introducir funciones de edición populares de Imagen 2, como inpainting (editar elementos en la imagen) y outpainting (expandirla), a Imagen 3 en los próximos meses. La compañía también ha anunciado sus intenciones de ampliar la disponibilidad de Imagen 3 en todo su ecosistema de productos, incluida la integración en la aplicación Gemini, Google Workspace y Google Ads. Este lanzamiento es parte de una estrategia más amplia de Google que tiene como objetivo poner Gemini y la tecnología de IA en básicamente todos sus servicios y hardware. Esta semana, la compañía presentó su nueva línea Pixel 9, que fue diseñada con capacidades de IA en su núcleo. Los nuevos teléfonos Pixel pueden manejar ciertas tareas de IA generativa de forma local, incluidas tareas basadas en texto y generaciones de imágenes pequeñas. El lanzamiento de Imagen 3 se produce en medio de una oleada de actividad en el espacio de generación de imágenes de IA. xAI de Elon Musk presentó recientemente Grok 2, con el generador de imágenes Flux.1, que ha ganado atención por su capacidad para producir imágenes altamente realistas y sin censura junto con sólidas capacidades de generación de texto. Mientras tanto, MidJourney, otro actor clave en el campo, anunció una inminente actualización v6.2 de su modelo. La compañía también adelantó el desarrollo de MidJourney v7, programado para su lanzamiento en los próximos meses. Ideogram, otro competidor en el campo de la generación de imágenes con IA, también ha insinuado una próxima actualización de su modelo. Por último, la Open Model Initiative ha elegido Flux.1 como base para desarrollar su modelo de generación de imágenes de código abierto de última generación. Editado por Ryan Ozawa.
Boletín informativo generalmente inteligente
Un viaje de IA semanal narrado por Gen, un modelo de IA generativa.

















