OpenAI ha lanzado la nueva versión de su IA generadora de imágenes, ChatGPT Images 2.0, en un intento no-desesperado-pero-casi de recuperar el trono de un mercado en el que hace tiempo que había sido superado por Gemini.
Y vaya sí lo ha conseguido.
No me gusta utilizar un tono exagerado al escribir pero lo de “revienta” que he puesto en el titular es así. Literalmente.
De hecho, apenas unas horas después de haberse lanzado, este nuevo modelo ya lidera el LLM Arena, la principal referencia a nivel popular para evaluar todo topo de IAs, en la categoría de generación de imágenes, con una gran (enorme) ventaja sobre Nano Banana 2.
Veamos cuáles son sus méritos para haberlo logrado.
En cuanto abres por primera vez la nueva interfaz de generación de imágenes de ChatGPT te das cuenta que el equipo de Sam Altman se ha inspirado, mucho, en el éxito de Gemini y su Nano Banana 2. Al igual que en ese caso, Images 2.0 presume de algunas novedades muy atractivas a primera vista para quien la usa, como la apuesta por incluir capas avanzadas de razonamiento, que ayudan a comprender mejor el fondo de la petición del usuario y a devolver un prompt más ajustado a lo que espera.
Ese razonamiento es palpable en todo el proceso de generación de la imagen, que puede durar algunos segundos, utilizando los típicos mensajes de texto del estilo “analizando petición”, “preparando boceto”, “generando entorno” o “un último retoque”.
Por otra parte, y para hacerlo todavía más práctico, ChatGPT ha colocado algunos estilos prediseñados al alcance del usuario, con un gatito (como no) como hilo conductor, para que los usuarios puedan elegir entre apariencias como “anime”, “retrato dramático”, “libro para colorear”…
Selector de estilos de ChatGPT Images 2.0
De acuerdo con la documentación de OpenAI, ChatGPT Images 2.0 presume de haber dado un salto cualitativo en el seguimiento de instrucciones detalladas y en la colocación exacta de objetos. Así, es capaz de renderizar textos densos, iconografía, elementos de interfaz de usuario y composiciones complejas con una gran fidelidad.
“Utiliza la primera parte del texto sobre Marketing4ecommerce para crear una imagen realista en la que la primera parte de la noticia aparezca en las páginas de un periódico de papel de los años 70, en español, en blanco y negro. El periódico está doblado sobre una mesa de trabajo en la que hay una taza de café”
Además, el modelo ofrece una mayor flexibilidad en cuanto a formatos, soportando relaciones de aspecto que van desde el panorámico 3:1 hasta el vertical 1:3. Esta versatilidad permite generar, en una sola sesión, desde banners para sitios web hasta gráficos para redes sociales o carteles, manteniendo siempre la continuidad de personajes y objetos.
“Ahora hagamos una versión de esta imagen en la que el periódico aparezca en las manos de una directora, de 40 años, en su oficina en LATAM. La imagen tiene que ser estilo manga”
¿Una de sus grandes fortalezas? Puede crear hasta ocho imágenes en una sola tanda, manteniendo continuidad de personajes y objetos.
Este cuidado de la coherencia permite incluso evolucionarlos a formatos más complejos, como la siguiente página de estilo manga. Este fue el prompt utilizado: “Ahora generemos una página de comic manga, con varias viñetas en las que se desarrolla una historia en la que la directora deja dramáticamente el periódico sobre la mesa y dice a un empleado, vestido de traje “¡Unámonos a la comunidad M4C!”. El empleado sale corriendo con un estilo épico y acude a su computadora. No se ve la pantalla del ordenador, solo el teclado. Coge el ratón del ordenador con su mano. Y pulsa. La última viñeta es una onomatopeya de “¡¡¡clic!!””
Otro pilar fundamental de esta actualización es mayor conocimiento sobre el mundo real, ya que el modelo posee un conocimiento actualizado hasta diciembre de 2025, lo que permite crear infografías, resúmenes visuales y materiales educativos correctos y claros. Además, la IA puede buscar información en la web en tiempo real para asegurar que el contenido sea contextualmente exacto, razonar sobre la estructura de la imagen antes de generarla y realizar verificaciones internas de sus propios resultados.
OpenAI también presume de la mejora en la comprensión multilingüe de la herramienta, lo que permite utilizarlo para crear textos más precisos en múltiples idiomas y sistemas de escritura.
Así, ChatGPT Images 2.0 ya no solo genera buenas imágenes con texto que utilice el alfabeto latino, sino que permite lograr grandes resultados con idiomas como japonés, chino, coreano, hindi y bengalí. De esta forma OpenAI abre nuevas oportunidades de mercado para su propia herramienta… y permite a las marcas crear campañas localizadas donde el idioma es una parte integral y fluida del diseño, no una simple traducción superpuesta.
Imagen realista de un tríptico sobre Marketing4ecommerce generado a partir de la información de nuestra web. La IA seleccionó el texto a destacar
Por supuesto no todo es tan maravilloso y la propia OpenAI reconoce limitaciones claras. Sigue teniendo dificultades en tareas que requieren una comprensión física completamente coherente, como construcciones complejas tipo origami o puzzles, así como en la representación de detalles extremadamente densos o en superficies parcialmente ocultas o invertidas.
Del mismo modo, elementos como diagramas con etiquetas muy precisas o estructuras complejas pueden requerir revisión.
ChatGPT Images 2.0 ya se encuentra disponible para todos los usuarios… aunque el acceso a sus funciones más potentes está segmentado según el tipo de plan. Actualmente, cualquier persona con una cuenta en ChatGPT puede empezar a utilizar el modelo, pero las capacidades de “razonamiento avanzado”, que permiten a la IA buscar información en tiempo real, generar múltiples variaciones coherentes de una sola vez y verificar la precisión de sus propios resultados, están reservadas exclusivamente para los suscriptores de los planes Plus, Pro y Business. En este artículo te explicamos las claves de todos los planes de ChatGPT.
Para los profesionales del desarrollo y empresas que buscan una integración más profunda, la herramienta también está disponible a través de la API de OpenAI y dentro de Codex. De hecho, la empresa busca que en Codex la generación de imágenes no se entienda como una función aislada, sino como parte de un entorno de trabajo más amplio que permite idear, prototipar y desarrollar productos, presentaciones o materiales visuales dentro de un mismo espacio.
En estos casos, el esquema de precios no es una tarifa plana, sino que se basa en un modelo de pago por uso. El costo final de cada imagen generada dependerá directamente de la configuración elegida por el usuario: factores como la calidad del renderizado (estándar o alta definición) y la resolución seleccionada (que ahora permite formatos de hasta 2K en fase beta) determinarán el precio final por cada activo visual creado.
Imagen: ChatGPT, a partir de la orden de buscar información sobre Marketing4eCommerce.co y plasmarla en una pizarra, presentada por un simpático androide con pajarita
No se han encontrado publicaciones relacionadas
Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *
Δ