Alibaba presenta Qwen-Image-3.0 para generar imágenes con mayor realismo útil
Alibaba presentó Qwen-Image-3.0, una evolución de su modelo de generación de imágenes que avanza desde el realismo de la versión anterior hacia resultados prácticamente útiles. El nuevo modelo genera contenido enriquecido con diseños complejos, detalles auténticos con precisión de 10 píxeles, y renderizado en doce idiomas con más de cien estilos artísticos.
- Qwen-Image-3.0 procesa hasta 4.500 tokens y genera imágenes con diseños complejos y organización ordenada de múltiples conceptos
- El modelo renderiza texto de 10 píxeles y reproduce elementos detallados como poros de piel o hebras de bordados
- Soporta doce idiomas, múltiples fuentes, cien estilos artísticos y diversas interfaces como páginas web, juegos y transmisiones en directo
Alibaba presentó Qwen-Image-3.0, una nueva iteración de su modelo de generación de imágenes que profundiza en el realismo mediante contenido enriquecido, detalles auténticos y conocimiento profundo. El modelo avanza desde el realismo que ofrece Qwen-Image-2.0 hacia resultados que son útiles más allá de ser visualmente atractivos. Para lograrlo, Alibaba se centró en tres dimensiones clave que definen la capacidad generativa del sistema.
La primera dimensión es el contenido enriquecido, reflejado en resultados con diseños complejos que se expanden horizontalmente y organizan múltiples conceptos de manera ordenada dentro de una sola imagen sin interferencias. Ejemplos incluyen cómics sobre seguridad en túneles o lecciones de geometría espacial. Para procesar la información requerida en indicaciones muy detalladas, Qwen-Image-3.0 admite entradas de hasta 4.500 tokens. La segunda dimensión comprende los detalles auténticos, es decir, la precisión en la generación de imágenes. El modelo es capaz de renderizar texto de diez píxeles y reproducir elementos como poros de la piel o las hebras de los hilos utilizados en un bordado.
La tercera dimensión es el alcance multilingüe y estilístico del renderizado. Qwen-Image-3.0 abarca doce idiomas, múltiples fuentes, más de cien estilos artísticos y una variedad de interfaces de usuario como páginas web, juegos y transmisiones en directo. Todo ello se respalda en el profundo conocimiento del mundo que posee el modelo. Según reportó El Comercio.
Este artículo fue redactado con asistencia de IA a partir de fuentes públicas y está sujeto a revisión editorial de Ahora.