Cómo funciona, en un párrafo
Escribes una descripción y aparece una imagen. Por debajo, la herramienta arranca con ruido visual aleatorio y lo va empujando poco a poco hacia algo que encaje con tus palabras, después de haber aprendido qué aspecto tienen las palabras a partir de una cantidad enorme de imágenes con pie de foto.
Una sola consecuencia explica casi toda la frustración de los principiantes: el modelo compara tu descripción con patrones, no sigue instrucciones como haría una persona. Si escribes "sin perro", la palabra perro sigue ahí dentro y es muy posible que aparezca un perro. Si te dejas algo sin decir, no te lo pregunta: rellena el hueco con la versión más promedio de esa cosa que ha visto.
Ahí está toda la habilidad. Di con concreción lo que quieres, y di lo que no quieres en el sitio diseñado para eso.
La fórmula de seis partes
Casi todo buen prompt de imagen contiene las mismas seis cosas. Las que faltan se rellenan con valores por defecto, y esos valores por defecto son justo lo que hace que una imagen parezca genérica.
| Parte | Qué decir | Si la omites |
|---|---|---|
| Sujeto | La cosa concreta, con los detalles que importan | La versión más genérica de ese sustantivo |
| Escenario | Dónde está, y cuánto se ve de él | Un fondo vacío o recargado |
| Iluminación | Hora del día, dirección, calidad | Plana, uniforme, sin vida |
| Encuadre | Primer plano o plano general, desde qué ángulo | Un plano medio centrado, siempre |
| Estilo | Fotografía, óleo, render 3D, ilustración | Arte digital brillante |
| Ánimo o color | La sensación y la paleta | Sobresaturado y con mucho contraste |
Un prompt flojo: una sala de estar acogedora.
Un prompt sólido: Una sala de estar pequeña con la chimenea encendida y un gato atigrado dormido en un sillón desgastado, luz de última hora de la tarde entrando por una ventana orientada al oeste, plano general desde la puerta, fotografía realista, 35 mm, marrones cálidos y ámbar suave, ambiente tranquilo y con aire de estar habitada.
Pensar cualquiera de los dos cuesta más o menos lo mismo. El segundo es una imagen; el primero es una categoría.
Luego añade la parte que los principiantes se saltan por completo: una lista de negativos. Negativo: texto, marca de agua, dedos de más, fondo recargado, sonrisa de foto de stock. Casi todo lo que hace que una imagen parezca generada por IA viene de un pequeño conjunto de artefactos que se repiten, y nombrarlos los quita.
El truco que lo vuelve fácil
No tienes que escribir estos prompts tú. Pídele a una IA de texto que los escriba por ti.
Escribe un prompt de generación de imagen para: [tu idea en bruto]. Es para [propósito]. Estructúralo como sujeto, escenario, iluminación, encuadre, estilo, color y ánimo, y después una lista de negativos. Dame tres versiones que se diferencien en el encuadre y no en los adjetivos.
Los modelos de lenguaje escriben prompts de imagen bastante mejor que la mayoría de la gente, porque el formato es conocido y han visto cantidades enormes de ejemplos. Por eso generar imágenes dentro de un chat es de verdad más útil que una caja de imágenes suelta: la herramienta que escribe el prompt está justo al lado de la que dibuja.
Por qué tu imagen salió mal
Una lista corta de diagnóstico que cubre casi todos los problemas de principiante.
Aburrida y genérica. No especificaste iluminación ni encuadre. Esas dos hacen más trabajo que cualquier otra pareja.
Los elementos correctos, mal colocados. Di el encuadre de forma explícita: plano general desde abajo, primer plano, el sujeto en el tercio izquierdo. El modelo no tiene ni idea de dónde quieres las cosas si no se lo dices.
Aparece algo que pediste no ver. Nombrarlo en el prompt principal lo hace más probable, no menos. Muévelo a la lista de negativos.
Las manos, las caras o los detalles pequeños repetidos salen mal. Sigue siendo el punto más débil en todas partes. Prueba con un recorte más cerrado, con otro ángulo o con que las manos no se vean. A veces basta con regenerar.
El texto es un galimatías. Es lo esperable. Mira la sección siguiente.
Parece una foto de stock. Añade espontáneo, describe una acción en lugar de una pose y pon sonrisa de foto de stock mirando a cámara en los negativos.
Forma equivocada para donde la necesitas. Pide la relación de aspecto que de verdad necesitas. Recortar un cuadrado para convertirlo en banner tira a la basura la composición que pediste.
Iterar sin dar vueltas en círculo
Los principiantes regeneran el mismo prompt esperando una tirada mejor. Algo de azar es inevitable, pero la mayoría de los intentos desperdiciados vienen de cambiar varias cosas a la vez.
- Cambia una sola cosa por intento. Iluminación, o encuadre, o estilo. No las tres, o no sabrás qué ayudó.
- Arregla la composición antes que el detalle. Acertar primero con el encuadre y la luz es mucho más eficiente que perfeccionar un sujeto que está en la parte equivocada del cuadro.
- Describe lo que sí estaba bien. Cuando una imagen se acerca, dilo con palabras en el siguiente prompt en vez de dar por hecho que la herramienta se acuerda.
- Guarda los prompts que funcionaron. Seis u ocho estructuras de prompt fiables valen más que cualquier imagen suelta, y son lo que hace que un conjunto de imágenes parezca de la misma familia.
Lo que todavía no puede hacer
Texto. Las palabras dentro de las imágenes siguen siendo poco fiables en todas partes. Una palabra corta a veces sale; un titular o un logotipo normalmente no. Genera la imagen limpia y añade el texto en cualquier herramienta de diseño, que además te da la tipografía correcta.
Disposiciones exactas. "Exactamente tres objetos, el rojo a la izquierda" no se cumple de forma fiable. Si la disposición importa, genera las piezas y móntalas tú.
El mismo personaje dos veces. Conseguir una persona o un producto idénticos a lo largo de una serie es difícil. Las descripciones detalladas y repetidas ayudan, pero no garantizan resultados idénticos.
Editar una foto real con precisión. Puede ajustar bien el fondo, la iluminación y el estilo. No puede mover con fiabilidad un objeto cinco centímetros a la izquierda.
Y sobre el uso de los resultados: revisa las reglas antes de que algo generado acabe en un uso comercial. Ten especial cuidado con imágenes que se parezcan a una persona real, a un lugar reconocible o al estilo distintivo de un artista vivo. Las condiciones cambian de una herramienta a otra y la responsabilidad recae en quien publica la imagen.
- Incluye las seis partes: sujeto, escenario, iluminación, encuadre, estilo y ánimo
- Pon lo que no quieres en una lista de negativos, nunca en la descripción principal
- Pídele a una IA de texto que escriba el prompt de imagen a partir de tu idea en bruto
- Genera en la relación de aspecto que de verdad necesitas
- Cambia una sola variable por intento para saber qué fue lo que ayudó
- Añade el texto en una herramienta de diseño, no en el modelo de imagen
- Guarda los prompts que funcionaron para que tus imágenes sean consistentes
Preguntas frecuentes
¿Necesito talento artístico para generar imágenes con IA?
No, pero sí necesitas talento descriptivo, y esa es la parte que los principiantes subestiman. La diferencia entre una imagen decepcionante y una buena está casi por completo en lo concreto que fuiste al describir la iluminación, el encuadre y el estilo. Si describir una escena con detalle no te sale solo, pídele a una IA de texto que convierta tu idea en bruto en un prompt estructurado: funciona muy bien.
¿Puedo usar la IA para que se me ocurran ideas de imágenes?
Sí, y sirve más de lo que casi nadie imagina. Pide a un chatbot cinco conceptos descriptivos y luego pídele que convierta tu favorito en un prompt de imagen completo y estructurado, con lista de negativos. Los modelos de lenguaje escriben prompts de imagen mejor que la mayoría de los principiantes, y por eso generar imágenes dentro de un chat le gana a una caja de imágenes suelta.
¿Por qué el texto de mi imagen parece un sinsentido?
Porque el texto renderizado es de verdad el punto más débil de todos los modelos de imagen, y ningún prompt lo arregla de forma fiable. Las palabras cortas y sueltas a veces salen; los titulares, los logotipos y las etiquetas normalmente no. Genera la imagen sin texto y añade la tipografía en cualquier herramienta de diseño, que además te deja usar la fuente correcta y colocarla bien.
¿Qué generador de imágenes es el mejor?
Depende del tema más de lo que la gente espera. Flux es el más fuerte en fotorrealismo y en todo lo que deba parecer salido de una cámara. Stable Diffusion da más control estilístico y más variedad para ilustración. La forma más rápida de decidir es pasar el mismo prompt por dos de ellos y mirar los resultados lado a lado, porque el que gana en retratos suele no ser el que gana en interiores.
¿Necesito una suscripción aparte para generar imágenes?
No necesariamente. La generación de imágenes está incluida en Whizi a partir del plan Pro, junto a los modelos de texto, y eso cubre el trabajo creativo y de contenido habitual sin una segunda factura. Una herramienta de imagen dedicada sigue teniendo sentido para quien se dedica a esto profesionalmente todos los días y quiere un control estilístico muy fino.