
CROWSON, paso 3: más decisiones de color — y cómo genera de verdad una imagen Stable Diffusion
En las dos entradas anteriores presentamos CROWSON: Llama elige colores de una lista cerrada y el código, sin ninguna inteligencia artificial, los dibuja en un lienzo. Primero fueron tres decisiones (cielo, suelo, un elemento central); después añadimos ver la respuesta cruda del modelo. Este tercer paso amplía las decisiones de color, y aprovechamos para explicar con más detalle lo que un generador de imágenes real hace de verdad — que es precisamente lo que CROWSON no hace.
Qué se ha añadido
Ahora Llama elige cinco colores en lugar de tres: además del cielo, el suelo y el elemento central, decide el color de una franja horizontal en la línea del horizonte (nubes, niebla, el brillo del atardecer…) y el color de una estrella, una segunda forma más pequeña en una esquina. El modelo sigue sin elegir ninguna forma — eso lo sigue fijando el código, exactamente igual que antes. Lo único que ha cambiado es cuántas decisiones de color le pedimos.
Con la frase “un mediodía mirando a los rascacielos de nueva york”, el modelo respondió:
{"cielo": "naranja", "suelo": "negro", "franja": "blanco", "elemento": "amarillo", "estrella": "azul"}
El suelo negro es una buena muestra de los límites del vocabulario cerrado: dentro de solo ocho colores, “negro” es la aproximación más cercana a “asfalto de una ciudad”, aunque no sea literalmente el color de una calle. Ese tipo de aproximación, otra vez, no es un fallo que haya que esconder: es la propia idea del proyecto hecha visible.

Cómo genera una imagen de verdad un generador como Stable Diffusion
Aquí es donde conviene detenerse, porque hasta ahora lo habíamos resumido en una frase. El proceso real tiene varias piezas, todas entrenadas con datos:
1. El texto se convierte en números (CLIP). Un modelo como CLIP se entrena con cientos de millones de pares imagen-texto, aprendiendo a colocar cerca, en un espacio matemático de miles de dimensiones, las imágenes y las frases que describen lo mismo. El resultado, para cualquier frase nueva, es un vector: una lista larga de números que representa “qué significa” esa frase para el modelo. No es una palabra de una lista cerrada — es un punto en un espacio continuo con matices que no se pueden nombrar.
2. Se trabaja en un espacio latente, no en píxeles. Para no tener que procesar millones de píxeles directamente, otra red (un autoencoder) comprime las imágenes en una representación mucho más pequeña, el “espacio latente”. Todo el proceso de generación ocurre ahí, y solo al final se descomprime de vuelta a una imagen de tamaño completo.
3. La difusión: de ruido puro a una imagen, paso a paso. Se parte de puro ruido aleatorio en ese espacio latente — el equivalente a la estática de un televisor sin señal. Una red neuronal (normalmente una U-Net), entrenada con millones de imágenes reales, predice en cada paso “qué parte de esto es ruido” y la resta un poco, guiada todo el tiempo por el vector de texto de CLIP. Este proceso se repite muchas veces — normalmente entre 20 y 50 pasos — y en cada uno la imagen latente se parece un poco más a lo que el texto describe.
4. De vuelta a píxeles. El resultado final del proceso de difusión se descomprime con la otra mitad del autoencoder, y ahí aparece la imagen completa.
Todo el sistema — el codificador de texto, la red que quita el ruido, el decodificador de imagen — se entrena de antemano con cientos de millones de imágenes reales emparejadas con sus descripciones (conjuntos de datos como LAION). Por eso un generador real puede producir prácticamente cualquier color, forma o composición: ha visto ejemplos de casi todo.
Comparado, punto por punto, con lo que hace CROWSON
- Interpretar el texto: Stable Diffusion usa CLIP, miles de números en un espacio continuo. CROWSON usa Llama eligiendo, como mucho, cinco palabras de una lista cerrada de ocho.
- Convertir esa interpretación en imagen: Stable Diffusion parte de ruido y lo limpia durante decenas de pasos con una red neuronal entrenada para imágenes. CROWSON no tiene ruido ni pasos: dibuja, de una sola vez, cinco formas geométricas fijas con reglas de programación normales.
- De dónde sale la capacidad de “saber dibujar”: en Stable Diffusion, de haber visto cientos de millones de imágenes reales durante el entrenamiento. En CROWSON, de ningún sitio parecido: el rectángulo, el círculo, la franja y la estrella están escritos directamente en el código, no aprendidos.
CROWSON no es una versión pequeña o simplificada de un generador real — es un mecanismo completamente distinto (sin ninguna red de imagen) que simula solo la forma general del proceso: texto, interpretación, píxeles. Con esta comparación completa, y con las cinco decisiones de color ya en marcha, seguimos sin acercarnos ni un paso a fingir que esto es difusión de verdad.

Etiqueta:AIDARAC, CLIP, crowson, difusión, espacio latente, montesteam, Stable Diffusion, texto a imagen



