
CROWSON, taller: mira con tus propios ojos cómo genera una imagen un modelo de difusión real
En la entrada del paso 5 contamos que Pollinations genera la imagen con un modelo de difusión real, pero también dijimos algo importante: el servicio gratuito no nos deja ver los pasos intermedios de esa generación concreta, solo el resultado final. Este taller resuelve justo eso — con dos recursos reales, no simulados, para que el alumnado vea con sus propios ojos lo que CROWSON solo puede explicar con palabras.
Antes de nada: el proceso entero, en una sola imagen

“X-Y plot of algorithmically-generated AI art of European-style castle in Japan demonstrating Euler ancestral diffusion steps”, de Benlisquare, licencia CC BY-SA 4.0, vía Wikimedia Commons (ver la imagen original).
Esta cuadrícula muestra diez momentos de la misma generación: en el paso 1 solo hay una mancha de color sin forma; hacia el paso 8 ya se intuye una silueta entre niebla; a partir del paso 15 el castillo es reconocible; en el paso 40, la imagen final, nítida y con detalle. Ese recorrido — de ruido a forma reconocible a detalle fino — es exactamente lo que CROWSON explica desde la primera entrada, pero aquí se ve de un vistazo, en una imagen real, con su autor y su licencia bien visibles (recuerda: es CC BY-SA, así que si la recortáis o la modificáis para la presentación, la versión que enseñéis en clase tiene que citar igualmente a Benlisquare).
Ahora, para verlo en marcha: Diffusion Explainer
Una imagen fija muestra el resultado de diez pasos concretos, pero no dónde se toma cada decisión. Para eso existe Diffusion Explainer (poloclub.github.io/diffusion-explainer), una herramienta interactiva, gratuita y sin registro, hecha por un equipo de investigación de Georgia Tech, que deja literalmente entrar dentro del proceso de un modelo de difusión real — Stable Diffusion — y mover sus controles con la mano.

Guía paso a paso para el alumno
- Abre
https://poloclub.github.io/diffusion-explainer/. Va a aparecer ya un ejemplo funcionando: una frase de texto a la izquierda, y a la derecha la imagen que ha generado. - Mira el diagrama de arriba sin tocar nada todavía. De izquierda a derecha: la frase de texto, una caja verde (“Text Representation Generator”), una caja rosa (“Image Representation Refiner”) y la imagen final. Ese es, con nombres reales, el mismo recorrido que ya conoces de CROWSON: texto -> interpretación -> píxeles.
- Haz clic en la caja verde “Text Representation Generator”. Vas a ver cómo la frase se trocea en piezas (“tokens”) y cómo esas piezas se convierten en números — así es como un modelo real “entiende” el texto, muy distinto de que Llama elija un color de una lista.
- Haz clic en la caja rosa “Image Representation Refiner”. Ahora sí vas a ver lo que ninguna captura de Pollinations nos deja ver: arriba a la derecha aparece un control “Timestep”. Muévelo hasta el principio (Timestep 1) y fíjate en el cuadrado de la derecha — es puro ruido de color, sin ninguna forma, como la estática de una televisión sin señal.
- Ahora mueve el control “Timestep” poco a poco hacia la derecha (o dale a reproducir). En cada paso, una red llamada UNet predice qué parte de ese cuadrado es ruido de más y la quita un poco. Repite esto muchas veces, y verás cómo el cuadrado de ruido se va pareciendo, cada vez más, a algo reconocible.
- Cuando llegues al final, haz clic en “Select another prompt” y prueba con una frase distinta — por ejemplo, una parecida a las que ya habéis probado en CROWSON. Repite los pasos 4 y 5 con la frase nueva.
- Por último, prueba a cambiar el valor de “Guidance scale” (arriba a la derecha de la caja rosa) y genera de nuevo. Con un valor bajo, la imagen se parece menos a la frase; con uno alto, se ajusta más — pero un valor demasiado alto puede exagerar la imagen. Es la única “perilla” de todo el proceso que se parece un poco a lo que hace el vocabulario cerrado de colores en CROWSON: un control simple sobre un proceso que, por dentro, es muchísimo más complejo.

Lo que hay que sacar en claro
CROWSON, en su Paso 5, hace exactamente este mismo tipo de proceso a través de Pollinations — pero de forma “opaca”: escribes la frase, esperas, y aparece la imagen, sin ver nada de lo que ha pasado por dentro. Diffusion Explainer no genera nada para vuestro proyecto ni sustituye a Pollinations — es una lupa sobre el mismo tipo de proceso, con un modelo real (Stable Diffusion), que deja ver aquello que el servicio gratuito de CROWSON tiene que dar ya hecho. Vistas las dos cosas juntas — la cuadrícula del castillo y esta herramienta interactiva — el alumnado tiene, por primera vez en todo el proyecto, una imagen completa y verificable de qué es de verdad la difusión, no solo una explicación con palabras.
Próximamente
Vídeo explicando este taller, que se añadirá aquí cuando esté grabado.




