
RAJI (1/2): montamos el juez de IA
¿Cómo sabe una IA si otra IA ha respondido bien? Es una pregunta que se hacen desde hace años quienes construyen estos sistemas, y la respuesta que ha ganado terreno en la industria tiene un nombre poco intuitivo: “AI as a judge”, un modelo que evalúa las respuestas de otro modelo. Es rápido, no necesita a una persona revisando cada respuesta una por una, y —lo más interesante para el aula— puede explicar por qué da la nota que da.
RAJI es nuestra versión mínima de esa idea, pensada para 2º de ESO en adelante: escribes una pregunta y una respuesta, y un segundo modelo, con el papel de profesor corrector, contesta solo tres cosas —si la respuesta es correcta, si se entiende bien, y por qué—. Nada de notas del 1 al 5: para que la corrección tenga sentido en el aula, mejor “Sí / Más o menos / No” que un número frío.
[ENLACE AL REPOSITORIO DE GITHUB]
Instalación
Igual de ligero que el resto de la familia: FastAPI sirviendo una única página, con LM Studio como único “cerebro” detrás, en local y sin ninguna clave de API de pago.
# 1. Clona el repositorio (o crea la carpeta a mano)
git clone [ENLACE AL REPOSITORIO DE GITHUB]
cd raji
# 2. Instala las dependencias
pip install -r requirements.txt
# 3. Asegúrate de que LM Studio está corriendo con un modelo cargado
# en http://localhost:1234 antes del siguiente paso
# 4. Arranca el servidor
uvicorn main:app --reload --port 8045
Y abre el navegador en http://localhost:8045.
Sin base de datos, sin conexión a servicios externos, sin coste por petición. Todo el “juicio” ocurre dentro de tu propio ordenador.
Qué te vas a encontrar
Un formulario arriba —asignatura, pregunta, respuesta— y, debajo, el panel dividido de siempre en dos columnas:
- Panel de resultado: el veredicto del juez en dos preguntas con respuesta en semáforo (verde para “Sí”, naranja para “Más o menos”, rojo para “No”), la explicación en una frase, y el tiempo de inferencia real de esa corrección.
- Panel de metadatos y auditoría: el modelo usado, la temperatura con la que se ha llamado a LM Studio, los tokens consumidos (prompt, respuesta y total), y —esto es importante— el prompt exacto que se le ha mandado al juez, sin resumir ni ocultar nada.
Ese segundo panel no es un capricho técnico: es la garantía de que, si alguien pregunta “¿por qué el juez le puso Más o menos a esta respuesta?”, la respuesta está ahí, no hay que fiarse de memoria.
Cómo funciona por dentro
Una sola llamada a LM Studio, con un prompt fijo con esta forma:
Eres un profesor de {asignatura} de instituto corrigiendo la
respuesta de un alumno. Sé breve, claro y amable...
Pregunta: {pregunta}
Respuesta del alumno: {respuesta}
Responde solo estas tres cosas, en este orden:
CORRECTA: Sí / Más o menos / No
CLARA: Sí / Más o menos / No
EXPLICACION: una frase explicando por qué
Tres decisiones de diseño, tomadas a propósito y no por accidente:
- Temperature baja (0.2), no cero. Buscamos que el juez sea consistente —que no cambie de opinión de una llamada a otra sobre la misma respuesta—, sin dejarlo tan rígido que suene robótico en la explicación.
- Formato de texto fijo, no JSON. Los modelos pequeños como los que corren en LM Studio en un portátil de instituto a veces rompen el JSON a medio generar. Pedir tres líneas con una etiqueta al principio es más fácil de seguir para el modelo, y el servidor las interpreta (“parsea”) él solo — si el modelo se sale del formato alguna vez, la respuesta completa se muestra igualmente en la explicación, en vez de fallar en silencio.
- Preguntas de sí/no/más o menos, no una nota numérica. Es una elección deliberadamente distinta a la que se usa en producción industrial (donde sí se ven escalas de 1 a 5): para el aula, una escala verbal es más clara y evita la falsa sensación de precisión de un número que, en realidad, puede variar de una ejecución a otra.

El nombre: Deborah Raji
Este proyecto lleva el nombre de Inioluwa Deborah Raji, informática nigeriano-canadiense conocida por su trabajo en auditoría de sistemas de inteligencia artificial. Junto con Joy Buolamwini participó en el proyecto Gender Shades, que evaluó públicamente el sesgo racial y de género en sistemas comerciales de reconocimiento facial de IBM, Microsoft y Face++. Más tarde, trabajando con el equipo de IA ética de Google liderado por Margaret Mitchell, ayudó a desarrollar un marco de documentación para que los equipos de aprendizaje automático dejaran constancia de las decisiones tomadas al construir un modelo, algo que hasta entonces no era una práctica estándar en la ingeniería de sistemas de IA. Fue reconocida en la lista TIME 100 más influyentes en IA.
Ninguna de las dos cosas que hace Raji en su trabajo real —auditar sistemas de IA y documentar cómo se evalúan— es exactamente lo que hace RAJI. Pero el espíritu es el mismo: no fiarte de una IA a ciegas, sino poder ver, con pruebas delante, por qué se ha llegado a una conclusión.
Qué sigue
Con el servidor ya montado y respondiendo, la siguiente entrada de esta pareja se dedica por completo a probarlo: casos donde el juez acierta claramente, casos límite donde “Más o menos” es la respuesta más honesta, y qué pasa cuando le pedimos que juzgue la misma pregunta y respuesta varias veces seguidas —la prueba de consistencia que, como profesores, más nos interesa antes de confiar en esto delante de una clase.
RAJI forma parte de la misma familia de proyectos que PINSAPIA, METIS, Biotopo, Contagio, Arsenia, Bermeja, Vaucanson, Laberinto, Rosenblatt y HAIBT — todos gratuitos, sencillos, modulares y pensados para el aula.



