
RAJI (2/2): ponemos a prueba al juez
En la entrada anterior dejamos RAJI montado y respondiendo en http://localhost:8045. Tener el servidor arrancado no es lo mismo que confiar en él delante de una clase — así que esta entrada es una guía de pruebas, no una demostración de que “funciona”: queremos que cada profesor la repita con su propio LM Studio antes de usarlo con alumnado real, porque el juez que corre en tu ordenador puede comportarse distinto al de otro modelo o de otra máquina.
[ENLACE AL REPOSITORIO DE GITHUB]
Antes de empezar: qué estamos comprobando
Tres cosas, y solo tres:
- ¿Acierta en los casos claros? Si una respuesta está claramente bien o claramente mal, el juez tiene que verlo.
- ¿Sabe decir “no lo tengo claro”? Un juez que solo dice Sí o No, nunca “Más o menos”, es sospechoso — la vida real está llena de respuestas a medias.
- ¿Es consistente? Si le das la misma pregunta y la misma respuesta dos veces, ¿dice lo mismo las dos veces? Esta es, con diferencia, la prueba más importante antes de fiarte de él en el aula.
Caso 1 — una respuesta claramente correcta
Asignatura: Biología
Pregunta: ¿Por qué las plantas son verdes?
Respuesta: Las plantas son verdes porque tienen clorofila, un pigmento
que absorbe la luz roja y azul pero refleja la luz verde, que es la
que vemos.
Esperamos: CORRECTA: Sí, CLARA: Sí, y una explicación que mencione la clorofila o la reflexión de la luz. Si tu juez responde esto, la instalación funciona correctamente — es el caso más fácil, y sirve como “prueba de humo” antes de complicarse con los otros dos.
Caso 2 — una respuesta claramente incorrecta
Asignatura: Biología
Pregunta: ¿Por qué las plantas son verdes?
Respuesta: Las plantas son verdes porque el sol las tiñe de ese color
cuando las toca por la mañana.
Esperamos: CORRECTA: No, y una explicación que señale que la respuesta no menciona la clorofila ni el mecanismo real. Aquí es donde conviene mirar el panel de metadatos: si la explicación del juez es vaga (“no es del todo correcta”) en vez de señalar el error concreto, prueba a hacer la pregunta más específica o a cambiar de modelo en LM Studio — un modelo demasiado pequeño puede detectar que algo falla sin saber explicar por qué.
Caso 3 — el caso ambiguo, el que de verdad importa
Asignatura: Biología
Pregunta: ¿Por qué las plantas son verdes?
Respuesta: Por la clorofila.
Aquí no hay una respuesta “correcta” única esperada, y es justo lo interesante: es correcta pero incompleta. Un juez que se limita a Sí/No fallará aquí — o la aprueba entera (premiando lo mínimo) o la suspende entera (penalizando de más una respuesta que va en la dirección correcta). Lo que buscamos es “Más o menos”, con una explicación que diga algo como “menciona la causa correcta pero no explica el mecanismo”. Si tu juez nunca usa “Más o menos” en ningún caso de prueba, es una señal de que el prompt necesita más ejemplos de por medio (esto es justo lo que los libros de referencia del proyecto llaman few-shot: mostrarle al juez ejemplos de qué es una respuesta a medias antes de pedirle que juzgue una nueva).

La prueba de consistencia (la que no te puedes saltar)
Coge el Caso 1 tal cual y pulsa “Corregir con el juez de IA” cinco veces seguidas, sin cambiar nada. Anota lo que dice cada vez en CORRECTA y CLARA.
- Si las cinco veces coincide → tu juez es consistente con temperature 0.2. Perfecto, puedes usarlo en clase con confianza.
- Si cambia alguna vez (por ejemplo, pasa de Sí a Más o menos sin que cambie nada en la pregunta) → no es un fallo del código, es el comportamiento probabilístico normal de un modelo de lenguaje. Dos formas de mejorarlo, de menor a mayor cambio:
- Baja
temperatureenmain.pyde 0.2 a 0.1 o incluso 0.0 — hace al modelo más determinista, aunque las explicaciones sonarán algo más rígidas. - Si tu versión de LM Studio permite fijar una
seed, añádela a la llamada — con la misma seed y la misma temperature, dos llamadas idénticas deberían dar resultados mucho más parecidos.
- Baja
Esta comprobación es, en realidad, la lección más importante que se puede sacar de RAJI para explicar en clase: ni el juez de IA es infalible, ni tiene por qué serlo siempre para ser útil — lo que necesitamos es saber cuánto se puede fiar uno de él, no fingir que es perfecto.
Una actividad para el aula
Una vez comprobados los tres casos y la consistencia, una forma sencilla de usar RAJI con el grupo: cada alumno escribe su propia respuesta a la misma pregunta (sin mirar la de los compañeros), se corrige con el juez, y luego se comenta en voz alta si el veredicto del juez coincide con lo que el profesor habría dicho. Cuando no coincide, esa discrepancia es el punto de partida perfecto para hablar de qué significa realmente “evaluar” — con o sin IA de por medio.
Qué revisar si algo no cuadra
- El servidor no arranca: comprueba que LM Studio está corriendo y respondiendo en
http://localhost:1234antes de lanzaruvicorn. - El juez tarda mucho: normal en la primera llamada (el modelo se carga en memoria); las siguientes deberían ser más rápidas. El tiempo se ve en el panel de resultado.
- La explicación viene vacía o rara: mira el panel de metadatos — si
sin_parsearaparece como verdadero en la respuesta bruta, el modelo no ha seguido el formato de las tres líneas. Prueba con un modelo algo más grande o revisa el prompt.
RAJI forma parte de la misma familia de proyectos que PINSAPIA, METIS, Biotopo, Contagio, Arsenia, Bermeja, Vaucanson, Laberinto, Rosenblatt y HAIBT — todos gratuitos, sencillos, modulares y pensados para el aula.



