
Proyecto IA Monterroso (I): nuestro primer modelo de IA funcionando en un portátil de instituto
En el IES Monterroso hemos empezado a construir nuestra propia inteligencia artificial: IA Monterroso. El objetivo final es tener un asistente conversacional propio, útil para alumnado y profesorado, que más adelante pueda responder con información real del centro y conectarse con proyectos hechos por el propio alumnado (Technovation, TIC, Programación y Computación…).
Pero antes de pensar en nada grande, teníamos que responder a una pregunta muy poco glamurosa:
¿Podemos hacer que un modelo de IA funcione, aquí y ahora, en un ordenador normal de instituto?
Esta primera entrada cuenta cómo lo hemos conseguido, y sirve como tutorial para quien quiera replicarlo.
¿Por qué un modelo local y no ChatGPT directamente?
Podríamos usar servicios de IA en la nube (ChatGPT, Gemini, Claude…) mediante su API, y de hecho es una opción que valoraremos más adelante para ciertas tareas. Pero para este primer paso hemos elegido ejecutar un modelo en local, en nuestro propio ordenador, por tres motivos:
- Privacidad: nada de lo que se escriba sale del ordenador. Importante en un centro educativo, donde en el futuro podría haber datos de alumnado circulando por aquí.
- Coste cero: no dependemos de créditos de pago ni de límites de una API externa.
- Aprendizaje real: entender cómo funciona un modelo de IA “por dentro” (tamaño, cuantización, velocidad, límites de hardware) es parte del valor educativo del proyecto.
La herramienta elegida para esto es LM Studio: una aplicación gratuita, con interfaz gráfica, que permite descargar y ejecutar modelos de IA de código abierto directamente en tu ordenador, sin necesidad de terminal ni de saber programar.
El reto: hardware modesto, sin GPU
Aquí viene la parte honesta del proyecto. El portátil de pruebas (nombre en clave: ROCKY) tiene estas características:
- Procesador Intel Core 3 100U (gama baja)
- 16 GB de RAM
- Sin tarjeta gráfica dedicada — solo gráficos integrados Intel
Sin GPU dedicada, el modelo de IA se ejecuta enteramente sobre el procesador (CPU). Esto es un condicionante muy real: no todos los modelos de IA que se pueden descargar van a funcionar a una velocidad razonable en un equipo así. Modelos grandes y potentes pueden tardar minutos en responder a una sola pregunta.
La decisión, por tanto, no ha sido “¿cuál es el mejor modelo de IA disponible?”, sino:
¿Cuál es el modelo más pequeño que sigue respondiendo con calidad suficiente en español, y que responde en segundos y no en minutos en un equipo sin GPU?
Modelo elegido: Llama 3.2 3B Instruct (cuantización Q4_K_M)
Tras valorar las alternativas, el modelo elegido para este primer prototipo es Llama 3.2 3B Instruct, en su versión cuantizada Q4_K_M, en formato GGUF (el formato que usa LM Studio).
Dos conceptos rápidos, por si no son familiares:
- 3B significa “3 mil millones de parámetros”: es un modelo pequeño comparado con los grandes modelos comerciales, pero soporta español de forma oficial y tiene buen soporte de la comunidad.
- Cuantización (Q4_K_M): es una técnica que “comprime” el modelo reduciendo la precisión numérica de sus cálculos internos. Esto hace que el archivo pese menos y vaya más rápido, a cambio de una pérdida de calidad muy pequeña. Q4_K_M es un punto de equilibrio habitual entre velocidad y calidad.
El archivo resultante ocupa en torno a 2 GB, muy manejable para 16 GB de RAM.
Tutorial: instalación paso a paso
Paso 1 — Descargar e instalar LM Studio
⚠️ Ojo, aquí hay una trampa fácil. La empresa que hace LM Studio (Element Labs) ha lanzado recientemente otro producto llamado “LM Studio Bionic”: un agente de IA para trabajo y código, con documentos, automatizaciones, etc. En la página de descargas aparece justo encima del LM Studio clásico, y es muy fácil descargar el que no toca. No es lo que necesitamos para este proyecto.
- Ve a lmstudio.ai/download.
- En esa página verás dos botones de descarga muy parecidos:
- “Download Bionic for Windows” → NO es este.
- “Download LM Studio for Windows” (con un número de versión debajo, por ejemplo 0.4.21, y el texto “Experiment with LLMs on your computer. Chat interface and programmable API”) → este es el correcto.
- Instala la aplicación como cualquier otro programa (siguiente, siguiente, finalizar).
- Ábrela. La primera vez puede mostrarte una pantalla de bienvenida o sugerencias de modelos; puedes cerrarla sin problema. Si ves un menú lateral con “Chat”, “My Models” y “Discover”, vas bien; si ves algo sobre “Projects” o una mascota de personaje, te has metido en la app equivocada.
Paso 2 — Buscar el modelo
- En el menú lateral de LM Studio, busca el icono de búsqueda/descubrir modelos (normalmente una lupa).
- Escribe en el buscador:
Llama-3.2-3B-Instruct-GGUF - Aparecerán varias versiones del mismo modelo, diferenciadas por la cuantización (Q4, Q5, Q8, F16…).
- Elige la variante Q4_K_M. Evita las versiones Q8 o F16: pesan más y van más lentas en equipos sin GPU dedicada.
- Pulsa descargar y espera a que termine (el archivo pesa en torno a 2 GB).
Paso 3 — Cargar el modelo
- Ve a la sección de chat de LM Studio.
- En la parte superior, selecciona el modelo que acabas de descargar para cargarlo en memoria.
- Espera a que aparezca como cargado (puede tardar unos segundos).
Paso 4 — Hacer la primera pregunta
- Escribe cualquier pregunta en español en el cuadro de chat, por ejemplo: “Explícame qué es la fotosíntesis en dos frases”.
- Pulsa enviar y observa cómo responde.
Paso 5 — Comprobar el rendimiento real
Esto es importante: no basta con que responda, hay que medir si responde a una velocidad razonable. LM Studio muestra, debajo de cada respuesta, dos datos clave:
- Tokens por segundo (tok/s): cuanto más alto, más rápido genera texto.
- Tiempo hasta el primer token: cuánto tarda en empezar a responder.
Con estos números decidimos si el modelo es utilizable tal cual, o si hay que bajar a uno todavía más pequeño (por ejemplo, un modelo de 1B de parámetros).
Qué hemos conseguido con esto
De momento, esto no es todavía “IA Monterroso”. Es el primer eslabón de la cadena: la comprobación de que un modelo de IA puede ejecutarse de forma viable en el hardware real que tenemos disponible, sin depender de servicios externos de pago.
A partir de aquí, los siguientes pasos del proyecto serán:
- Exponer este modelo mediante una API sencilla.
- Conectar una interfaz básica de pregunta-respuesta.
- Ir añadiendo conocimiento propio del centro, memoria y, más adelante, integración con proyectos del alumnado.
Iremos contando cada paso en el blog, con lo que funciona y también con lo que no funciona — que en un proyecto real también forma parte del aprendizaje.
Una advertencia honesta: este modelo se equivoca
Durante las pruebas, le preguntamos al modelo por el lince y nos respondió con datos inventados: le atribuyó el nombre científico del zorro y lo describió como un cánido, cuando el lince es un felino. Lo dijo, además, con total seguridad, como si fuera un dato correcto.
Esto no es un fallo de instalación ni algo que vayamos a “arreglar” en este punto del proyecto. Es una limitación conocida y esperable en un modelo tan pequeño (3B parámetros): cuanto menor es el modelo, más tiende a rellenar huecos de conocimiento con respuestas plausibles pero falsas, en vez de admitir que no sabe algo. Y esto es todavía más frecuente en español, donde estos modelos pequeños tienen menos datos de entrenamiento que en inglés.
Lo importante es entender qué estamos probando en esta fase y qué no. Ahora mismo el objetivo no es tener una IA que responda siempre bien, sino comprobar que toda la infraestructura funciona: que un modelo se puede instalar, cargar y responder en un tiempo razonable en un ordenador de instituto sin GPU. Ese objetivo está conseguido, con sus fallos de calidad incluidos.
El plan es seguir construyendo sobre esta base (API, interfaz, conocimiento propio del centro) con este mismo modelo pequeño, sabiendo que fallará en preguntas de cultura general. Cuando toda esa infraestructura esté funcionando de forma sólida, el siguiente paso natural será conseguir un ordenador más potente que actúe como servidor y que permita usar un modelo más grande y más fiable, sin tener que rehacer nada de lo construido hasta entonces — esa es precisamente la ventaja de haber diseñado el sistema por piezas independientes.
José Luis Usero — Profesor de Informática, IES Monterroso (Estepona)




