
METIS 6: la encuesta tiene dueño
Para el profesorado, en tres líneas
Actividad de 1º de ESO, y la más simple de toda la serie. En METIS no cambia ni una línea de código.
Los dos archivos tienen solo columnas de palabras: ni un número que promediar. Hace falta un solo tipo de gráfica, el recuento, y todo lo demás se cuenta con el dedo. Ocho filas y veinte.
Y una cosa que no estaba en las actividades anteriores: aquí el sesgo tiene un culpable y un motivo. No es un descuido ni un efecto estadístico: alguien gana dinero si el número sale así. Eso es lo que hace que los alumnos se lo tomen en serio.
¿Por qué iba alguien a hacer trampas con unos datos?
Esta es la pregunta que hay que contestar antes de tocar el ordenador.
Casi siempre, por una de estas cuatro razones:
- Porque quiere venderte algo. Si el número sale bien, vende.
- Porque quiere que le den permiso o dinero para hacer algo.
- Porque quiere tener razón en una discusión y ya ha decidido la respuesta antes de mirar.
- Y muchas veces, sin mala intención ninguna: porque preguntar donde es fácil es más cómodo que preguntar bien. Los datos salen torcidos igual.
Quédate con esto:
Cuando veas un número que le conviene mucho a quien lo publica, desconfía.
No significa que sea mentira. Significa que hay que mirarlo.
El caso: la máquina del vestíbulo
El instituto va a poner una máquina de bebidas y hay que decidir qué se vende: zumos o bebidas energéticas.
La empresa de bebidas energéticas hace una encuesta y publica esto:
«El 75 % del instituto prefiere bebidas energéticas»
Suena a que está clarísimo. Vamos a mirarlo.
(Aviso: las 20 personas de estos archivos no existen. Me las he inventado yo. No hay nombres ni datos de nadie.)
PASO 1 — Abre lo que publicó la empresa
Arrastra encuesta_empresa.csv a METIS.
Tiene 8 filas y 2 columnas: persona y prefiere. Está limpio, sin huecos. Pulsa Limpiar sin cambiar nada.
Baja a Dibujar y comparar:
| Control | Qué eliges |
|---|---|
| Tipo de gráfica | Recuento por grupo (barras) |
| Eje horizontal (X) | prefiere |
Sale:
- energética: 6 (el 75 %)
- zumo: 2 (el 25 %)
El 75 % es verdad. La cuenta está bien hecha. Y METIS te suelta dos avisos:
Los dos grupos son muy desiguales: ‘energética’ tiene 6 casos (75.0 %) y ‘zumo’ tiene 2 (25.0 %), 3.0 veces menos…
Hay categorías con menos de 5 casos: ‘zumo’ (2). Cualquier media o porcentaje calculado sobre tan pocos casos se mueve muchísimo si cambia uno solo.
PASO 2 — Mira el número, no el porcentaje
Ese segundo aviso es el primer truco al descubierto. ¿A cuánta gente se preguntó?
A ocho personas.
Haz la cuenta: si una sola de esas ocho cambiara de opinión, serían 5 de 8. Eso es el 62,5 %. Una persona, doce puntos y medio.
Un instituto tiene cientos de alumnos. Ocho personas no son el instituto.
Y fíjate en la trampa del lenguaje: «el 75 %» suena a muchísima gente. «Seis personas» no suena a nada. Es el mismo dato.
PASO 3 — Ahora la encuesta que hizo el instituto
Arrastra encuesta_instituto.csv. 20 filas y 3 columnas: persona, prefiere y una nueva, donde_se_pregunto.
Dibuja otra vez el recuento de prefiere:
- zumo: 11 (el 55 %)
- energética: 9 (el 45 %)
- Ningún aviso.
Para. Esto no es «gana el zumo». Esto es más interesante:
Está casi empatado. Once contra nueve. Y a eso la empresa le puso el titular de un 75 % arrasador.
El sesgo no le dio la vuelta al resultado. Lo exageró hasta que dejó de parecerse a la verdad.
Eso es lo normal, y es lo difícil de pillar: casi nadie te dice lo contrario de lo que pasa. Te dicen lo que pasa, pero mucho más fuerte.
PASO 4 — ¿Dónde se preguntó?
Esa columna nueva es la clave. Dibuja el recuento de donde_se_pregunto:
- entrenamiento: 8 (40 %)
- patio: 7 (35 %)
- biblioteca: 5 (25 %)
El instituto preguntó en tres sitios distintos. Ahora la pregunta buena: ¿qué contestaron en cada sitio?
Eso METIS no lo puede dibujar, porque no sabe cruzar dos columnas de palabras. Da igual: son 20 filas. Aquí está la tabla entera.
persona | prefiere | donde_se_pregunto |
|---|---|---|
| P01 | energética | entrenamiento |
| P02 | zumo | patio |
| P03 | zumo | biblioteca |
| P04 | energética | entrenamiento |
| P05 | zumo | patio |
| P06 | zumo | patio |
| P07 | energética | patio |
| P08 | energética | entrenamiento |
| P09 | zumo | entrenamiento |
| P10 | zumo | biblioteca |
| P11 | energética | entrenamiento |
| P12 | zumo | patio |
| P13 | energética | biblioteca |
| P14 | zumo | entrenamiento |
| P15 | energética | entrenamiento |
| P16 | zumo | biblioteca |
| P17 | energética | patio |
| P18 | zumo | patio |
| P19 | energética | entrenamiento |
| P20 | zumo | biblioteca |
Coge un lápiz y cuenta:
| Dónde | Cuántos | Energética | Zumo |
|---|---|---|---|
| entrenamiento | 8 | ||
| patio | 7 | ||
| biblioteca | 5 |
Las respuestas, cuando hayas acabado:
- entrenamiento: 6 energética, 2 zumo
- patio: 2 energética, 5 zumo
- biblioteca: 1 energética, 4 zumo
En el entrenamiento gana la energética. En los otros dos sitios gana el zumo, y bastante.
PASO 5 — Pilla a la empresa
Vuelve al archivo de la empresa. Estas eran sus 8 personas:
persona | prefiere |
|---|---|
| P01 | energética |
| P04 | energética |
| P08 | energética |
| P09 | zumo |
| P11 | energética |
| P14 | zumo |
| P15 | energética |
| P19 | energética |
Ahora busca esos ocho códigos en la tabla grande y mira la columna donde_se_pregunto.
Los ocho son del entrenamiento. Los ocho. Sin una excepción.
La empresa preguntó en el sitio donde estaba la gente que acababa de hacer deporte. Ahí, claro, gana la bebida energética.
Y esto es lo que tienes que entender bien, porque es lo más importante de la actividad:
La empresa no inventó ni un dato.
Las ocho respuestas son ciertas y están copiadas tal cual. No borró a nadie. No cambió ni una palabra.
Lo único que hizo fue elegir dónde preguntar. Y luego no contarlo.
No hace falta mentir para engañar con datos. Con elegir vale.
Cómo te engañaron: tres trucos
Ponles nombre, porque los vas a volver a ver:
1. Elegir dónde preguntas. Si preguntas en el entrenamiento, sale la energética. Si preguntas en la biblioteca, sale el zumo. El sitio decide la respuesta, y quien elige el sitio elige el resultado.
2. Preguntar a poca gente. Con 8 personas, una persona vale 12,5 puntos de porcentaje. Cuanta menos gente, más fácil es que salga lo que tú quieres.
3. Dar el porcentaje y esconder cuánta gente hay. «El 75 %» y «6 de 8 personas» son lo mismo. Uno impresiona y el otro no.
Qué hacer para no creérselo
Estas cinco preguntas van al cuaderno. Sirven para cualquier gráfica, cualquier titular y cualquier vídeo que te diga que el 90 % de algo.
- ¿A cuánta gente se preguntó? Busca el número de personas, no el porcentaje. Si no lo dicen, ya sabes algo.
- ¿Dónde y a quién se preguntó? Si no lo dicen, tampoco es casualidad.
- ¿Quién gana si sale ese resultado? ¿Quién pagó la encuesta?
- ¿Falta alguien que debería estar? ¿Quién no aparece en estos datos?
- ¿Puedo ver los datos, o solo la gráfica? Si solo te dejan ver el dibujo, no puedes comprobar nada.
Y la pregunta que resume las cinco, la que tienes que aprender a hacer siempre:
¿Quién no está en estos datos?
La columna que no estaba
Última cosa. Vuelve a mirar las columnas del archivo de la empresa:
persona, prefiere
donde_se_pregunto no está.
Y es exactamente la columna que la delataba. No es un olvido: es la trampa. Quien publica un porcentaje no publica dónde preguntó.
Los datos que engañan casi nunca traen dentro la prueba de que engañan.
Con el archivo de la empresa en la mano, y por bien que lo limpiaras, no había forma de pillar el truco. Hacía falta el otro archivo.
Cuando faltan datos de un grupo y por eso las cuentas salen torcidas, se dice que los datos están sesgados. Ya tienes la palabra, y ya tienes las cinco preguntas.
La tabla, dentro del programa
Estas son las 20 personas tal cual están escritas en generar_encuesta_maquina.py. No hay ninguna operación ni ningún número aleatorio: están puestas una por una. Es la parte que te da derecho a desconfiar de mí, y por eso está aquí.
# La tabla, escrita a mano. Cada fila es:
# (persona, prefiere, donde_se_pregunto)
#
# El orden esta mezclado a proposito: si viniera ordenado por lugar, la
# trampa se veria de un vistazo y no habria nada que buscar.
ENCUESTA = [
("P01", "energética", "entrenamiento"),
("P02", "zumo", "patio"),
("P03", "zumo", "biblioteca"),
("P04", "energética", "entrenamiento"),
("P05", "zumo", "patio"),
("P06", "zumo", "patio"),
("P07", "energética", "patio"),
("P08", "energética", "entrenamiento"),
("P09", "zumo", "entrenamiento"),
("P10", "zumo", "biblioteca"),
("P11", "energética", "entrenamiento"),
("P12", "zumo", "patio"),
("P13", "energética", "biblioteca"),
("P14", "zumo", "entrenamiento"),
("P15", "energética", "entrenamiento"),
("P16", "zumo", "biblioteca"),
("P17", "energética", "patio"),
("P18", "zumo", "patio"),
("P19", "energética", "entrenamiento"),
("P20", "zumo", "biblioteca"),
]
Y así se fabrica el archivo de la empresa. Son cuatro líneas, y lo importante está en el comentario:
def filas_empresa(instituto):
"""Lo que publica la empresa: solo el sitio que le conviene, y sin la
columna que dice cual era ese sitio.
Fijate en que no se inventa ni un dato y no se borra ninguna respuesta:
las 8 filas son ciertas y estan copiadas tal cual. Lo unico que se hace
es ELEGIR DONDE PREGUNTAR y luego NO CONTARLO. Con eso basta."""
return [
{"persona": fila["persona"], "prefiere": fila["prefiere"]}
for fila in instituto
if fila["donde_se_pregunto"] == LUGAR_DE_LA_TRAMPA
]
Para volver a generar los dos archivos:
python generar_encuesta_maquina.py
Salen siempre idénticos, porque no hay azar en ninguna parte. Antes de escribir nada, el programa comprueba que la actividad se cumple —que en el instituto está casi empatado, que lo publicado es exactamente el 75 %, que las ocho personas de la empresa son las ocho del entrenamiento y que su archivo no incluye la columna que lo delata— y si algún día alguien cambia una fila y rompe el ejercicio, se para y dice por qué.



