
Evitando alucinaciones: cómo conseguir que Claude reconozca lo que no sabe
En esta sesión de vídeo nos hemos adentrado en uno de los capítulos más importantes de todo el tutorial de ingeniería de prompts de Anthropic: cómo evitar que Claude alucine, es decir, que genere respuestas que suenan convincentes y con aspecto de dato real, pero que en realidad son inventadas.
El primer ejemplo es deliberadamente sencillo: "¿quién es el hipopótamo más pesado de la historia?". Se trata de una pregunta sin un registro fiable y ampliamente documentado detrás. Sin embargo, cuando se la formulamos a Claude de forma directa, tiende a responder con un nombre concreto, un zoológico concreto y un peso exacto, con toda la seguridad de quien está citando un dato verificado. Es el patrón clásico de la alucinación: ante una pregunta que exige una respuesta específica, el modelo prioriza sonar útil y decisivo sobre admitir que no dispone de esa información con certeza. La solución, en este caso, es sorprendentemente sencilla: basta con añadir al final del prompt una frase como "solo responde si conoces la respuesta con certeza" para que Claude cambie de comportamiento y reconozca abiertamente la incertidumbre, en lugar de inventar un dato plausible. Esto demuestra que muchas alucinaciones no ocurren porque el modelo "no sepa" que algo es dudoso, sino porque el propio prompt le exige implícitamente una respuesta categórica.
El segundo bloque del vídeo eleva la dificultad con un caso mucho más realista y peligroso: el informe 10-K que Matterport presentó ante la SEC (el regulador bursátil estadounidense), un documento extenso y totalmente real. Le pedimos a Claude que dijera cuántos suscriptores tenía la empresa exactamente el 31 de mayo de 2020, y le dimos el documento completo para que basara su respuesta en él. El problema es que el documento solo ofrece cifras de suscriptores a fecha de cierre de ejercicio -- 31 de diciembre de 2018, 2021 y 2022 -- y nunca menciona el 31 de mayo de 2020. Aun así, cuando le pedimos a Claude directamente un número dentro de unas etiquetas de respuesta, tiende a interpolar una cifra aproximada a partir de las tasas de crecimiento mencionadas, presentándola como si fuera un dato razonable, cuando en realidad es una estimación no verificada. Este caso es más delicado que el del hipopótamo precisamente porque hay un documento real de por medio: eso puede hacer que la respuesta suene mucho más fiable de lo que en realidad es.
La solución que probamos a continuación introduce un paso intermedio muy simple pero muy eficaz: antes de escribir la respuesta numérica, pedimos a Claude que extraiga literalmente, en unas etiquetas de cita, el fragmento del documento más relevante para la pregunta, y que valore explícitamente si esa cita responde de verdad a lo que se pregunta o si le falta detalle suficiente. Al obligarle a mostrar la evidencia textual exacta antes de comprometerse con un número, resulta mucho más difícil disfrazar una extrapolación como si fuera un hecho documentado. Con este cambio, Claude identifica que el documento solo cubre fechas de diciembre, reconoce que no hay ningún dato para el 31 de mayo de 2020, y lo declara con honestidad en lugar de rellenar el hueco.
La lección de fondo que conecta ambos ejemplos es que la honestidad ante la incertidumbre no surge por defecto: hay que pedirla explícitamente, ya sea dando permiso directo para decir "no lo sé", ya sea exigiendo evidencia textual verificable antes de cualquier conclusión. Esta segunda técnica -- pedir la cita antes que la respuesta -- es especialmente valiosa cuando se trabaja con documentos reales, porque convierte la falta de evidencia en algo visible tanto para el modelo como para quien lee la respuesta después.
Aplicado al día a día en el sector de la ingeniería civil, esta técnica tiene un valor enorme cuando se usa Claude para consultar informes técnicos, normativas o documentación de proyecto: pedirle siempre que cite el fragmento exacto en el que basa su respuesta, antes de dar una conclusión, es una salvaguarda sencilla frente a datos inventados que podrían pasar desapercibidos si simplemente se acepta la respuesta final sin más.
Para practicar hoy: coja un prompt donde le pida a Claude un dato concreto a partir de un documento largo, y añada un paso previo obligatorio en el que deba citar textualmente el fragmento que respalda su respuesta antes de darla. Compruebe si eso cambia la fiabilidad de lo que obtiene.
Próxima lección del curso: seguiremos avanzando en el tutorial interactivo de Anthropic sobre ingeniería de prompts.




