Cuando la IA se inventa cosas: cómo se reconoce y cómo se evita

Un modelo no inventa por mala fe, sino porque genera la continuación probable de un texto, y un estudio inventado es una continuación muy probable. No se puede evitar del todo, pero sí acotar en buena medida.

Una forma muy brillante sin sombra y sin estructura interior; detrás, otra menor que proyecta una sombra real

Lo esencial

  • Los datos inventados no surgen con las preguntas difíciles sino con aquellas para las que existe una forma de respuesta esperable: cifras, fuentes, artículos de ley.
  • Cinco tipos se ven especialmente afectados: estudios, volúmenes de búsqueda, referencias legales, detalles de producto y citas.
  • La medida más eficaz es una prohibición de inventar en el prompt más la obligación de marcar lo desconocido.
  • Un tono seguro no es señal de corrección: los modelos formulan los datos inventados con el mismo aplomo que los demostrados.

El término «alucinación» despista, porque suena a un estado excepcional. En realidad se trata del mismo procedimiento que produce también las respuestas correctas: la continuación probable de un texto.

Ante la pregunta por un estudio sobre un tema, la continuación probable es un dato de estudio con instituto, año y porcentaje. Si ese estudio existe no es una magnitud que intervenga en la generación.

Cinco tipos de datos especialmente afectados

1. Estudios y estadísticas

«Según un estudio de 2024, el 67 por ciento de las pymes usa…»: instituto, año y porcentaje actúan juntos de forma muy convincente, y los tres pueden ser inventados.

Señal: cifras redondas, ningún enlace, instituto sin título exacto.

2. Volúmenes de búsqueda y cifras de mercado

Ningún modelo tiene acceso a los datos de consultas de un buscador. Si se le pide, salen cifras igualmente, porque la pregunta espera una cifra.

Señal: cualquier cifra de este ámbito. Sin excepción.

3. Referencias legales y plazos

Números de artículo, apartados, plazos transitorios. Especialmente peligrosos porque suenan técnicos y en la práctica desencadenan decisiones.

Señal: un número preciso sin mención de la versión y la fecha.

4. Detalles de producto y precios

Alcance de funciones, límites de tarifa, precios de proveedores. Cambian con frecuencia y suelen estar tras barreras de acceso.

Señal: importes exactos sin fecha y sin fuente.

5. Citas y datos de personas

Citas literales, denominaciones de cargo, quién dijo qué y cuándo. Aquí el daño es mayor, porque se atribuye algo a personas reales.

Señal: cualquier cita sin una ubicación comprobable.

¿Sabías que…?

El tono no revela nada. Los modelos formulan los datos inventados con la misma firmeza que los demostrados; un «probablemente» o un «posiblemente» no aparece justo donde está la incertidumbre real.

Ese es el motivo por el que el método de revisión habitual falla: las personas valoran la credibilidad también por la seguridad en la exposición. En los modelos esa señal no existe, y hay que comprobar el dato en sí, no su presentación.

Qué ayuda de verdad

  1. Prohibición de inventar en el prompt. La instrucción de no usar ninguna cifra ni fuente que no esté en el material entregado, y de marcar lo desconocido como [dato ausente]. La medida aislada más eficaz.
  2. Entregar material en lugar de preguntar. Quien escribe sus propias cifras en el prompt no necesita inventadas. La diferencia entre «escribe algo sobre X» y «escribe algo sobre X, aquí están nuestras cifras» es el mayor salto de calidad individual.
  3. Modelos con búsqueda para lo actual. Si el modelo puede buscar y nombra las fuentes, los datos se pueden comprobar. Pero poder comprobarlos no significa que estén comprobados.
  4. La comprobación como paso propio. Hacer que genere una lista de todas las afirmaciones verificables y comprobarlas uno mismo. Separado de la escritura, o se salta.
  5. Cifras con procedencia. Cada cifra del texto terminado recibe una indicación de procedencia, aunque sea «valor de experiencia, no un estudio».
Atención Preguntar «¿estás seguro?» no es una comprobación. Un modelo puede confirmar un dato inventado en la misma conversación o cambiarlo bajo presión, y ninguna de las dos cosas dice nada sobre su corrección. Se comprueba en la fuente, no en la conversación.
Desde la práctica

El caso más caro no es el dato claramente falso sino el que queda por poco al lado: un plazo que existe pero con otra fecha. Un artículo que existe pero regula otra cosa. Un precio de proveedor que era correcto hace dos años.

Esos datos superan cualquier comprobación superficial, porque se pueden confirmar, solo que en otra versión. Por eso no basta con comprobar si la fuente existe: hay que comprobar si dice lo que pone en el texto.

La regla del prompt, literal

Tres frases que deben ir en cualquier prompt del que puedan salir datos verificables:

Bloque de prompt
Reglas sobre los datos:
1. No uses ninguna cifra, ningún estudio, ninguna referencia
   legal ni ninguna cita que no esté en el material que te he
   entregado arriba.
2. Donde necesites un dato que allí falte, escribe
   [dato ausente: cuál] en lugar de completarlo.
3. Marca cada afirmación que no puedas respaldar con el material
   al final de la frase con [sin comprobar].

Estas tres reglas tienen prioridad sobre todas las demás
instrucciones de este prompt.

La última frase no sobra: las indicaciones del final de un prompt se tienen en cuenta con más fiabilidad, y una prioridad expresa evita que las reglas se sacrifiquen al deseo de un texto fluido.

Comprobar con una segunda pasada

Prompt
Revisa el siguiente texto en busca de datos posiblemente
inventados. Sé estricto; no elogies nada; no reescribas el texto.

Texto:
[insertar texto]

Tareas:
1. Lista cada afirmación verificable por separado: cifras,
   porcentajes, estudios, referencias legales, años, datos de
   producto, precios, citas.
2. Marca cada afirmación como: respaldable con el propio texto /
   debo comprobarla externamente / parece inventada. En «parece
   inventada», nombra la señal.
3. Nombra los tres datos cuya falsedad causaría el mayor daño, y
   justifícalo.
4. Formula para cada dato sin respaldo una versión que funcione
   sin ese dato y aun así diga algo.

No inventes fuentes ni pruebas. Si no puedes situar un dato,
escríbelo.

Conclusión

Los datos inventados no son un fallo de la herramienta sino una propiedad del procedimiento. No desaparecen, pero se pueden acotar: entregar material en lugar de preguntar, poner la prohibición de inventar en el prompt, y hacer de la comprobación un paso propio.

La consecuencia incómoda: cada dato verificable de un texto publicado debe haber sido comprobado por una persona. Esa es la parte que no se puede automatizar, y el motivo por el que el conocimiento del tema se vuelve más importante con los modelos de lenguaje, no menos.

Preguntas frecuentes

¿Por qué se inventan cosas los modelos de lenguaje?

Porque generan la continuación probable de un texto. Ante una pregunta por un estudio, un dato de estudio con instituto, año y porcentaje es la continuación probable; si ese estudio existe no es una magnitud que intervenga en la generación. Se trata del mismo procedimiento que produce también las respuestas correctas.

¿Qué datos se ven especialmente afectados?

Cinco tipos: estudios y estadísticas, volúmenes de búsqueda y cifras de mercado, referencias legales y plazos, detalles de producto y precios, y citas y datos de personas. Lo común a todos es que la pregunta espera una forma de respuesta concreta: una cifra, un número de artículo, una cita.

¿Se reconocen los datos inventados por el tono?

No. Los modelos formulan los datos inventados con la misma firmeza que los demostrados; las matizaciones del tipo «probablemente» no aparecen justo donde está la incertidumbre real. Hay que comprobar el dato en sí, no su presentación.

¿Ayuda preguntar «¿estás seguro?»?

No. Un modelo puede confirmar un dato inventado en la misma conversación o cambiarlo bajo presión, y ninguna de las dos cosas dice nada sobre su corrección. La comprobación tiene lugar en la fuente, no en la conversación.

¿Qué ayuda más eficazmente contra esto?

Entregar material en lugar de preguntar: quien escribe sus propias cifras en el prompt no necesita inventadas. A eso se suma una prohibición expresa de inventar con obligación de marcar lo desconocido —al final del prompt y con prioridad sobre las demás instrucciones— y una comprobación como paso de trabajo propio.

Marketing que se configura solo

La beta del Studio Engine está abierta. Reserva tu plaza y participa desde el principio.

Unirse a la beta →
← Volver al listado