Desarrollos propios Soluciones Webs InfinyAI School Cómo trabajamos Blog Noticias Contacto Ver web 3D
Guías5 min de lectura

Por qué la IA se inventa datos (y cómo evitarlo)

La IA se inventa datos porque no sabe qué es verdad: un modelo de lenguaje como ChatGPT no busca la respuesta en ningún sitio, la construye palabra a palabra eligiendo cada vez la más probable. Cuando no tiene el dato, no se calla: escribe lo que suena más probable, con la misma seguridad con la que da un dato cierto. A eso se le llama alucinación. Y se evita dándole la fuente y pidiéndole que cite de dónde saca cada cosa. Si no puede citarlo, no lo sabe.

Logotipo de InfinyAI sobre fondo negro con el título «Por qué la IA se inventa datos»

Lo explicamos en poco más de medio minuto en este vídeo, y con más calma debajo.

Portada del vídeo: la inteligencia artificial no te miente, no sabe qué es verdad
Por qué la IA se inventa datos (y cómo evitarlo). El vídeo se carga desde YouTube al pulsar. Verlo en YouTube

Cómo escribe una IA

Un modelo de lenguaje ha aprendido, a partir de enormes cantidades de texto, qué palabras suelen ir detrás de otras. Cuando le preguntas algo, no consulta una base de datos ni abre un documento: calcula qué palabra encaja mejor después de la anterior, la escribe y repite.

En el vídeo lo enseñamos con un ejemplo sencillo. Si la frase es «La capital de Francia es», la palabra más probable es «París», con muchísima diferencia sobre cualquier otra. Ahí la probabilidad y la verdad coinciden, porque ese dato aparece una y otra vez en todo lo que el modelo ha leído.

Qué pasa cuando no tiene el dato

Ahora cambia la pregunta por algo que el modelo no puede saber: qué dice un artículo concreto de un reglamento, el precio de un producto tuyo, el horario de tu tienda. El mecanismo es el mismo. El modelo sigue buscando la palabra más probable, y la más probable casi nunca es «no lo sé». Es algo que suena bien, como «el plazo es de 30 días».

La respuesta sale con la misma seguridad, el mismo tono y el mismo formato que un dato cierto. Por eso engaña: no hay nada en el texto que te avise de que esa parte se la ha inventado.

Por qué pedirle que no se invente nada no funciona

La reacción natural es añadir al final de la petición «no te inventes nada». Ayuda poco. El modelo no tiene una lista interna de lo que sabe y lo que no. No puede comprobar si una frase suya es verdad, porque no tiene con qué compararla. Le estás pidiendo que distinga algo que no puede ver.

Cómo detectar un dato inventado

No hay una señal infalible, pero hay pistas que conviene mirar dos veces:

  • Cifras demasiado redondas o demasiado precisas sin decir de dónde salen.
  • Referencias muy concretas: el número de un artículo, el título de un estudio, el nombre de una norma. Son fáciles de inventar y fáciles de comprobar.
  • Datos que cambian con el tiempo, como precios, horarios o fechas, dados como si fueran fijos.

Si ves alguna, busca el dato en su fuente antes de usarlo.

Cómo se evita: la fuente y la cita

Lo que sí funciona es cambiar el trabajo que le pides. En vez de «respóndeme», pídele «respóndeme con esto».

  1. Dale la fuente. Pega el documento, la política, la ficha del producto o el texto del reglamento. Así la respuesta sale de algo real que tú controlas, no de lo que el modelo recuerda.
  2. Pídele que cite de dónde saca cada dato: el apartado, la frase o la página. Una cita se comprueba en un momento.
  3. Déjale decir «no lo sé». Dile de forma explícita que, si la respuesta no está en el texto que le das, lo diga así. Si no le das esa salida, rellenará el hueco.
  4. Comprueba lo que cambia. Precios, horarios, fechas y normas pueden haber cambiado desde que se entrenó el modelo: se miran siempre en la fuente original.

La regla corta es la del vídeo: si no puede citarlo, no lo sabe.

Petición con fuente y cita, para copiar
Responde solo con la información del texto que te pego debajo. Para cada dato que me des, indica de qué parte del texto sale. Si la respuesta no está en el texto, dime «no lo sé» y no la completes con lo que creas.

Texto:
[pega aquí el documento]

Pregunta:
[escribe aquí tu pregunta]

Qué significa para un negocio pequeño

En una conversación privada, un dato inventado es una molestia. Delante de un cliente es otra cosa. Si usas la IA para contestar mensajes, redactar fichas de producto, preparar presupuestos o atender en la web, una respuesta inventada sale con el nombre de tu negocio.

Por eso, en un chatbot o un asistente para una web, lo primero que cuidamos es de dónde saca las respuestas. El asistente de nuestra propia web responde solo con lo que dice la web y, si algo no está ahí, lo dice en vez de inventarlo. Es la misma idea de la fuente y la cita, llevada a un sistema que funciona solo.

Lo mismo vale para las automatizaciones con IA. Cuando un proceso usa un modelo para leer un correo o resumir un documento, hay que decidir qué datos puede usar, qué hace cuando le falta uno y qué pasa por una persona antes de salir.

Preguntas frecuentes

¿Qué es una alucinación de la IA?

Es una respuesta que el modelo presenta como cierta pero que se ha inventado. Pasa porque escribe la continuación más probable del texto, no la verdadera, y cuando no tiene el dato rellena el hueco con algo que suena bien.

¿Se puede conseguir que la IA no se invente nunca nada?

Del todo, no. Lo que sí se puede es reducirlo mucho y hacerlo visible: darle la fuente, pedirle que cite de dónde saca cada dato y permitirle decir «no lo sé». Así, lo que no tenga fuente se detecta enseguida.

¿Pasa con ChatGPT y con las demás IA?

Sí. Es una consecuencia de cómo funcionan los modelos de lenguaje, no de una marca concreta. Unos se equivocan más y otros menos, pero todos pueden inventar un dato si no se lo das.

¿Cómo sé si un chatbot se inventa las respuestas?

Pregúntale algo que no esté en la información de tu negocio y mira qué contesta. Si da una respuesta concreta en vez de decir que no lo sabe, se la está inventando.

Sigue leyendo