← Últimos artículos
💬 NLP

BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation

Este artículo presenta un nuevo benchmark y una herramienta de mitigación llamada clibib para evaluar y reducir las alucinaciones en las citas BibTeX generadas por agentes de IA con búsqueda web, demostrando que una integración en dos etapas que separa la búsqueda de la revisión mejora significativamente la precisión y la integridad de las referencias científicas.

Autores originales: Delip Rao, Chris Callison-Burch

Publicado 2026-04-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Delip Rao, Chris Callison-Burch

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un estudiante brillante que está escribiendo su tesis doctoral. Para que tu trabajo sea serio, necesitas citar a los grandes expertos: autores famosos, libros clásicos y artículos recientes.

Antiguamente, tenías que ir a la biblioteca, buscar los libros y copiar los datos a mano. Hoy, tienes un asistente de inteligencia artificial (IA) súper rápido. Le dices: "Oye, necesito la referencia del artículo sobre inteligencia artificial que escribió tal persona hace dos años".

El problema es que este asistente, aunque es muy inteligente y tiene acceso a internet, a veces alucina. Es como si tuviera una memoria muy buena pero un poco confusa, y a veces inventa detalles o mezcla cosas.

Este paper (documento de investigación) es como un examen de realidad para ver qué tan bien funcionan estos asistentes cuando les pedimos citas bibliográficas, y cómo podemos arreglar sus errores.

Aquí te explico los puntos clave con analogías sencillas:

1. El Problema: El Asistente "Confiado pero Inexacto"

Los autores probaron a los tres asistentes de IA más avanzados del mundo (GPT-5, Claude y Gemini). Les pidieron que buscaran 931 artículos científicos reales.

  • La sorpresa: Aunque los asistentes tienen acceso a internet (como tener un navegador abierto), siguen cometiendo errores.
  • La analogía: Imagina que le pides a un chef experto que te describa un plato que ha cocinado mil veces (un artículo famoso). Lo hace perfecto. Pero si le pides un plato que salió ayer y que nunca ha probado, empieza a inventar ingredientes.
  • El resultado: Solo la mitad de las citas que generaron eran 100% correctas. El resto tenían errores: ponían el año equivocado, el nombre de la revista incorrecto, o incluso inventaban un número de página que no existía.
  • El error más grave: A veces, el asistente no solo se equivoca en un detalle, sino que cambia de libro por completo. Te da la portada de un libro de cocina, pero te dice que es un libro de física. Esto pasa cuando el asistente busca un artículo desconocido y, en lugar de copiar los datos, "adivina" basándose en lo que recuerda de otros libros similares.

2. La Prueba: ¿Memoria o Búsqueda?

Los investigadores dividieron los artículos en tres grupos para ver cómo reaccionaban los asistentes:

  1. Los Famosos: Artículos muy conocidos (como "Harry Potter" en el mundo de la literatura).
  2. Los Olvidados: Artículos poco citados.
  3. Los Nuevos: Artículos publicados ayer (después de que la IA dejó de aprender cosas nuevas).

Lo que descubrieron:

  • Con los famosos, la IA es excelente porque los tiene guardados en su "memoria interna".
  • Con los nuevos, la IA se cae de la silla. Aunque tiene el navegador abierto, a veces no sabe cómo leer la información correctamente o se confunde. Es como si le dieras un mapa nuevo a alguien que solo conoce su barrio; se pierde aunque tenga el mapa.

3. La Solución: El "Inspector de Pasaportes" (La herramienta clibib)

Los autores se dieron cuenta de que el problema no es que la IA sea tonta, sino que confía demasiado en su propia imaginación cuando busca datos.

Para arreglarlo, crearon una herramienta llamada clibib.

  • La analogía: Imagina que el asistente de IA es un viajero que te trae un pasaporte (la cita). A veces, el viajero dibuja el pasaporte él mismo y pone datos falsos.
  • La herramienta clibib es como un oficial de aduanas estricto. No confía en lo que dice el viajero. Va directamente a la base de datos oficial del gobierno (las editoriales científicas), busca el pasaporte original y lo compara con lo que trajo el viajero.
  • Si el viajero dijo "Año 2020" pero el pasaporte oficial dice "2021", el oficial lo corrige.

4. El Resultado: Dos Maneras de Trabajar

Los investigadores probaron dos formas de usar a este "oficial de aduanas":

  • Opción A (El viaje en solitario): Le dices al asistente: "Busca en internet y usa la herramienta oficial si tienes dudas".
    • Resultado: Mejora un poco, pero el asistente a veces ignora la herramienta o la usa mal.
  • Opción B (El equipo de dos pasos):
    1. El asistente hace su búsqueda y te da su borrador.
    2. Paso 2: Tú (o un programa) tomas ese borrador, lo llevas al "oficial de aduanas" (clibib), obtienes la versión oficial y se lo devuelves al asistente diciendo: "Mira, aquí está la versión correcta. Por favor, reescribe tu cita usando estos datos exactos".
    • Resultado: ¡Milagro! La precisión sube del 50% al 78%. Los errores casi desaparecen.

5. La Lección Principal

El mensaje de este paper es muy claro para cualquiera que use IA:

No confíes ciegamente en la IA para cosas que requieren precisión absoluta (como citas, leyes o recetas médicas).

La IA es genial para escribir ideas, pero cuando se trata de datos duros (nombres, fechas, números), tiende a "alucinar". La mejor forma de usarla es como un boceto: deja que la IA haga el trabajo sucio, pero siempre pasa los datos finales por un verificador automático (como clibib) o un humano antes de publicar.

En resumen:
La IA es como un estudiante muy listo que a veces se inventa las respuestas cuando no está seguro. Si le pones un "profesor corrector" (una base de datos oficial) que revise su trabajo al final, deja de inventar y empieza a ser fiable. Pero si le dejas hacer todo solo, terminará citando libros que no existen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →