← Últimos artículos
💻 computer science

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

Este artículo presenta CitizenQuery-UK, un novedoso conjunto de datos de referencia de 22.000 consultas ciudadanas generadas sintéticamente basadas en información del gobierno del Reino Unido, y evalúa 11 modelos de lenguaje de gran tamaño en cuanto a veracidad, abstención y verbosidad para resaltar los desafíos críticos de fiabilidad y la necesidad de reconocer la falibilidad de la IA en las aplicaciones del sector público.

Autores originales: Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres una persona común intentando comprender una regla gubernamental confusa, como por ejemplo cómo solicitar un beneficio o completar un formulario de impuestos. En el pasado, podrías haber llamado a un centro de atención o buscado en un sitio web del gobierno. Hoy, podrías preguntarle a un chatbot de IA superinteligente.

Este artículo trata sobre la creación de una "boleta de calificaciones" gigante para probar qué tan bien manejan estos chatbots de IA las preguntas específicas sobre las reglas del gobierno del Reino Unido. Los autores llaman a esta boleta de calificaciones CitizenQuery-UK.

Aquí está el desglose de lo que hicieron y lo que encontraron, utilizando analogías sencillas:

1. El Problema: La trampa del "Confía en mí"

Imagina que le pides consejo a una IA muy segura de sí misma y que habla rápido sobre tus impuestos. Te da una respuesta larga y detallada. Pero, ¿qué pasa si inventa una regla que no existe? En un chat normal, eso es solo un error gracioso. Pero con las reglas gubernamentales, un dato inventado podría costarte dinero, meterte en problemas con la ley o arruinar tu vida.

Los autores dicen: "No podemos simplemente confiar en la IA porque suene inteligente. Necesitamos pruebas de que está diciendo la verdad".

2. La Solución: Construir el "Examen" (El Conjunto de Datos)

Para probar a la IA, necesitas un examen. Pero no puedes simplemente inventar preguntas; tienen que ser reales.

  • La Fuente: Tomaron miles de páginas de gov.uk (el sitio web oficial del gobierno del Reino Unido), que es como la "biblia" de las reglas gubernamentales.
  • Las Preguntas: No se limitaron a escribir preguntas robóticas. Utilizaron ejemplos reales de personas pidiendo consejos en Reddit para que las preguntas sonaran como la forma en que los humanos reales hablan realmente (desordenadas, específicas y a veces confundidas).
  • Los Personajes: Crearon "personas" para las preguntas. Por ejemplo, una pregunta sobre la crianza de los hijos se asigna a una persona con el perfil de "padre", no de "hijo". Esto asegura que la IA sea probada sobre si entiende el contexto de la persona que pregunta.
  • El Resultado: Construyeron un conjunto de datos de 22,000 pares de pregunta-respuesta. Piensa en esto como un examen final masivo de 22,000 preguntas donde las "respuestas correctas" ya están escritas en el texto oficial del gobierno.

3. El Sistema de Calificación: Cómo Revisaron el Trabajo

No se limitaron a preguntar "¿La IA lo hizo bien?". Utilizaron un proceso de calificación de tres pasos para ser súper precisos:

  • Paso 1: La prueba del "Tratamiento de Silencio" (Abstención): ¿Dice la IA "no lo sé" cuando no está segura? ¿O simplemente adivina? Los autores querían ver si la IA era lo suficientemente valiente para admitir que no sabía, o si estaba demasiado ansiosa por hablar.
  • Paso 2: Descomposición (Atomización): Imagina que la IA escribe un párrafo largo. Los calificadores descompusieron ese párrafo en hechos individuales diminutos (como desarmar un castillo de Lego en piezas individuales).
  • Paso 3: La "Coincidencia de Verdad" (Verificación): Compararon cada uno de los "ladrillos" (hechos) que la IA mencionó contra los "ladrillos" en la respuesta oficial del gobierno.
    • La Puntuación (F1@K): Le dieron a la IA una puntuación basada en dos cosas: ¿Incluyó los hechos correctos? Y ¿incluyó solo los hechos correctos (sin añadir demasiado relleno extra)?

4. Los Resultados: Lo que dijo la Boleta de Calificaciones

Probaron 11 modelos de IA diferentes (como los de OpenAI, Google, Meta, etc.) y encontraron algunas cosas interesantes:

  • El Problema de la "Charlatanería": Casi todas las IA hablaban demasiado. Eran como un estudiante que, cuando se le hace una pregunta simple, escribe todo un ensayo. Añadían hechos extra que no estaban en el texto oficial del gobierno. Esto se llama verbosidad.
  • El Problema del "Silencio": Las IA casi nunca decían "no lo sé". Incluso cuando estaban equivocadas, seguían hablando. Rara vez se "abstuvieron" de responder.
  • La "Cola Larga" de Errores: La mayoría de las veces, las IA acertaban los puntos principales. Pero cuando se equivocaban, se equivocaban muchísimo. Es como un estudiante que saca una A en las preguntas fáciles, pero reprueba completamente las difíciles. Esto hace que los resultados sean impredecibles.
  • Abierto vs. Cerrado: Algunos de los modelos "abiertos" (donde el código es público) funcionaron tan bien como los "cerrados" que son costosos. No necesariamente necesitas la IA más cara para obtener buenos resultados.

5. La Gran Conclusión

El artículo concluye que, si bien la IA está mejorando, actualmente es demasiado ansiosa por hablar y tiene demasiado miedo de admitir que se equivoca para dar consejos gubernamentales de alto riesgo.

Si una IA va a ser tu guía para las reglas del gobierno, necesita aprender dos cosas:

  1. Ser concisa: Limítate a los hechos en el sitio web del gobierno; no inventes historias extra.
  2. Ser humilde: Si no conoces la respuesta, deberías decir "no lo sé" en lugar de adivinar.

Los autores construyeron este "examen" (CitizenQuery-UK) para que los gobiernos y las empresas tecnológicas puedan seguir probando la IA para asegurar que se vuelva lo suficientemente segura y confiable para ayudar realmente a las personas con sus problemas de la vida real. No están diciendo que la IA esté lista para reemplazar a los trabajadores de asesoría humana todavía; están diciendo: "Aquí hay una regla para medir qué tan cerca estamos de estar listos".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →