The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks
यह शोधपत्र CitizenQuery-UK को प्रस्तुत करता है, जो यूके सरकारी जानकारी पर आधारित 22,000 कृत्रिम रूप से निर्मित नागरिक प्रश्नों का एक नवीन बेंचमार्क डेटासेट है, और सार्वजनिक क्षेत्र के अनुप्रयोगों में AI की त्रुटिशीलता को स्वीकार करने की आवश्यकता और विश्वसनीयता संबंधी गंभीर चुनौतियों को उजागर करने के लिए 11 लार्ज लैंग्वेज मॉडल्स (LLMs) का तथ्यात्मकता, परहेज (abstention), और शब्दबहुलता (verbosity) के आधार पर मूल्यांकन करता है।