Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
यह शोधपत्र DataGovBench प्रस्तुत करता है, जो सरकारी ओपन डेटा से प्राप्त एक नया बेंचमार्क है जो जटिल टेबल QA और खोजपूर्ण अंतर्दृष्टि (exploratory insight) कार्यों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे वर्तमान मॉडल्स और वास्तविक दुनिया के डेटा एनालिटिक्स की मांगों के बीच महत्वपूर्ण प्रदर्शन अंतराल का पता चलता है।