Counsel: A Meta-Evaluation Dataset for Agentic Tasks
यह शोधपत्र Counsel को प्रस्तुत करता है, जो एजेंटिक कार्यों (agentic tasks) पर LLM-as-a-judge आलोचनाओं के लिए मानव-सत्यापित मेटा-मूल्यांकनों का पहला सार्वजनिक डेटासेट है, जो त्रुटि के स्थान और तर्क की गुणवत्ता पर मानव निर्णयों के साथ उनके संरेखण का विश्लेषण करके स्वचालित मूल्यांकनकर्ताओं के अंशांकन (calibration) और सुधार को सक्षम बनाता है।