Benchmarking Agentic Review Systems
यह शोध पत्र मानव गुणवत्ता निर्णयों और इंजेक्ट की गई त्रुटियों के विरुद्ध कई एजेंटिक समीक्षा प्रणालियों का बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि हालांकि उन्हें अभी भी सुधार की आवश्यकता है, फिर भी OpenAIReview (GPT-5.5 के साथ) जैसे शीर्ष कॉन्फ़िगरेशन प्रभावी रूप से पेपर की गुणवत्ता को ट्रैक करते हैं, अधिकांश त्रुटियों का पता लगाते हैं, और वास्तविक उपयोगकर्ताओं से सकारात्मक प्रतिक्रिया प्राप्त करते हैं।