PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers
यह शोध पत्र PRISM को प्रस्तुत करता है, जो एक बहु-आयामी बेंचमार्क है जो यह प्रकट करता है कि जबकि LLM-आधारित पीयर समीक्षक नवीनता सत्यापन और दोष प्राथमिकता जैसे विशिष्ट क्षेत्रों में मानव प्रदर्शन के बराबर या उससे बेहतर हो सकते हैं, उनमें मानव समीक्षकों के स्टैंडअलोन प्रतिस्थापन के रूप में कार्य करने के लिए आवश्यक सभी समीक्षा आयामों में निरंतर, संतुलित विशेषज्ञता का अभाव है।