Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility
यह शोध पत्र यह तर्क देता है कि जनरेटिव एआई के मजबूत बेंचमार्क प्रदर्शन और इसकी सीमित वास्तविक दुनिया की उपयोगिता के बीच का अंतर त्रुटिपूर्ण मूल्यांकन प्रथाओं से उत्पन्न होता है, और विशिष्ट परिनियोजन संदर्भों के भीतर मानव परिणामों में निरंतर सुधार को मापने की ओर मूल्यांकन को स्थानांतरित करने के लिए SCU-GenEval ढांचे का प्रस्ताव करता है।