One prompt is not enough: Instruction Sensitivity Undermines Embedding Model Evaluation
यह शोध पत्र यह प्रदर्शित करता है कि इंस्ट्रक्शन-ट्यून्ड एम्बेडिंग मॉडल्स के लिए वर्तमान सिंगल-प्रॉम्ट मूल्यांकन पद्धति मौलिक रूप से त्रुटिपूर्ण है क्योंकि यह निर्देश वाक्यांशण (instruction phrasing) के प्रति अत्यधिक संवेदनशील है, जिससे भ्रामक प्रदर्शन स्कोर और अस्थिर लीडरबोर्ड रैंकिंग उत्पन्न होती है, अतः ऐसे बेंचमार्क की आवश्यकता है जो प्रॉम्ट सुदृढ़ता (prompt robustness) को समाहित करते हों।