Revisiting the Reliability of Language Models in Instruction-Following
यह शोध पत्र IFEval++ बेंचमार्क और reliable@k मीट्रिक को प्रस्तुत करता है जो यह प्रकट करता है कि जबकि उन्नत भाषा मॉडल मानक निर्देश-अनुपालन परीक्षणों पर उच्च स्कोर प्राप्त करते हैं, वे सूक्ष्म प्रॉम्प्ट बारीकियों का सामना करने पर महत्वपूर्ण नाजुकता और 61.8% तक की प्रदर्शन गिरावट प्रदर्शित करते हैं, जो वास्तविक दुनिया की विश्वसनीयता में एक महत्वपूर्ण अंतर को उजागर करता है।