Robustness assessment of large audio language models in multiple-choice evaluation
यह शोध पत्र प्रकट करता है कि बड़े ऑडियो भाषा मॉडल बहुविकल्पीय मूल्यांकनों में विकल्प क्रम और पैराफ्रेसिंग (वाक्य पुनर्गठन) के प्रति महत्वपूर्ण संवेदनशीलता प्रदर्शित करते हैं, जिसके कारण लेखक तीन बेंचमार्क और चार मॉडलों में इन विविधताओं को संबोधित करने के लिए एक अधिक सुदृढ़ मूल्यांकन प्रोटोकॉल और मीट्रिक का प्रस्ताव करते हैं।