Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions
यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) की अर्थ संबंधी सामान्यीकरण क्षमताओं का आकलन करने के लिए कंस्ट्रक्शन ग्रामर पर आधारित एक नवीन मूल्यांकन डेटासेट प्रस्तुत करता है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी भिन्न अर्थों वाले वाक्यात्मक रूप से समान वाक्यांश संरचनाओं के बीच अंतर करने में संघर्ष करते हैं, और मानव अंतर्ज्ञान की तुलना में 40% से अधिक की प्रदर्शन गिरावट प्रदर्शित करते हैं।