Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation
यह शोधपत्र Logifus और LogiQAte बेंचमार्क को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) के प्रदर्शन में तब महत्वपूर्ण गिरावट आती है जब तार्किक तर्क कार्यों को अस्पष्ट लेकिन समतुल्य स्वरूपों में प्रस्तुत किया जाता है, जो गहरे अर्थपूर्ण बोध के बजाय उनकी सतही पैटर्न पर निर्भरता को उजागर करता है।