Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation
यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के अनुसंधान-स्तरीय गणितीय तर्क में विफलता के चार रूपों का एक वर्गीकरण प्रस्तावित करता है और अनुभवजन्य रूप से यह प्रदर्शित करता है कि "प्रिमिस स्मगलिंग" (premise smuggling)—मौलिक दावों का unverified या अपुष्ट अभिकथन—एक व्यापक, उद्धरण-सत्यापन-प्रतिरोधी दोष है जिसके लिए पोस्ट-हॉक डिटेक्शन के बजाय इन्फरेंस-टाइम रोकथाम रणनीतियों की आवश्यकता है।