💬 NLP

Learning State-Tracking from Code Using Linear RNNs

यह शोध पत्र क्रमपरिवर्तन संयोजन (permutation composition) को कोड-आधारित REPL ट्रेसेस में परिवर्तित करके स्टेट-ट्रैकिंग अनुसंधान और नेक्स्ट-टोकन प्रेडिक्शन के बीच के अंतर को पाटता है, यह प्रदर्शित करते हुए कि जबकि लीनियर RNNs इस कार्य में ट्रांसफॉर्मर्स की तुलना में उत्कृष्ट हैं, वे नॉन-लीनियर RNNs की तुलना में खराब प्रदर्शन कर सकते हैं जब स्टेट रिवील्स (state reveals) नियतात्मक होते हैं लेकिन एक्शन्स पूरी तरह से अवलोकन योग्य नहीं होते हैं।

Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani2026-06-26
💬 NLP

Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

यह शोधपत्र ProofRank प्रस्तुत करता है, जो गणितीय प्रमाण की गुणवत्ता के पांच स्केलेबल आयामों—संक्षिप्तता (conciseness), गणनात्मक सुगमता (computational ease), संज्ञानात्मक सरलता (cognitive simplicity), विविधता (diversity), और अनुकूलनशीलता (adaptivity)—पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक बेंचमार्क है—जो इन गुणात्मक मेट्रिक्स और केवल शुद्धता (correctness) के बीच महत्वपूर्ण ट्रेड-ऑफ को प्रकट करता है।

Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov, Martin Vechev2026-06-26
💬 NLP

Learning User Simulators with Turing Rewards

यह शोध पत्र ट्यूरिंग-आरएल (Turing-RL) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक डिस्क्रिमिनेटिव ट्यूरिंग रिवॉर्ड के माध्यम से वास्तविक मनुष्यों से अविभेद्यता के लिए अनुकूलन करके उपयोगकर्ता सिम्युलेटर को प्रशिक्षित करता है, जो कन्वर्सेशनल चैट और रेडिट फोरम दोनों डोमेन में पारंपरिक रिस्पॉन्स-मैचिंग बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim2026-06-26
💬 NLP

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

यह शोधपत्र Know2Guess प्रस्तुत करता है, जो एक संदूषण-जागरूक (contamination-aware) मल्टी-ज़ोन बेंचमार्क है जिसे समर्थित उत्तरों और अज्ञात विषयों पर परहेज (abstentions) के बीच अंतर करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल्स में चयनात्मक परहेज की कुछ क्षमता दिखाई देती है, फिर भी वे अंशांकन (calibration) और सौम्य-वस्तु अस्वीकृति (benign-item refusal) के मामले में संघर्ष करते हैं।

Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang2026-06-26
💬 NLP

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

यह शोध पत्र प्रदर्शित करता है कि सहायक डेटा (helpfulness data) पर भाषा मॉडलों को पोस्ट-ट्रेनिंग देना, कोडिंग-केंद्रित प्रशिक्षण की तुलना में मिड-ट्रेन्ड पशु करुणा मूल्यों और सामान्य नैतिक तर्क को महत्वपूर्ण रूप से कम कर देता है, जबकि यह भी प्रकट करता है कि ये करुणा मूल्य डोमेन-विशिष्ट पोस्ट-ट्रेनिंग से प्राप्त तर्क सुधारों की तुलना में भाषाओं के बीच अधिक मजबूती से एनकोडेड हैं।

Jasmine Brazilek, Juliana Seawell2026-06-26
💬 NLP

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

यह अध्ययन मॉडल डिस्टिलेशन दृष्टिकोण के माध्यम से स्टेटिक्स (स्थिरता) की समस्याओं को हल करने में लार्ज लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि वे केवल टेक्स्ट वाले प्रश्नों पर अच्छा प्रदर्शन करते हैं, जब आरेखों और बहु-चरणीय तर्क की आवश्यकता होती है तो उनकी सटीकता काफी घट जाती है क्योंकि वे इमेज रिकग्निशन (छवि पहचान) की सीमाओं के बजाय विजुअल जानकारी को लगातार लागू करने में चुनौतियों का सामना करते हैं।

Tanner Culleton, Hung-Fu Chang2026-06-26
💬 NLP

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

यह शोध पत्र प्रदर्शित करता है कि जब पशु-कल्याण संबंधी ग्रंथों का उपयोग भाषा मॉडलों को फाइन-ट्यून करने के लिए किया जाता है, तो मुखर भाषाई विशेषताएं (जैसे कि निश्चितता, नैतिक शब्दावली और भावना) मॉडल के पशु-कल्याण समर्थक तर्क को महत्वपूर्ण रूप से सुदृढ़ करती हैं, जबकि वर्णनात्मक या संदेहात्मक भाषा इस रुख को कमजोर कर देती है।

Jasmine Brazilek, Harper Dunn2026-06-26
💬 NLP

Context Recycling for Long-Horizon LLM Inference

यह शोध पत्र ContextForge को प्रस्तुत करता है, जो एक ऐसी प्रणाली है जो संरचित क्वेरी जनरेशन, बाहरी मेमोरी रिट्रीवल और नियंत्रित सिंथेसिस के माध्यम से कार्य-प्रासंगिक जानकारी को पुनर्चक्रित (recycle) करके लॉन्ग-होरिज़न LLM इन्फरेंस को बेहतर बनाती है, जिससे बड़े कॉन्टेक्स्ट विंडो या मॉडल रिट्रेनिंग की आवश्यकता के बिना टोकन खपत को कम किया जाता है और सटीकता बनाए रखी जाती है।

Derek Thomas2026-06-26
💬 NLP

Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints

यह शोध पत्र यह प्रदर्शित करता है कि अहिंसक संचार (Nonviolent Communication) के सिद्धांतों पर आधारित हल्के प्रॉम्प्ट-स्तरीय प्रतिबंधों को लागू करना, भावनात्मक रूप से आवेशित संघर्ष वाले परिदृश्यों में बड़े भाषा मॉडलों (large language models) और प्रतिरोधी उपयोगकर्ताओं के बीच संवादात्मक वृद्धि (conversational escalation) को प्रभावी ढंग से कम करता है और अंतःक्रियाओं को स्थिर करता है।

Zhixing Sun, Shenghe Xu, Tao Li2026-06-26
💬 NLP

Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

यह पायलट अध्ययन NEST-V1 को पेश करता है, जो एक हल्का, भावना-आधारित मल्टीमॉडल फ्रेमवर्क है जो बोले गए इनपुट से नेपाली सांकेतिक भाषा के अवतारों को उच्च सटीकता के साथ सफलतापूर्वक उत्पन्न करता है, जो स्पीच रिकग्निशन और इमोशन क्लासिफिकेशन दोनों में, कम संसाधन वाले परिवेश में वास्तविक समय में, भावनात्मक रूप से अभिव्यंजक सांकेतिक भाषा अनुवाद के लिए एक व्यवहार्य मार्ग प्रदर्शित करता है।

Jatin Bhusal, Salma Tamang2026-06-26