💻 computer science

On the Generalization Gap in Self-Evolving Language Model Reasoning

यह शोध पत्र क्लोज्ड-लूप सेल्फ-इवॉल्विंग लैंग्वेज मॉडल्स में जनरलाइजेशन गैप की जांच करता है, जिसमें यह पाया गया है कि हालांकि सेल्फ-जेनरेटेड सुपरविजन बेस मॉडल्स की तुलना में रीजनिंग परफॉरमेंस को बेहतर बनाता है, लेकिन यह उन्नत मल्टी-टर्न रिवीज़न रणनीतियों के साथ भी ओरैकल-सुपरवाइज्ड ट्रेनिंग की प्रभावशीलता से पूरी तरह मेल बिठाने में लगातार विफल रहता है।

Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby, Kan Yuan, Andrew Tomkins, Tu Vu, Da-Cheng Juan, Cyrus Rashtchian2026-06-02
💻 computer science

MiCU: End-to-End Smart Home Command Understanding with Large Language Model

यह शोध पत्र MiCU को प्रस्तुत करता है, जो स्मार्ट होम कमांड समझने के लिए एक डोमेन-विशिष्ट लार्ज लैंग्वेज मॉडल है, जो स्वचालित डेटा संश्लेषण, करिकुलम लर्निंग, रीइन्फोर्समेंट लर्निंग और टोकन संपीड़न का लाभ उठाकर सटीकता और दक्षता में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है, और सफलतापूर्वक Xiaomi Home ऐप में तैनात होकर यूजर करेक्शन रेट को कम करने और कमांड रिकग्निशन में सुधार करने में सफल होता है।

Haowei Han, Kexin Hu, Weiwei Cai, Debiao Zhang, Bin Qin, Yuxiang Wang, Jiawei Jiang, Xiao Yan, Bo Du2026-06-02
💻 computer science

Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities

यह शोधपत्र FOSSIL प्रस्तुत करता है, जो एक बहुभाषी डेटासेट और उसके साथ संलग्न वर्कफ़्लो है जिसे कानून और मानविकी विद्वत्ता में पादटिप्पणी-आधारित उद्धरणों (footnote-based citations) के निष्कर्षण को बेहतर बनाने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि एक विशिष्ट पाइपलाइन मानक उपकरणों की तुलना में निष्कर्षण गुणवत्ता को लगभग दोगुना कर देती है, जबकि क्रॉस-रेफरेंस और मिश्रित-सामग्री वाली पादटिप्पणियों को संभालने में शेष चुनौतियों पर भी प्रकाश डालती है।

Luca Foppiano, Christian Boulanger2026-06-02
💻 computer science

Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales

यह शोध पत्र प्रश्नोत्तर मॉडलों के लिए मौखिक रूप से व्यक्त किए गए फीचर एट्रिब्यूशन (feature attributions) और स्व-निर्मित तर्कों (self-generated rationales) की सिमुलेटिबिलिटी (simulatability) का मूल्यांकन और तुलना करता है, यह प्रदर्शित करते हुए कि स्पष्टीकरण का प्रारूप, सूक्ष्मता (granularity) और स्रोत, काउंटरफैक्चुअल (counterfactual) परिवेश में मॉडल के व्यवहार की भविष्यवाणी करने की एक एलएलएम (LLM) जज की क्षमता को महत्वपूर्ण रूप से प्रभावित करते हैं।

Pingjun Hong, Benjamin Roth2026-06-02
💻 computer science

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard एक स्व-विकसित रक्षा ढांचा (self-evolving defense framework) है जो गार्ड मॉडल्स के प्रशिक्षण के लिए यथार्थवादी एजेंट प्रक्षेपवक्र (agent trajectories) उत्पन्न करने हेतु ओपन-वर्ल्ड खतरों का खनन करता है, जो स्थिर, बेंचमार्क-संचालित दृष्टिकोणों की तुलना में कंप्यूटर-उपयोग एजेंटों के लिए सुरक्षा पहचान में महत्वपूर्ण सुधार करता है।

Yunhao Feng, Yifan Ding, Xiaohu Du, Ming Wen, Xinhao Deng, Yanming Guo, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li (…)2026-06-02
💻 computer science

Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs

यह शोध पत्र 'Hierarchical Adaptive Budgeter' (HAB) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो "आर्थिक रूप से सोचने" (Thinking Economically) के सिद्धांत को लागू करता है, ताकि इंटर-प्रॉब्लम (inter-problem) और इंट्रा-स्टेप (intra-step) दोनों स्तरों पर कम्प्यूटेशनल संसाधनों को गतिशील रूप से आवंटित करके मानक 'चेन-ऑफ-थॉट' (Chain-of-Thought) तर्क की तुलना में एक बेहतर सटीकता-दक्षता संतुलन प्राप्त किया जा सके।

Yubo Gao, Haotian Wu, Hong Chen, Junquan Huang, Yibo Yan, Jungang Li, Zihao Dongfang, Sicheng Tao, Puay Siew Tan, Jie Zh (…)2026-06-02
💬 NLP

CA-BED: Conversation-Aware Bayesian Experimental Design

यह शोध पत्र CA-BED का प्रस्ताव करता है, जो एक वार्ता-जागरूक (conversation-aware) बेयसियन प्रयोगात्मक डिज़ाइन ढांचा है जो संवादात्मक परिदृश्यों में लार्ज लैंग्वेज मॉडल्स के लिए प्रश्न चयन को अनुकूलित करता है, और न्यूनतम अतिरिक्त संवादात्मक चरणों के साथ सफलता दर में 21.8% का सुधार प्राप्त करता है।

Daniel Arnould, Rashad Aziz, Zixuan Kang, Tanav Changal, Kevin Zhu, Sunishchal Dev, Gabriel Grand, Shreyas Sunil Kulkarn (…)2026-06-02
💬 NLP

Low-Resource Safety Failures Are Action Failures, Not Representation Failures

यह शोध पत्र प्रदर्शित करता है कि कम-संसाधन वाली सुरक्षा विफलताएं हानिकारक प्रतिनिधित्व की कमी के बजाय निर्णय अंशांकन (डिसीजन कैलिब्रेशन) में मिसअलाइनमेंट से उत्पन्न होती हैं, और केवल कुछ लक्षित-भाषा उदाहरणों का उपयोग करके मौजूदा उच्च-संसाधन सुरक्षा गेटों को पुन: अंशांकित करने के माध्यम से इसे ठीक करने की एक विधि प्रस्तावित करता है।

Rashad Aziz, Ikhlasul Akmal Hanif, Fajri Koto2026-06-02✓ Author reviewed
🤖 AI

The Shape of Wisdom: Decision Trajectories in Language Models

यह शोध पत्र तीन भाषा मॉडलों के माध्यम से 9,000 निर्णय प्रक्षेप पथों (decision trajectories) का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि शुद्धता (correctness) और स्थिरता (stability) अलग-अलग गुण हैं, जो यह प्रदर्शित करता है कि अटेंशन मैकेनिज्म मुख्य रूप से स्थिर सही उत्तरों को संचालित करते हैं जबकि विशिष्ट टेक्स्ट स्पैन निर्णय मार्जिन को महत्वपूर्ण रूप से प्रभावित करते हैं।

Shailesh Rana2026-06-02
💬 NLP

Implicit Geographic Inference in LLM Medical Triage: Language-Driven Disparities in Emergency Recommendations

यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल चिकित्सा ट्राइएज (medical triage) में महत्वपूर्ण भाषा-संचालित असमानताएं प्रदर्शित करते हैं, जो लक्षण की गंभीरता के आकलन में अंतर के बजाय केवल इनपुट भाषा के कारण निहित भौगोलिक अनुमानों के आधार पर, समान न्यूरोलॉजिकल लक्षणों के लिए आपातकालीन कक्ष जाने की सिफारिश करने की दरों में भारी अंतर रखते हैं।

Qi Han Wong2026-06-02