💬 NLP

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

यह शोध पत्र एक नवीनता-आधारित 'ट्री-ऑफ-थॉट' (Tree-of-Thought) खोज पद्धति प्रस्तुत करता है जो भाषा-आधारित नियोजन और तर्क कार्यों में दक्षता में सुधार करने और टोकन लागत को कम करने के लिए अनावश्यक तर्क पथों को मापने और उन्हें छाँटने हेतु एक एलएलएम (LLM) के पूर्व-प्रशिक्षित ज्ञान का लाभ उठाती है।

Leon Hamm, Zlatan Ajanovic2026-05-08
💬 NLP

Milestone-Guided Policy Learning for Long-Horizon Language Agents

यह शोध पत्र BEACON को प्रस्तुत करता है, जो एक मील का पत्थर-निर्देशित (milestone-guided) नीति शिक्षण ढांचा है जो मील के पत्थर की सीमाओं पर प्रक्षेपवक्रों (trajectories) को विभाजित करके और द्वि-स्तरीय लाभ अनुमान (dual-scale advantage estimation) लागू करके लॉन्ग-होरिज़न लैंग्वेज एजेंटों में क्रेडिट मिसअट्रिब्यूशन और सैंपल अक्षमता को संबोधित करता है, और ALFWorld जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongli (…)2026-05-08
💬 NLP

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

यह शोध पत्र मोंटे कार्लो पोर्टफोलियो प्लानिंग (MCPP) को प्रस्तुत करता है, जो एक हल्का क्लोज्ड-लूप प्लानर है जो सिम्युलेटेड परिणामों के आधार पर मॉडल्स और समानांतर सैंपल्स को गतिशील रूप से आवंटित करके स्पष्ट बजट और समय सीमा की बाधाओं के भीतर एजेंटिक वर्कफ्लो को पूरा करने की संभावना को अनुकूलित करता है।

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan (…)2026-05-08
💬 NLP

IRC-Bench: Recognizing Entities from Contextual Cues in First-Person Reminiscences

यह शोधपत्र IRC-Bench प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे स्पष्ट उल्लेखों के बजाय बिखरे हुए प्रासंगिक संकेतों से लक्ष्यों का अनुमान लगाने के परीक्षण के माध्यम से प्रथम-पुरुष स्मृति वृत्तांतों में अंतर्निहित संदर्भित संस्थाओं की पहचान का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसके परिणाम दर्शाते हैं कि QLoRA-अनुकूलित Llama 3.1 8B ओपन-वर्ल्ड सेटिंग्स में उत्कृष्ट है जबकि फाइन-ट्यून्ड DPR क्लोज्ड-वर्ल्ड रिट्रीवल में अग्रणी है।

Yehudit Aperstein, Eden Moran, Alexander Apartsin2026-05-08
📊 statistics

Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes

यह लेख प्रदर्शित करता है कि "स्लिंगशॉट मैकेनिज्म" (slingshot mechanism), जो दीर्घकालिक प्रशिक्षण के दौरान आवधिक लॉस स्पाइक्स (loss spikes) और तीव्र पैरामीटर वृद्धि द्वारा पहचाना जाता है, एक अंतर्निहित अनुकूलन गतिकी (optimization dynamic) का प्रतिनिधित्व नहीं करता है बल्कि कम-परिशुद्धता वाले फ्लोटिंग-पॉइंट अंकगणित (low-precision floating-point arithmetic) के कारण उत्पन्न एक संख्यात्मक विसंगति (numerical artifact) है, जहाँ ग्रेडिएंट्स में राउंडिंग त्रुटियाँ शून्य-योग स्थिति (zero-sum condition) का उल्लंघन करती हैं और एक सकारात्मक फीडबैक लूप को सक्रिय करती हैं जिसे संख्यात्मक विशेषता मुद्रास्फीति (numerical feature inflation - NFI) के रूप में जाना जाता है।

Liu Hanqing, Jianjun Cao, Yuanze Li, Zijian Zhou2026-05-08
💬 NLP

Contrastive Identification and Generation in the Limit

यह शोध पत्र एक सामान्य क्रॉसिंग ग्राफ के माध्यम से सीखने योग्य वर्गों (learnable classes) को अभिलक्षित करके, नई ज्यामितीय स्थितियों और आयामों को स्थापित करके, और यह प्रदर्शित करके कि कंट्रास्टिव डेटा पारंपरिक केवल-सकारात्मक उदाहरणों की तुलना में प्रतिकूल भ्रष्टाचार (adversarial corruption) के प्रति अधिक सुदृढ़ हो सकता है, सीमा में कंट्रास्टिव पहचान और पीढ़ी के अध्ययन की शुरुआत करता है।

Xiaoyu Li, Andi Han, Jiaojiao Jiang, Junbin Gao2026-05-08
💬 NLP

TIDE: Every Layer Knows the Token Beneath the Context

यह शोध पत्र TIDE का प्रस्ताव करता है, जो एक नवीन ट्रांसफार्मर आर्किटेक्चर है जो मानक सिंगल-इंजेक्शन टोकन एम्बेडिंग को एक "एम्बेडिंगमेमोरी" (EmbeddingMemory) प्रणाली से बदल देता है जो प्रत्येक परत में संदर्भ-मुक्त अर्थ संबंधी वेक्टर्स को इंजेक्ट करता है, जिससे दुर्लभ टोकन के कम प्रशिक्षण और समान टोकन के संदर्भात्मक पतन (contextual collapse) की समस्या को हल करते हुए भाषा मॉडलिंग प्रदर्शन में सुधार किया जा सके।

Ajay Jaiswal, Lauren Hannah, Han-Byul Kim, Duc Hoang, Mehrdad Farajtabar, Minsik Cho2026-05-08
💬 NLP

YEZE at SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization via Heterogeneous Ensembling

यह शोध पत्र YEZE प्रस्तुत करता है, जो SemEval-2026 टास्क 9 के लिए एक प्रणाली है जो XLM-RoBERTa-large और mDeBERTa-v3-base मॉडलों के एक विषम समूह (heterogeneous ensemble) का उपयोग करके 22 भाषाओं में ऑनलाइन ध्रुवीकरण का पता लगाता है, जहाँ गंभीर लेबल असंतुलन को संभालने के लिए क्लास वेटिंग (class weighting) के साथ स्वतंत्र टास्क मॉडलिंग सबसे प्रभावी सिद्ध हुई।

Fengze Guo (University of Tübingen), Yue Chang (University of Tübingen)2026-05-08
💬 NLP

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

यह शोध पत्र तर्क देता है कि सुदृढीकरण सीखना (reinforcement learning) नई क्षमताओं को सिखाकर नहीं, बल्कि उच्च-एन्ट्रॉपी निर्णय बिंदुओं पर विरल, पूर्वानुमेय सुधार करके LLM तर्क क्षमता में सुधार करता है, जिससे ReasonMaxxer का विकास होता है, जो एक अत्यधिक कुशल, RL-मुक्त विधि है जो न्यूनतम प्रशिक्षण लागत के साथ पूर्ण RL प्रदर्शन के बराबर है।

Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna2026-05-08
💬 NLP

Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

यह शोध पत्र इस बात की जांच करता है कि मूल्यांकन रूपरेखाओं (rubrics) में संशोधन करना—विशेष रूप से उदाहरण, संदर्भ जोड़कर और स्थितिजन्य पूर्वाग्रह (positional bias) को कम करके, बनाम जटिलता बढ़ाकर या रूढ़िवादी एकत्रीकरण (conservative aggregation) का उपयोग करके—निबंध स्कोरिंग और निर्देश पालन जैसे डोमेन में मानव और एलएलएम-आधारित ऑटोरेटर के बीच सांख्यिकीय सहमति को कैसे प्रभावित करता है, यह पाते हुए कि कुछ संपादन संरेखण (alignment) को बढ़ाते हैं जबकि अन्य इसे बाधित करते हैं।

Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz2026-05-08