💬 NLP

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

यह शोध पत्र मोंटे कार्लो पोर्टफोलियो प्लानिंग (MCPP) को प्रस्तुत करता है, जो एक हल्का क्लोज्ड-लूप प्लानर है जो सिम्युलेटेड परिणामों के आधार पर मॉडल्स और समानांतर सैंपल्स को गतिशील रूप से आवंटित करके स्पष्ट बजट और समय सीमा की बाधाओं के भीतर एजेंटिक वर्कफ्लो को पूरा करने की संभावना को अनुकूलित करता है।

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan (…)2026-05-08
💬 NLP

IRC-Bench: Recognizing Entities from Contextual Cues in First-Person Reminiscences

यह शोधपत्र IRC-Bench प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे स्पष्ट उल्लेखों के बजाय बिखरे हुए प्रासंगिक संकेतों से लक्ष्यों का अनुमान लगाने के परीक्षण के माध्यम से प्रथम-पुरुष स्मृति वृत्तांतों में अंतर्निहित संदर्भित संस्थाओं की पहचान का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसके परिणाम दर्शाते हैं कि QLoRA-अनुकूलित Llama 3.1 8B ओपन-वर्ल्ड सेटिंग्स में उत्कृष्ट है जबकि फाइन-ट्यून्ड DPR क्लोज्ड-वर्ल्ड रिट्रीवल में अग्रणी है।

Yehudit Aperstein, Eden Moran, Alexander Apartsin2026-05-08
📊 statistics

Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes

यह लेख प्रदर्शित करता है कि "स्लिंगशॉट मैकेनिज्म" (slingshot mechanism), जो दीर्घकालिक प्रशिक्षण के दौरान आवधिक लॉस स्पाइक्स (loss spikes) और तीव्र पैरामीटर वृद्धि द्वारा पहचाना जाता है, एक अंतर्निहित अनुकूलन गतिकी (optimization dynamic) का प्रतिनिधित्व नहीं करता है बल्कि कम-परिशुद्धता वाले फ्लोटिंग-पॉइंट अंकगणित (low-precision floating-point arithmetic) के कारण उत्पन्न एक संख्यात्मक विसंगति (numerical artifact) है, जहाँ ग्रेडिएंट्स में राउंडिंग त्रुटियाँ शून्य-योग स्थिति (zero-sum condition) का उल्लंघन करती हैं और एक सकारात्मक फीडबैक लूप को सक्रिय करती हैं जिसे संख्यात्मक विशेषता मुद्रास्फीति (numerical feature inflation - NFI) के रूप में जाना जाता है।

Liu Hanqing, Jianjun Cao, Yuanze Li, Zijian Zhou2026-05-08
💬 NLP

Contrastive Identification and Generation in the Limit

यह शोध पत्र एक सामान्य क्रॉसिंग ग्राफ के माध्यम से सीखने योग्य वर्गों (learnable classes) को अभिलक्षित करके, नई ज्यामितीय स्थितियों और आयामों को स्थापित करके, और यह प्रदर्शित करके कि कंट्रास्टिव डेटा पारंपरिक केवल-सकारात्मक उदाहरणों की तुलना में प्रतिकूल भ्रष्टाचार (adversarial corruption) के प्रति अधिक सुदृढ़ हो सकता है, सीमा में कंट्रास्टिव पहचान और पीढ़ी के अध्ययन की शुरुआत करता है।

Xiaoyu Li, Andi Han, Jiaojiao Jiang, Junbin Gao2026-05-08
💬 NLP

TIDE: Every Layer Knows the Token Beneath the Context

यह शोध पत्र TIDE का प्रस्ताव करता है, जो एक नवीन ट्रांसफार्मर आर्किटेक्चर है जो मानक सिंगल-इंजेक्शन टोकन एम्बेडिंग को एक "एम्बेडिंगमेमोरी" (EmbeddingMemory) प्रणाली से बदल देता है जो प्रत्येक परत में संदर्भ-मुक्त अर्थ संबंधी वेक्टर्स को इंजेक्ट करता है, जिससे दुर्लभ टोकन के कम प्रशिक्षण और समान टोकन के संदर्भात्मक पतन (contextual collapse) की समस्या को हल करते हुए भाषा मॉडलिंग प्रदर्शन में सुधार किया जा सके।

Ajay Jaiswal, Lauren Hannah, Han-Byul Kim, Duc Hoang, Mehrdad Farajtabar, Minsik Cho2026-05-08
💬 NLP

YEZE at SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization via Heterogeneous Ensembling

यह शोध पत्र YEZE प्रस्तुत करता है, जो SemEval-2026 टास्क 9 के लिए एक प्रणाली है जो XLM-RoBERTa-large और mDeBERTa-v3-base मॉडलों के एक विषम समूह (heterogeneous ensemble) का उपयोग करके 22 भाषाओं में ऑनलाइन ध्रुवीकरण का पता लगाता है, जहाँ गंभीर लेबल असंतुलन को संभालने के लिए क्लास वेटिंग (class weighting) के साथ स्वतंत्र टास्क मॉडलिंग सबसे प्रभावी सिद्ध हुई।

Fengze Guo (University of Tübingen), Yue Chang (University of Tübingen)2026-05-08
💬 NLP

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

यह शोध पत्र तर्क देता है कि सुदृढीकरण सीखना (reinforcement learning) नई क्षमताओं को सिखाकर नहीं, बल्कि उच्च-एन्ट्रॉपी निर्णय बिंदुओं पर विरल, पूर्वानुमेय सुधार करके LLM तर्क क्षमता में सुधार करता है, जिससे ReasonMaxxer का विकास होता है, जो एक अत्यधिक कुशल, RL-मुक्त विधि है जो न्यूनतम प्रशिक्षण लागत के साथ पूर्ण RL प्रदर्शन के बराबर है।

Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna2026-05-08
💬 NLP

Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

यह शोध पत्र इस बात की जांच करता है कि मूल्यांकन रूपरेखाओं (rubrics) में संशोधन करना—विशेष रूप से उदाहरण, संदर्भ जोड़कर और स्थितिजन्य पूर्वाग्रह (positional bias) को कम करके, बनाम जटिलता बढ़ाकर या रूढ़िवादी एकत्रीकरण (conservative aggregation) का उपयोग करके—निबंध स्कोरिंग और निर्देश पालन जैसे डोमेन में मानव और एलएलएम-आधारित ऑटोरेटर के बीच सांख्यिकीय सहमति को कैसे प्रभावित करता है, यह पाते हुए कि कुछ संपादन संरेखण (alignment) को बढ़ाते हैं जबकि अन्य इसे बाधित करते हैं।

Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz2026-05-08
💬 NLP

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

LatentRAG एक अभिनव ढांचा है जो एजेंटिक RAG तर्क और पुनर्प्राप्ति (retrieval) को विविक्त भाषा स्थान (discrete language space) से निरंतर लेटेंट स्पेस (continuous latent space) में स्थानांतरित करता है, जिससे एंड-टू-एंड संयुक्त अनुकूलन सक्षम होता है और स्पष्ट बहु-चरणीय विधियों के तुलनीय प्रदर्शन बनाए रखते हुए अनुमान विलंबता (inference latency) को लगभग 90% तक कम किया जाता है।

Yijia Zheng, Marcel Worring2026-05-08
💬 NLP

MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method

यह शोध पत्र MultiLinguahah का प्रस्ताव करता है, जो एक अनसुपरवाइज्ड (unsupervised) बहुभाषी हँसी विभाजन पद्धति है जो हँसी को एक विसंगति (anomaly) के रूप में पहचानने के लिए BYOL-A ऑडियो रिप्रजेंटेशन पर आइसोलेशन फॉरेस्ट (Isolation Forest) का उपयोग करती है, और मौजूदा सुपरवाइज्ड, अंग्रेजी-केंद्रित अत्याधुनिक एल्गोरिदम की तुलना में गैर-अंग्रेजी संदर्भों में बेहतर प्रदर्शन प्रदर्शित करती है।

Callejas Sofia, Gomez Nahuel, Pelachaud Catherine, Ravenet Brian, Barriere Valentin2026-05-08