💬 NLP

Office Comprehension Benchmark

यह शोध पत्र ऑफिस कॉम्प्रिहेंशन बेंच (OCB) को प्रस्तुत करता है, जो वर्ड, एक्सेल और पावरपॉइंट बोध के मूल्यांकन के लिए डिज़ाइन किया गया पहला सार्वजनिक बेंचमार्क है, जो दो ट्रैक्स—फाइल फिडेलिटी Q&A और डोमेन Q&A—के माध्यम से यह प्रकट करता है कि शीर्ष स्तर के मॉडल भी जटिल दस्तावेज़ तर्क करने में संघर्ष करते हैं, और डोमेन कार्यों पर केवल 59.3% सटीकता प्राप्त करते हैं।

Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwa (…)2026-07-03
💬 NLP

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules

RuleChef एक ओपन-सोर्स फ्रेमवर्क है जो लर्निंग फेज के दौरान एनएलपी (NLP) कार्यों के लिए मानव-संपादन योग्य, नियतात्मक नियमों को संश्लेषित और पुनरावृत्ति से परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसके परिणामस्वरूप तेज़ और निरीक्षण योग्य सिस्टम प्राप्त होते हैं जिन्हें इन्फरेंस (inference) के समय LLMs की आवश्यकता नहीं होती है।

Ádám Kovács, Nadia Verdha, Gábor Recski2026-07-03
💬 NLP

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

यह शोध पत्र ISOSCI को प्रस्तुत करता है, जो समरूपी (isomorphic) क्रॉस-डोमेन विज्ञान समस्याओं का एक बेंचमार्क है, जो यह दर्शाता है कि बड़े भाषा मॉडलों में अधिकांश तर्क संबंधी सुधार वास्तव में संरचनात्मक तर्क क्षमताओं के बजाय डोमेन ज्ञान पुनर्प्राप्ति (domain knowledge retrieval) द्वारा संचालित होते हैं, जिससे इस धारणा को चुनौती मिलती है कि चेन-ऑफ-थॉट रीजनिंग स्वाभाविक रूप से लघु-क्षितिज (short-horizon) वैज्ञानिक समस्या-समाधान को बेहतर बनाती है।

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban2026-07-03
💬 NLP

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

यह शोधपत्र FaithMed को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो साक्ष्य-आधारित चिकित्सा सिद्धांतों को प्रक्रिया-स्तरीय मानदंडों में औपचारिक रूप देकर और साक्ष्य मूल्यांकन एवं तर्क को पर्यवेक्षित करने के लिए चरण-स्तरीय सुदृढीकरण शिक्षण (reinforcement learning) को लागू करके मेडिकल लार्ज लैंग्वेज मॉडल्स की निष्ठा और प्रदर्शन को बढ़ाता है।

Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong2026-07-03
💬 NLP

Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting

यह शोध पत्र "ग्राउंडेड ऑप्टिमाइज़ेशन" (Grounded Optimization) प्रस्तुत करता है, जो एक पांच-स्तरीय इंजीनियरिंग ढांचा है जो टेम्पोरल वैलिडेशन (temporal validation), डिटर्मिनिस्टिक कंटैमिनेशन डिटेक्शन (deterministic contamination detection) और स्ट्रक्चरल एनफोर्समेंट (structural enforcement) को जोड़कर स्वचालित रेज़्यूमे रीराइटिंग में विशिष्ट मतिभ्रम (hallucination) जोखिमों को प्रभावी ढंग से कम करता है, जिससे प्रति दस्तावेज़ मतिभ्रम की दर औसतन 2.48–5.36 से घटकर 0.04–0.24 हो जाती है।

Shashank Indukuri, Adarsh Agrawal2026-07-03
💬 NLP

Parameter Golf: What Really Works?

यह शोध पत्र "पैरामीटर गोल्फ" चुनौती के 1,430 सबमिशन का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि जबकि व्यक्तिगत अनुकूलन तकनीकें शायद ही कभी महत्वपूर्ण लाभ प्रदान करती हैं, 84 विशिष्ट विधियों के व्यवस्थित संयोजन ने सख्त 16 MB आर्टिफैक्ट और 10 मिनट की प्रशिक्षण सीमाओं के तहत लैंग्वेज मॉडल बिट्स-पर-बाइट को 13.6% सफलतापूर्वक कम कर दिया।

Prashanna Mani Paudel, Shivanand Venkanna Sheshappanavar2026-07-03
🤖 machine learning

Multi-Head Recurrent Memory Agents

यह शोध पत्र मल्टी-हेड रिकरेंट मेमोरी (MHM) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो मेमोरी को स्वतंत्र हेड्स में विभाजित करता है और ओवरराइटिंग को रोकने के लिए एक 'सेलेक्ट-देन-अपडेट' रणनीति का उपयोग करता है, जिससे विभिन्न मॉडलों और स्केल्स में लॉन्ग-कॉन्टेक्स्ट रिटेंशन और एंड-टू-एंड प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jiatong Li, Samuel Yeh, Sharon Li2026-07-03
💬 NLP

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

यह शोध पत्र दस लाख-टोकन के पैमाने पर इन-कॉन्टेक्स्ट रिट्रीवल (in-context retrieval) का एक व्यवस्थित अध्ययन प्रस्तुत करता है, जिसमें अटेंशन डाइल्यूशन (attention dilution) को एक प्रमुख विफलता बिंदु के रूप में पहचाना गया है और ऐसे वास्तुशिल्प संशोधनों (architectural modifications) का प्रस्ताव दिया गया है जो एक 0.6B भाषा मॉडल को विभिन्न बेंचमार्क पर डेंस रिट्रीवल सिस्टम के बराबर या उससे बेहतर बनाने में सक्षम बनाते हैं, साथ ही उत्कृष्ट लंबाई सामान्यीकरण (length generalization) प्रदर्शित करते हैं।

Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min2026-07-03
💬 NLP

DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents

यह शोध पत्र DiPS का प्रस्ताव करता है, जो एक Q-learning फ्रेमवर्क है जो उच्च-जोखिम वाले अग्नि-बचाव परिदृश्यों में निकासी सफलता दरों को सुधारने के लिए निवासी के कथनों के आधार पर अनुकूलित अनुनय रणनीतियों को गतिशील रूप से चुनता है, और सिम्युलेटेड एवं वास्तविक मानव अंतःक्रियाओं दोनों में ज़ीरो-शॉट LLMs और जेनेरिक RAG दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Tianyi Zhang, Mousumi Das, Abrar Anwar, Jesse Thomason, David Traum2026-07-03
💬 NLP

Beyond Skepticism: Evaluating LLMs Pedagogical Intent Reasoning with the Adaptive Pedagogical Vigilance Framework

यह शोध पत्र एडेप्टिव पेडागोगिकल विजिलेंस (APV) फ्रेमवर्क प्रस्तुत करता है, जो एक बेयसियन औपचारिकता (Bayesian formalism) है जो बड़े भाषा मॉडलों (Large Language Models) की शैक्षणिक इरादे को समझने और निर्देशात्मक सामग्री को एक्सपोज़र-आधारित सामग्री से अलग करने की क्षमता को महत्वपूर्ण रूप से बढ़ाता है, जिससे विश्वसनीय एआई-सहायता प्राप्त शिक्षण प्रणालियों के विकास को आगे बढ़ाया जा सकता है।

Minghao Chen, Ruihan Zhou, Jiayi Tang, Zihan Xu, Bowen Huang, Yuxin Liu2026-07-03