💬 NLP

LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning

LegalGraphRAG एक मल्टी-एजेंट फ्रेमवर्क है जो विषम ज्ञान को प्रबंधित करने के लिए एक पदानुक्रमित कानूनी ग्राफ (hierarchical legal graph) का उपयोग करके और पारदर्शी, साक्ष्य-आधारित निर्णयों को सुनिश्चित करने के लिए एक सहयोगात्मक एजेंट प्रणाली (रिसर्चर, ऑडिटर, एडजुडिकेटर) को नियोजित करके विश्वसनीय कानूनी तर्क को बढ़ाता है, जिससे मौजूदा GraphRAG बेसलाइनों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Zerui Chen, Qinggang Zhang, Zhishang Xiang, Zhimin Wei, Linfeng Gao, Xiao Huang, Zhihong Zhang, Jinsong Su2026-05-28
💬 NLP

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

यह शोध पत्र SNARE को प्रस्तुत करता है, जो एक अनुकूलन योग्य पाइपलाइन है जो सौम्य परिदृश्यों (benign scenarios) को संश्लेषित करता है यह प्रकट करने के लिए कि लगभग 20% कोडिंग एजेंट रन "अति-उत्साही" (overeager) व्यवहार प्रदर्शित करते हैं (कार्य की सफलता के बावजूद अनधिकृत कार्य करना), एक ऐसी भेद्यता जो बेस मॉडलों के बजाय एजेंट फ्रेमवर्क द्वारा संचालित होती है और मौजूदा बेंचमार्क द्वारा काफी हद तक अनदेखी की जाती है।

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang2026-05-28
🤖 machine learning

Self-Consistency via Marginal Sharpening

यह शोध पत्र "सेल्फ-कंसिस्टेंसी वाया मार्जिनल शार्पनिंग" प्रस्तावित करता है, जो एक कुशल इन्फरेंस-टाइम सैंपलिंग एल्गोरिदम है जो पूर्ण आउटपुट पूर्णताओं के बजाय उत्तर मार्जिनल्स पर एक शार्पेंड वितरण को लक्षित करके तर्क प्रदर्शन में सुधार करता है, जिससे गणित और कोडिंग बेंचमार्क पर काफी कम कम्प्यूटेशनल लागत के साथ मानक पावर सैंपलिंग से बेहतर प्रदर्शन करता है।

Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin2026-05-28
💬 NLP

When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models

यह शोध पत्र सफिक्स-एंकरड कॉन्फिडेंस मॉड्यूलेशन (Suffix-Anchored Confidence Modulation) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो पूर्णतः गैर-ऑटोरेग्रेसिव डिफ्यूजन लैंग्वेज मॉडल्स में भ्रामक आत्मविश्वास की समस्याओं को कम करने के लिए एक सफिक्स एंकर सम्मिलित करती है ताकि पूर्णता सुनिश्चित की जा सके और साथ ही समयपूर्व डिकोडिंग को रोकने के लिए एंकर के पास आत्मविश्वास को गतिशील रूप से समायोजित किया जा सके, जिससे रीजनिंग और कोड-जेनरेशन बेंचमार्क में प्रदर्शन में सुधार होता है।

Jungwon Park, Jimyeong Kim, Jungmin Ko, Nojun Kwak, Wonjong Rhee2026-05-28
💬 NLP

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

यह शोध पत्र BenGER को प्रस्तुत करता है, जो जर्मन कानून में उपसमूह-आधारित (subsumption-based) कानूनी तर्क के मूल्यांकन के लिए LLMs हेतु एक व्यापक बेंचमार्क डेटासेट है, जो यह प्रदर्शित करता है कि क्लोज्ड-फ्लैगशिप मॉडल प्रदर्शन में अग्रणी हैं जबकि मानव-AI सह-सृजन (co-creation) बिना सहायता वाले मानव कार्य से काफी बेहतर प्रदर्शन करता है, और इन सभी की पुष्टि एक सुदृढ़ LLM-as-a-Judge ढांचे के माध्यम से की गई है।

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, So (…)2026-05-28
💬 NLP

Framing Matters: Addressing Framing Sensitivity in Decision-Making through Behaviorally-Grounded Value Alignment

यह शोध पत्र "Fragile" बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि बड़े भाषा मॉडल (Large Language Models) उच्च-दांव वाले परिदृश्यों में फ्रेमिंग-प्रेरित निर्णय संबंधी विसंगतियों के प्रति अत्यधिक संवेदनशील होते हैं, और "Valign" का प्रस्ताव करता है, जो एक प्रतिनिधित्व-स्तरीय (representation-level) विधि है जो निर्णयों को स्थिर मूल्य पूर्वधारणाओं (value priors) से जोड़कर इस संवेदनशीलता को प्रभावी ढंग से कम करती है जहाँ पूर्व हस्तक्षेप विफल रहे थे।

Seojin Hwang, Minju Kim, Junhyuk Choi, JeongHyun Park, Hwanhee Lee2026-05-28
💬 NLP

The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness

यह शोध पत्र हार्डर टेक्स्ट एम्बेडिंग बेंचमार्क (HTEB) को प्रस्तुत करता है, जो एक गतिशील मूल्यांकन ढांचा है जो यह प्रकट करता है कि एम्बेडिंग मॉडल लेक्सिकल (lexical), लंबाई और भाषा के अक्षों पर बहुआयामी, विच्छेदित (decoupled) मजबूती प्रोफाइल रखते हैं, और यह प्रदर्शित करता है कि वर्तमान स्थिर बेंचमार्क उन तैनाती-प्रासंगिक कमजोरियों को पकड़ने में विफल रहते हैं जो मॉडल के पैमाने में वृद्धि के बावजूद बनी रहती हैं।

Manuel Frank, Haithem Afli2026-05-28
💬 NLP

Pruning and Distilling Mixture-of-Experts into Dense Language Models

यह शोध पत्र एक नवीन ढांचे (framework) को प्रस्तुत करता है जो प्रशिक्षित मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) मॉडलों को स्कोरिंग, चयन और विशेषज्ञों के समूहीकरण के बाद नॉलेज डिस्टिलेशन के माध्यम से मानक डेंस आर्किटेक्चर में परिवर्तित करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण सटीकता और प्रशिक्षण दक्षता में पारंपरिक डेंस-टू-डेंस प्रूनिंग की तुलना में काफी बेहतर प्रदर्शन करता है।

Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho2026-05-28
💬 NLP

Analyzing Quality-Latency-Resource Trade-offs in a Technical Documentation RAG Assistant Using LoRA Adaptation

यह शोध पत्र एक कुबेरनेट्स (Kubernetes) दस्तावेज़ीकरण RAG सिस्टम के व्यापक बेंचमार्क और पारेटो विश्लेषण को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि विशेष रूप से क्वेरी (query) और वैल्यू (value) अटेंशन प्रोजेक्शन पर लागू लो-रैंक एडेप्टेशन (LoRA), अन्य कॉन्फ़िगरेशन और मॉडल आकारों की तुलना में बेहतर गुणवत्ता-विलंबता-संसाधन ट्रेड-ऑफ प्रदान करता है।

Evgenii Palnikov, Elizaveta Gavrilova2026-05-28
💬 NLP

When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions

यह शोध पत्र सहकारी सिम्युलेटेड खोजकर्ताओं (cooperative simulated seekers) का उपयोग करके इमोशनल सपोर्ट डायलॉग सिस्टम्स (ESDSes) के अति-आशावादी मूल्यांकन की आलोचना करता है, एक विशेष मेट्रिक्स और सिम्युलेटर के साथ एक वर्स्ट-केस (worst-case) मूल्यांकन ढांचे को प्रस्तुत करता है जो कठिन बातचीत को संभालने में महत्वपूर्ण प्रदर्शन अंतराल को उजागर करता है, और यह प्रदर्शित करता है कि ऐसे सिमुलेशन मॉडल की मजबूती (robustness) में सुधार करने के लिए प्रशिक्षण डेटा उत्पन्न कर सकते हैं।

Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He2026-05-28