💬 NLP

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

यह शोध पत्र StatABench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें क्लोज्ड-फॉर्म प्रश्न और ओपन-एंडेड मॉडलिंग कार्य शामिल हैं, ताकि वर्तमान बड़े भाषा मॉडलों की सांख्यिकीय विश्लेषण क्षमताओं, टूल-ग्राउंडेड रीजनिंग और एंड-टू-एंड मॉडलिंग प्रदर्शन में महत्वपूर्ण सीमाओं का मूल्यांकन और अनावरण किया जा सके।

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen2026-06-23
🤖 machine learning

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

यह शोध पत्र ग्रुप-ग्राफ पॉलिसी ऑप्टिमाइज़ेशन (G2PO) का प्रस्ताव करता है, जो एक नवीन समूह-आधारित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम है जो रिवॉर्ड स्पर्सिटी (पुरस्कार की विरलता) को कम करने और क्रेडिट असाइनमेंट में सुधार करने के लिए रैखिक इंटरेक्शन ट्रेजेक्टरीज को एक वैश्विक स्टेट-ट्रांज़िशन ग्राफ में परिवर्तित करता है, जिससे लॉन्ग-होराइज़न एजेंटिक कार्यों में लार्ज लैंग्वेज मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang2026-06-23
💬 NLP

Unlimited OCR Works

यह शोध पत्र अनलिमिटेड OCR (Unlimited OCR) का परिचय देता है, जो एक ऐसा मॉडल है जो मानक डिकोडर अटेंशन को एक नवीन रेफरेंस स्लाइडिंग विंडो अटेंशन (Reference Sliding Window Attention - R-SWA) तंत्र से बदल देता है ताकि एक स्थिर KV कैश बनाए रखा जा सके, जिससे LLM-आधारित OCR सिस्टम में लंबे आउटपुट अनुक्रमों के कारण होने वाली मेमोरी और गति की गिरावट के बिना दर्जनों पृष्ठों का कुशल, सिंगल-पास ट्रांसक्रिप्शन सक्षम हो सके।

Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Sh (…)2026-06-23
🤖 AI

Cognitive Digital Twins: Ethical Risks and Governance for AI Systems That Model the Mind

यह शोध पत्र कॉग्निटिव डिजिटल ट्विन्स (CDTs) को मानव संज्ञान के गतिशील कम्प्यूटेशनल निरूपण के रूप में परिभाषित करता है, उनके अद्वितीय नैतिक जोखिमों जैसे कि गलत निरूपण और प्रॉक्सी-शक्ति विषमताओं को संबोधित करने के लिए एक 5A गवर्नेंस फ्रेमवर्क का प्रस्ताव करता है, और उन नए नियामक आवश्यकताओं के लिए तर्क देता है जो केवल डेटा प्रोसेसिंग या स्वचालित निर्णयों के बजाय स्वयं मन के निरूपण को नियंत्रित करती हैं।

Vamshi Krishna Bonagiri, Juan Nicolas Sepulveda-Arias, Abdoul Jalil Djiberou Mahamadou, Monojit Choudhury2026-06-23
💬 NLP

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

यह शोध पत्र PRIDE का प्रस्ताव करता है, जो एक विशेषाधिकार प्राप्त सूचना-संवर्धित ज्ञान आसवन (knowledge distillation) ढांचा है जो प्रशिक्षण के समय विशेषज्ञ एनोटेशन और एक बहु-घटक वास्तुकला का लाभ उठाता है ताकि बड़े भाषा मॉडलों से सूक्ष्म सहानुभूतिपूर्ण तर्क को छोटे, संसाधन-कुशल मॉडलों में स्थानांतरित किया जा सके, जिसके लिए अनुमान (inference) के दौरान अतिरिक्त इनपुट की आवश्यकता नहीं होती है।

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang2026-06-23
🤖 AI

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

यह शोध पत्र AFTER को प्रस्तुत करता है, जो विविध एंटरप्राइज कार्यों में LLM एजेंटों में प्रक्रियात्मक स्मृति (procedural memory) के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रदर्शित करता है कि परिष्कृत कौशल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाते हैं और प्रभावी क्रॉस-मॉडल एवं क्रॉस-रोल ट्रांसफर को सक्षम करते हैं, जबकि विभिन्न कौशलों के बीच सामान्यीकरण की अलग-अलग डिग्री को भी उजागर करते हैं।

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko2026-06-23
💬 NLP

Same question, different history: language, national identity, and credit in large language models

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल सांस्कृतिक स्मृति की वितरित प्रणालियों के रूप में कार्य करते हैं जहाँ क्वेरी भाषा व्यवस्थित रूप से विभिन्न राष्ट्रीय आख्यानों को सक्रिय करने वाले एक स्विच के रूप में कार्य करती है, जिससे जब उनकी संबंधित भाषाओं में प्रश्न पूछे जाते हैं तो कम-स्तर के ऐतिहासिक दावेदार अधिक बार सामने आते हैं जबकि प्रमुख एंग्लोफोन (अंग्रेजी भाषी) व्यक्तित्व सभी भाषाओं में स्थिर रहते हैं।

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes2026-06-23
🤖 AI

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

DART हाइब्रिड रीजनिंग मॉडल्स के लिए एक ट्रेनिंग-फ्री रूटिंग फ्रेमवर्क है जो सस्ते ड्राफ्ट्स को सैंपल करके और सीधे उत्तर देने या विस्तारित तर्क (extended reasoning) के बीच निर्णय लेने के लिए उनकी सहमति या एंट्रॉपी का उपयोग करके थिंकिंग बजट को गतिशील रूप से आवंटित करता है, जिससे जटिल गणित और कोड कार्यों पर सटीकता में सुधार करते हुए टोकन के उपयोग को काफी कम किया जा सकता है।

Jungseob Lee, Seongtae Hong, Seungjun Lee, Jaehyung Seo, Junyoung Son, Sugyeong Eo, Chanjun Park, Hyeongju Park, Hyeonse (…)2026-06-23
🤖 AI

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

यह शोध पत्र AgentCIBench को प्रस्तुत करता है, जो एक मूल्यांकन हारनेस (harness) है जो यह प्रकट करता है कि विजुअल को-लोकेशन (visual co-location), कार्य अस्पष्टता (task ambiguity) और प्राप्तकर्ता मिसअलाइनमेंट (recipient misalignment) के कारण 15 में से 11 फ्रंटियर मॉडल्स अक्सर अनुचित क्रॉस-कॉन्टेक्स्ट जानकारी लीक करते हैं, जिससे कंप्यूटर-उपयोग एजेंटों में महत्वपूर्ण गोपनीयता जोखिम सामने आते हैं।

Anmol Goel, Iryna Gurevych2026-06-23
💬 NLP

Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory

यह शोध पत्र "मेमोरी कंटेजियन" (स्मृति संक्रामकता) की पहचान और उसे औपचारिक रूप देता है, जो एक ऐसी घटना है जहाँ मूल्यांकनकर्ता का पूर्वाग्रह एजेंट मेमोरी सिस्टम के माध्यम से समय के साथ फैलता है, यह प्रदर्शित करते हुए कि कैसे लंबाई प्राथमिकता वाला पूर्वाग्रह (length preference bias) पूर्ण समेकन (perfect consolidation) के बावजूद भविष्य के एजेंटों को संक्रमित कर सकता है, जबकि अधिकार पूर्वाग्रह (authority bias) ऐसा नहीं करता है, जो वर्तमान एआई मेमोरी आर्किटेक्चर में एक मॉडल-जनरेशन-निर्भर भेद्यता को प्रकट करता है।

Zewen Liu2026-06-23