💬 NLP

The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling

कॉम्प्लेक्सिटी सीलिंग बेंचमार्क (CCB) यह मूल्यांकन करता है कि तीन डोमेन में बढ़ते कार्य की गहराई के साथ भाषा मॉडल की तर्क क्षमता कैसे घटती है, जिससे यह पता चलता है कि जहाँ कुछ मॉडल 50 चरणों तक स्थानिक और प्रतीकात्मक कार्यों में उच्च सटीकता बनाए रखते हैं, वहीं वे रिलेशनल इन्फरेंस (संबंधात्मक अनुमान) में तेजी से विफल हो जाते हैं, जिसमें एक विशिष्ट मीट्रिक (k*) पैरामीटर संख्या की तुलना में लॉन्ग-होराइजन प्रदर्शन का बेहतर पूर्वानुमान लगाता है।

Shubh Chapra, Dhruv Kumar, Murari Mandal, Yash Sinha2026-06-30
💬 NLP

Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts

यह शोध पत्र प्रकट करता है कि एलएलएम (LLM) एजेंट अनजाने में अपनी स्मृति प्रणालियों के भीतर अनिश्चित टिप्पणियों को कठोर "तथ्यों" में परिवर्तित करके झूठा आत्मविश्वास निर्मित करते हैं, जो एक ऐसी भेद्यता है जो स्रोत एट्रिब्यूशन या सुरक्षा टैग के बावजूद बनी रहती है लेकिन अनिश्चित वाक्यांशों को संरक्षित करके और अतिरेक सत्यापन की आवश्यकता देकर कम की जा सकती है।

Alex Kwon2026-06-30
🤖 machine learning

Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning

यह शोध पत्र ज़ीरो-शॉट (zero-shot) एलएलएम (LLM) शैक्षिक सलाहकारों में "हस्तक्षेप पूर्वाग्रह" (intervention bias) की पहचान और मात्रा निर्धारित करता है, जो एक इष्टतम ओरेकल (optimal oracle) की तुलना में त्रुटिपूर्ण रूप से अनावश्यक कार्यों की सिफारिश करते हैं, और यह प्रदर्शित करता है कि डिसीजन ट्रांसफॉर्मर (Decision Transformers) या एक्सजीबूस्ट (XGBoost) का उपयोग करके सुपरवाइज्ड पॉलिसी लर्निंग (supervised policy learning), इस पूर्वाग्रह को प्रभावी ढंग से समाप्त करती है और उच्च सटीकता तथा कम-विलंबता (low-latency) वाले निर्णय प्राप्त करती है जो उच्च-जोखिम वाले परिनियोजन (high-stakes deployment) के लिए उपयुक्त हैं।

Craig Atkinson2026-06-30✓ Author reviewed
💻 computer science

Covering the Unseen: Information Demand Coverage Optimization for Retrieval-Augmented Generation

यह शोध पत्र GeoRAG का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है, जो सूचना की मांग को एक बहु-आयामी वितरण के रूप में मॉडल करके और इसे दस्तावेज़ कवरेज के सिंकहॉर्न-वासरस्टीन (Sinkhorn-Wasserstein) दूरी को न्यूनतम करके संदर्भ चयन को अनुकूलित करता है, जिससे यह जटिल, मल्टी-हॉप QA बेंचमार्क पर पारंपरिक रैंकिंग-आधारित विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

Bingxue Zhang, Jianying Jia, Feida Zhu2026-06-30
💻 computer science

PHF: Privileged Hidden Flow for On-Policy Self-Distillation

यह शोध पत्र प्रिविलेज्ड हिडन फ्लो (PHF) का प्रस्ताव करता है, जो एक नवीन ऑन-पॉलिसी सेल्फ-डिस्टिलेशन विधि है जो केवल आउटपुट डिस्ट्रीब्यूशन या पॉइंटवाइज हिडन स्टेट्स के बजाय हिडन स्टेट ट्रांजिशन के ज्यामितीय प्रक्षेपवक्र (जियोमेट्रिक ट्रैजेक्टरी) को संरेखित करके रीजनिंग मॉडल ट्रेनिंग में सुधार करती है, जिससे कई मॉडल आकारों में निरंतर प्रदर्शन लाभ प्राप्त होता है।

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun2026-06-30
💻 computer science

When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning

यह शोध पत्र कम्युनिकेटिव लैंग्वेज सिम्बोलिज्म रूटिंग (CLSR) को प्रस्तुत करता है, जो एक टेस्ट-टाइम फ्रेमवर्क है जहाँ कई LLM एजेंट सटीकता-टोकन संतुलन को अनुकूलित करने के लिए स्वायत्त रूप से संक्षिप्त प्रतीकात्मक प्रोटोकॉल विकसित और साझा करते हैं, जिससे चुनौतीपूर्ण बेंचमार्क पर प्रदर्शन बनाए रखते हुए मानक चेन-ऑफ-थॉट रीजनिंग की तुलना में लेटेंसी (विलंबता) में 3–6 गुना कमी आती है।

Zhengqi Pei, Qingming Huang, Shuhui Wang2026-06-30
💻 computer science

Diagnosing and Repairing Factual Errors in RAG under Budget Constraints

यह शोध पत्र D2R-RAG प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) और संसाधन-जागरूक ढांचा है जो व्याख्यात्मक हस्ताक्षरों (interpretable signatures) के माध्यम से विफलताओं का निदान करके और स्पष्ट विलंबता (latency) एवं VRAM सीमाओं के भीतर सुधारात्मक कार्यों को अनुकूल रूप से चुनकर, बजट संबंधी बाधाओं के तहत रिट्रीवल-ऑगमेंटेड जनरेशन की विश्वसनीयता को बढ़ाता है।

Soroush Hashemifar, Havva Alizadeh Noughabi, Fattane Zarrinkalam, Ali Dehghantanha2026-06-30
💻 computer science

Learning to Adaptively Allocate Gaussians for Arbitrary-Scale Image Super-Resolution

यह शोधपत्र QuADA-GS का प्रस्ताव करता है, जो एक नवीन फीड-फॉरवर्ड फ्रेमवर्क है जो स्थानीय छवि जटिलता के आधार पर 2D गॉसियन प्रिमिटिव्स को अनुकूल रूप से आवंटित और सघन करने के लिए एक न्यूरल रूटिंग आर्किटेक्चर और पदानुक्रमित पॉइंटर कनवल्शन का लाभ उठाता है, जिससे उच्च दक्षता और कम विलंबता के साथ अत्याधुनिक произвоल-स्केल (arbitrary-scale) इमेज सुपर-रिज़ॉल्यूशन प्राप्त होता है।

Giulio Federico, Giuseppe Amato, Claudio Gennaro, Fabio Carrara, Marco Di Benedetto2026-06-30
📊 statistics

Self-Organized Conformal Prediction: Reducing Regional Coverage Gaps with Unsupervised Group Discovery

यह शोध पत्र सेल्फ-ऑर्गनाइज्ड कॉन्फॉर्मल प्रेडिक्शन (SOCP) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड कैलिब्रेशन विधि है जो इनपुट-स्पेस समूहों की खोज करने और स्थानीय कैलिब्रेशन करने के लिए सेल्फ-ऑर्गनाइजिंग मैप्स का उपयोग करती है, जिससे प्रेडिक्टर को पुन: प्रशिक्षित किए बिना या सुपरवाइज्ड विभाजनों की आवश्यकता के बिना, सुरक्षा-महत्वपूर्ण उपसमूहों में क्षेत्रीय कवरेज अंतराल को महत्वपूर्ण रूप से कम किया जाता है और सटीक वैधता गारंटी बनाए रखी जाती है।

Louis Berthier, Ahmed Shokry, Maxime Moreaud, Guillaume Ramelet, Aymeric Dieuleveut2026-06-30
💬 NLP

Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning

यह शोध पत्र 'मिक्सचर ऑफ डिबेटर्स' (MoD) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो डिकपल्ड रोल एलोकेशन (decoupled role allocation) और मोमेंटम स्विचिंग (momentum momentum switching) को सक्षम करने के लिए 'मिक्सचर-ऑफ-एक्सपर्ट्स' प्रतिमान का लाभ उठाता है, जिससे पारंपरिक स्टेटिक मल्टी-एजेंट सिस्टम की तुलना में बेहतर सटीकता और दक्षता प्राप्त होती है।

Dayong Liang, Kaisong Gong, Yi Cai, Changmeng Zheng, Xiao-Yong Wei2026-06-30