💬 NLP

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

यह शोध पत्र "रिप्रजेंटेशन-एज़-अ-जज" (Representation-as-a-Judge) का प्रस्ताव करता है, जो एक प्रतिमान परिवर्तन है जहाँ छोटे भाषा मॉडल आउटपुट का कुशलतापूर्वक और सटीक रूप से मूल्यांकन करने के लिए सतही पीढ़ी (surface generation) के बजाय आंतरिक छिपी हुई अवस्थाओं (internal hidden states) का लाभ उठाते हैं, जो इस परिकल्पना पर आधारित है कि मूल्यांकन के लिए पीढ़ी की तुलना में काफी कम अर्थ संबंधी क्षमता (semantic capacity) की आवश्यकता होती है।

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Da (…)2026-07-10
💬 NLP

Towards Isolated Interventions via Almost Orthogonal Features in Language Models

यह शोध पत्र एक ऑर्थोगोनैलिटी रेगुलराइजेशन (orthogonality regularization) विधि का प्रस्ताव और सत्यापन करता है जो भाषा मॉडल के फीचर्स को लगभग ऑर्थोगोनल होने के लिए बाध्य करती है, जिससे फीचर एंटैंगलमेंट (feature entanglement) कम होता है और मॉडल के प्रदर्शन से समझौता किए बिना अधिक विश्वसनीय, पृथक कारण संबंधी हस्तक्षेप (causal interventions) सक्षम होते हैं।

Moritz Miller, Florent Draye, Bernhard Schölkopf2026-07-10
⚡ electrical engineering

Communication-Efficient Byzantine-Robust Federated Conformal Prediction via Partial Model Sharing

यह शोध पत्र PRISM-FCP का प्रस्ताव करता है, जो एक संचार-कुशल फेडेरेटेड कॉन्फॉर्मल प्रेडिक्शन फ्रेमवर्क है जो प्रशिक्षण के दौरान आंशिक मॉडल साझाकरण और अंशांकन (कैलिब्रेशन) के दौरान हिस्टोग्राम-आधारित फ़िल्टरिंग का उपयोग करके एंड-टू-एंड बायज़ेंटाइन हमलों को कम करता है ताकि कम संचार ओवरहेड के साथ सटीक अनिश्चितता परिमाणीकरण बनाए रखा जा सके।

Ehsan Lari, Reza Arablouei, Stefan Werner2026-07-10
📊 statistics

A Stochastic--Geometric Theory of Scaling Laws in Grokking

यह शोध पत्र एक स्टोकेस्टिक-जियोमेट्रिक सिद्धांत प्रस्तावित करता है जो ग्रोकिंग (grokking) को एडम (Adam) के पैरामीटर स्पेस के भीतर एक मेमोराइजेशन शेल (memorization shell) से जनरलाइजेशन कोर (generalization core) में अनुकूलन-प्रेरित संक्रमण (optimization-induced transition) के रूप में समझाता है, जिससे लर्निंग रेट, बैच साइज और रेगुलराइजेशन के आधार पर डिले टाइम (delay time) के लिए स्केलिंग लॉ (scaling laws) को व्युत्पन्न और मान्य किया जाता है।

Róisín Luo, Christian Gagné, Jonas Ngnawé, Ihsan Ullah, Karyn Morrissey2026-07-10
🤖 machine learning

LLM for the development of FCM

यह शोध पत्र प्रदर्शित करता है कि एक स्थानीय लार्ज लैंग्वेज मॉडल (Qwen2.5-32B), अनफ़िल्टर्ड ट्रिपएडवाइजर होटल समीक्षाओं से मात्रात्मक डेटा निकालने के लिए और एक डेटा-संचालित फजी कॉग्निटिव मैप (Fuzzy Cognitive Map) का निर्माण एवं सत्यापन करने के लिए, जो समीक्षकों की प्राथमिकताओं को स्टार रेटिंग के साथ प्रभावी ढंग से सह-संबंधित करता है, का उपयोग कर सकता है।

Alexis Kafantaris2026-07-10
💻 computer science

Towards the Explainability of Temporal Graph Networks via Memory Backtracking and Topological Attribution

यह शोध पत्र MemExplainer का प्रस्ताव करता है, जो एक नवीन ढांचा (framework) है जो टोपोलॉजी एट्रिब्यूशन (topology attribution) और मेमोरी बैकट्रैकिंग ट्रीज़ (memory backtracking trees) को पेश करके टेम्पोरल ग्राफ नेटवर्क्स की व्याख्यात्मकता (explainability) को बढ़ाता है ताकि भविष्यवाणियों पर ऐतिहासिक घटनाओं के प्रभाव को मापा जा सके, जिससे यह विभिन्न टेम्पोरल ग्राफ कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Yazheng Liu, Xi Zhang, Sihong Xie, Hui Xiong2026-07-10
💻 computer science

Who Gets Missed in the Tail? Thresholded Subgroup Underdiagnosis in Long-Tailed Chest X-ray Classification

यह शोधपत्र यह प्रदर्शित करता है कि लॉन्ग-टेल्ड चेस्ट एक्स-रे वर्गीकरण में, स्वीकार्य रैंकिंग मेट्रिक्स विशिष्ट उपसमूहों के भीतर दुर्लभ सकारात्मक मामलों के गंभीर अंडरडायग्नोसिस (कम निदान) को छिपा सकते हैं, जिसके लिए विविध रोगी जनसांख्यिकी में फॉल्स नेगेटिव रेट को महत्वपूर्ण रूप से कम करने हेतु सबग्रुप-अवेयर वेटिंग और टेल-विशिष्ट थ्रेशोल्ड चयन के एक संयुक्त दृष्टिकोण की आवश्यकता होती है।

Ha-Hieu Pham, Hai-Dang Nguyen, Dang P. M. Cao, Thanh-Huy Nguyen, Min Xu, Trung-Nghia Le, Ulas Bagci, Huy-Hieu Pham2026-07-10
💻 computer science

LLT: Local Linear Transformer for PDE Operator Learning

यह शोध पत्र लोकल लीनियर ट्रांसफॉर्मर (LLT) को प्रस्तुत करता है, जो एक नवीन न्यूरल ऑपरेटर आर्किटेक्चर है जो विविध विविक्तीकरणों (discretizations) और मेश प्रकारों में PDE समाधान मानचित्रों को कुशलतापूर्वक और सटीक रूप से सीखने के लिए लीनियर ग्लोबल अटेंशन को लोकल स्पेशियल मिक्सिंग के साथ जोड़ता है, जबकि यह मानक ट्रांसफॉर्मर्स में निहित क्वाड्रेटिक स्केलिंग और स्थानीय पूर्वाग्रह (local bias) की कमी को दूर करता है।

Oded Ovadia, Eli Turkel2026-07-10
💻 computer science

ReCoLoRA: Spectrum-Aware Recursive Consolidation for Continual LLM Fine-Tuning

ReCoLoRA एक स्पेक्ट्रम-जागरूक निरंतर फाइन-ट्यूनिंग फ्रेमवर्क है जो प्रभावी भारों (weights) को फ्रोजन अवशेषों (frozen residuals) और अपडेटेड प्रिंसिपल कंपोनेंट्स में पुन: विघटित करके लो-रैंक एडेप्टर्स को पुनरावर्ती रूप से समेकित करता है, जिससे कैटास्ट्रोफिक फॉरगेटिंगिंग को रोका जा सकता है और मौजूदा विधियों की तुलना में कम मापदंडों के साथ बेहतर प्रदर्शन प्राप्त किया जा सकता है।

Wentao Lu2026-07-10
💻 computer science

Uncertainty-gated selection for block-sparse attention

यह शोध पत्र ब्लॉक-स्पार्स अटेंशन के लिए एक अनसर्टेन्टी-गेटेड राउटर पेश करता है जो अस्पष्ट टॉप-के (top-k) स्कोर वाले क्वेरीज़ के लिए चयनित की-ब्लॉक्स (key blocks) को गतिशील रूप से विस्तारित करता है, जिससे कई मॉडल आर्किटेक्चर में लगभग-डेंस (near-dense) दक्षता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट रिट्रीवल सटीकता और रिकॉल में महत्वपूर्ण सुधार होता है।

Thomas Rossi2026-07-10