💬 NLP

inversedMixup: Data Augmentation via Inverting Mixed Embeddings

यह शोध पत्र inversedMixup का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो टास्क-विशिष्ट और LLM एम्बेडिंग स्पेस को संरेखित करके लेटेंट एम्बेडिंग इंटरपोलेशन और डिस्क्रीट टोकन जनरेशन के बीच के अंतर को पाटता है ताकि मैनिफोल्ड घुसपैठ (manifold intrusion) को कम करते हुए नियंत्रणीय, मानव-व्याख्या योग्य संवर्धित वाक्यों का उत्पादन किया जा सके।

Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu2026-06-10
💬 NLP

RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty

यह शोध पत्र RankLLM का प्रस्ताव करता है, जो एक नवीन ढांचा है जो सूक्ष्म-स्तरीय, स्थिर और कुशल मूल्यांकन को सक्षम करने के लिए द्विदिश स्कोर प्रसार (bidirectional score propagation) के माध्यम से प्रश्न की कठिनाई और मॉडल की सक्षमता दोनों को परिमाणित करता है, जो IRT जैसे मौजूदा बेंचमार्क और बेसलाइन से बेहतर प्रदर्शन करता है।

Ziqian Zhang, Xingjian Hu, Yue Huang, Kai Zhang, Ruoxi Chen, Yixin Liu, Qingsong Wen, Kaidi Xu, Xiangliang Zhang, Neil Z (…)2026-06-10
💬 NLP

ProbeLLM: Automating Principled Diagnosis of LLM Failures

ProbeLLM एक बेंचमार्क-अज्ञेय (benchmark-agnostic) स्वचालित ढांचा है जो पदानुक्रमित मोंटे कार्लो ट्री सर्च (hierarchical Monte Carlo Tree Search) और टूल-संवर्धित सत्यापन (tool-augmented verification) का उपयोग करके LLM विफलताओं को व्यवस्थित रूप से व्याख्या योग्य विफलता मोडों में खोजने, परिष्कृत करने और समेकित करने के लिए नियोजित करता है, जिससे मूल्यांकन अलग-थलग मामलों के पता लगाने से सिद्धांतपूर्ण कमजोरी की खोज की ओर स्थानांतरित हो जाता है।

Yue Huang, Zhengzhe Jiang, Yuchen Ma, Yu Jiang, Xiangqi Wang, Yujun Zhou, Yuexing Hao, Kehan Guo, Pin-Yu Chen, Stefan Fe (…)2026-06-10
💬 NLP

Improving Topic Modeling by Distilling Soft Labels from Language Models

यह शोध पत्र डिस्टिलिंग सॉफ्ट लेबल्स (DSL) नामक एक नवीन टॉपिक मॉडलिंग फ्रेमवर्क प्रस्तावित करता है जो प्रशिक्षण के लिए संदर्भपूर्ण रूप से समृद्ध सॉफ्ट लेबल्स उत्पन्न करने हेतु लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे पारंपरिक विधियों की तुलना में टॉपिक कोहेरेंस (विषय सुसंगतता), असाइनमेंट सटीकता और डॉक्यूमेंट रिट्रीवल प्रदर्शन में महत्वपूर्ण सुधार होता है।

Raymond Li, Amirhossein Abaskohi, Chuyuan Li, Gabriel Murray, Giuseppe Carenini2026-06-10
🤖 AI

An LLM-Native Psychometric Instrument Does Not Predict LLM Behavior: Evidence Across 25 Models

उच्च आंतरिक विश्वसनीयता प्रदर्शित करने के बावजूद, LLM व्यवहार संबंधी सामर्थ्य (behavioral affordances) से व्युत्पन्न एक नवीन साइकोमेट्रिक उपकरण, वास्तविक LLM व्यवहार की भविष्यवाणी करने में विफल रहता है, जो मॉडल के स्व-प्रतिवेदनों (self-reports) और देखे गए कार्यों के बीच एक महत्वपूर्ण विच्छेद को प्रकट करता है जो LLM-एज़-जज मूल्यांकन पाइपलाइनों के लिए एक महत्वपूर्ण जोखिम पैदा करता है।

Juan Manuel Contreras2026-06-10✓ Author reviewed
🤖 machine learning

Mechanistic Analysis of Alignment Algorithms in Language Models

यह शोध पत्र छह प्राथमिकता-अनुकूलन एल्गोरिदम का एक व्यवस्थित यांत्रिक विश्लेषण प्रदान करता है, जो यह प्रकट करता है कि जबकि वे सभी मॉडल व्यवहार को संरेखित करते हैं, वे लेटेंट स्पेस (latent space) में गुणात्मक रूप से भिन्न और आर्किटेक्चर-निर्भर ज्यामितीय रूपांतरण उत्पन्न करते हैं, जिनमें से कुछ विधियाँ विशेषता पृथक्करणीयता (feature separability) को बढ़ाती हैं जबकि अन्य गैर-रचनात्मक रोटेशन के माध्यम से इसे कम करती हैं।

Aarush Sinha, Ishan Garg, Veeraraju Elluru, Arth Singh, Kushal Garg2026-06-10
💬 NLP

Can Multi-Agent LLMs Identify Their Peers? Stylometric Fingerprinting in Role-Constrained Political Analysis

यह शोध पत्र यह प्रदर्शित करता है कि प्रॉम्प्ट-स्तरीय अनामीकरण (anonymization), मल्टी-एजेंट एलएलएम (LLMs) को उनके साथियों के मॉडल परिवारों की पहचान करने से रोकने में विफल रहता है, जो कि सुदृढ़ शैलीमितीय फिंगरप्रिंट्स (stylometric fingerprints) के माध्यम से होता है, यहाँ तक कि सख्त कंटेंट-डिस्जॉइंट सत्यापन स्थितियों के तहत भी, जिससे वर्तमान शमन रणनीतियों को चुनौती मिलती है और यूरोपीय संघ के एआई अधिनियम (EU AI Act) के लिए महत्वपूर्ण अनुपालन संबंधी चिंताएं उत्पन्न होती हैं।

Juergen Dietrich2026-06-10
💬 NLP

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

यह शोध पत्र प्रोग्राम-आधारित पोस्टीरियर ट्रेनिंग (PPT) को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग विधि है जो विविध ओपन-वर्ल्ड परिदृश्यों और वितरण संबंधी सॉफ्ट लेबल (distributional soft labels) को उत्पन्न करने के लिए संभाव्य कार्यक्रमों (probabilistic programs) का लाभ उठाती है, जिससे बड़े भाषा मॉडलों की अनिश्चित आगमनात्मक तर्क (uncertain inductive reasoning) करने की क्षमता और मानवीय निर्णयों के साथ संरेखित होने की क्षमता में महत्वपूर्ण रूप से वृद्धि होती है।

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths2026-06-10
🤖 machine learning

Streaming Knowledge Compilation: Proactive Materiality-Scored Pinning for Time-Evolving LLM Wikis

यह शोध पत्र स्ट्रीमिंग नॉलेज कंपाइलेशन (Streaming Knowledge Compilation) के लिए एक रूपरेखा प्रस्तुत करता है जो एक सीखे गए मटेरियलिटी सिग्नल (materiality signal) के आधार पर दस्तावेजों को सक्रिय रूप से पिन करके विकसित होते कॉर्पोरा (corpora) के लिए कुशल एलएलएम विकी (LLM wikis) बनाए रखता है, जिससे एक सिद्ध O(TlogK)O(\sqrt{T\log K}) रिग्रेट बाउंड (regret bound) प्राप्त होता है और एक नवीन रिग्रेट-आधारित मूल्यांकन मीट्रिक के माध्यम से वित्त और विकिपीडिया डोमेन दोनों में स्थिर बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित होता है।

Juan M. Huerta2026-06-10
💬 NLP

Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History

यह शोध पत्र एंग्राम (Engram) को पेश करता है, जो एक ओपन-सोर्स बाइटेंपोरल मेमोरी इंजन है जो एक लॉसलेस राइट पाथ को बाइटेंपोरल नॉलेज ग्राफ से कॉम्पैक्ट, प्रोवेनेंस-टैग्ड कॉन्टेक्स्ट को असेंबल करने वाली एक हाइब्रिड रीड स्ट्रैटेजी के साथ जोड़कर सटीकता और दक्षता में फुल-कॉन्टेक्स्ट बेसलाइन्स से बेहतर प्रदर्शन करता है, जिससे काफी कम टोकन का उपयोग करते हुए LongMemEval_S पर 83.6% स्कोर प्राप्त होता है।

Liuyin Wang2026-06-10