🤖 machine learning

To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

यह शोध पत्र BlendIn को पेश करता है, जो एक इन्फरेंस-टाइम अलाइनमेंट फ्रेमवर्क है जो बाइनरी गाइडेंस इंटरवेंशन के स्थान पर एक संभाव्य ब्लेंडिंग दृष्टिकोण का उपयोग करके मॉडल की सुरक्षा और दक्षता में सुधार करता है, जो उनके आकलित विश्वसनीयता के आधार पर कई मॉडलों के योगदान को गतिशील रूप से भारित (weight) करता है।

Jin Gan, Xin Li, Jun Luo2026-06-11
🤖 machine learning

Dual-Stance Evaluation of Sycophancy: The Structure of Agreement and the Limits of Intervention

यह शोध पत्र एक दोहरी-दृष्टिकोण (dual-stance) मूल्यांकन पद्धति प्रस्तुत करता है जो यह प्रकट करता है कि एलएलएम (LLM) में चाटुकारिता (sycophancy) को कम करने के उद्देश्य से की जाने वाली एक्टिवेशन स्टीयरिंग (activation steering), तथ्यात्मक सत्यों के साथ सहमत होने और चाटुकारितापूर्ण संकेतों के साथ सहमत होने के बीच अंतर करने में विफल रहती है, जिससे वे दोनों प्रकार की सहमति को अनियंत्रित रूप से दबा देती है, बावजूद इसके कि वे ज्यामितीय रूप से भिन्न उप-स्थानों (subspaces) में प्रतिनिधित्व रखती हैं।

Matthew James Buchan2026-06-11
💬 NLP

BioDivergence: A Benchmark and Evaluation Framework for Hidden Contextual Contradictions in Biomedical Abstracts

यह शोध पत्र BioDivergence को प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा और बेंचमार्क है जिसे एक छह-वर्ग संघर्ष वर्गीकरण (six-class conflict taxonomy) और एक 13-अक्ष विचलन ऑन्टोलॉजी (13-axis divergence ontology) का उपयोग करके बायोमेडिकल एब्स्ट्रैक्ट्स में संदर्भ-निर्भर वैज्ञानिक असहमतियों को वास्तविक विरोधाभासों से अलग करने के लिए डिज़ाइन किया गया है, ताकि सूक्ष्म दावा सत्यापन (nuanced claim verification) पर मॉडल के प्रदर्शन का बेहतर आकलन किया जा सके।

Elias Hossain, Sanjeda Sara Jennifer, Sabera Akter Bushra, Niloofar Yousefi2026-06-11
💬 NLP

T2MM: An LLM Supported Architecture For Inquiry-Based Modeling

यह शोध पत्र T2MM को प्रस्तुत करता है, जो एक LLM-समर्थित आर्किटेक्चर है जो VERA सॉफ़्टवेयर के भीतर इंटरैक्टिव, समायोज्य वैज्ञानिक मॉडलों को उत्पन्न करके पूछताछ-आधारित शिक्षण (inquiry-based learning) को बढ़ाता है, और पारंपरिक पूर्ण कोड जनरेशन बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

John Kos, Rudra Singh, Ashok Goel2026-06-11
💻 computer science

The Environmental Cost of LLMs in AIED: Reporting and Practices

यह शोध पत्र आर्टिफिशियल इंटेलिजेंस इन एजुकेशन (AIED) में लार्ज लैंग्वेज मॉडल्स की छिपी हुई कम्प्यूटेशनल और पर्यावरणीय लागतों पर मानकीकृत रिपोर्टिंग की कमी को रेखांकित करता है और एक ओपन-सोर्स फ्रेमवर्क प्रस्तावित करता है, जिसमें इन प्रभावों को व्यवस्थित रूप से मापने और पारदर्शी रूप से रिपोर्ट करने के लिए सॉफ्टवेयर टूल्स और गणना सूत्र शामिल हैं।

Sabrina C. Eimler, Lukas Erle, Daniel Flood, Aditi Haiman, Luca Häckert, André Helgert, Lachlan McGinness, Büsra Yapici2026-06-11
💻 computer science

Preregistration for Experiments with AI Agents

यह शोध पत्र पद्धतिगत कमजोरियों को कम करने और विश्वसनीयता बढ़ाने के लिए एआई एजेंटों के साथ प्रयोगों में प्री-रजिस्ट्रेशन प्रथाओं को अनिवार्य रूप से अपनाने का समर्थन करता है, साथ ही मॉडल चयन और प्रॉम्प्ट इंजीनियरिंग जैसे विशिष्ट शोधकर्ता स्वतंत्रता स्तरों (researcher degrees of freedom) को संबोधित करने के लिए एक अनुकूलित टेम्पलेट भी प्रदान करता है।

Michelle Vaccaro2026-06-11
💬 NLP

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

यह शोध पत्र 'एफ्रिसपीच सिमेंटिक्स' (Afrispeech Semantics) प्रस्तुत करता है, जो एक व्यापक मूल्यांकन ढांचा है जो विविध कार्यों, डोमेन और लहजों में सिमेंटिक तर्क करने की ऑडियो लैंग्वेज मॉडल्स की क्षमता का आकलन करता है, जो लहजे की भिन्नता, डोमेन शिफ्ट और सिमेंटिक ओवर-इन्फरेंस के संबंध में वर्तमान मॉडल्स की महत्वपूर्ण सीमाओं को उजागर करता है।

Chibuzor Okocha, Christan Grant2026-06-11
💬 NLP

Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

यह शोध पत्र "मोरल ट्रॉली एरिना" (Moral Trolley Arena) प्रस्तुत करता है, जो एक दो-चरणीय बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक एलएलएम (LLMs) नैतिक संकेतों को उनके निर्णयों में एक सुसंगत रूप से संकुचित, गैर-योगात्मक तंत्र के माध्यम से संयोजित करते हैं न कि सरल योग के माध्यम से, जो यह सुझाव देता है कि नैतिक मूल्यांकनों को अलग-थलग कार्यों की रैंकिंग के साथ-साथ इन संयोजन नियमों पर भी ध्यान केंद्रित करना चाहिए।

Weijia Zhang, Ruiqi Chen, Yunze Xiao, Weihao Xuan2026-06-11
💻 computer science

SPEAR: A System for Post-Quantization Error-Adaptive Recovery Enabling Efficient Low-Bit LLM Serving

SPEAR एक ऐसी प्रणाली है जो रणनीतिक रूप से पहचाने गए संवेदनशील परतों पर हल्के, इनपुट-अनुकूली त्रुटि क्षतिपोषकों (error compensators) को तैनात करके लो-बिट LLM सर्विंग को उन्नत करती है, जो विशेष कर्नेल फ्यूजन और शेड्यूलिंग के माध्यम से न्यूनतम मेमोरी ओवरहेड और स्थिर विलंबता बनाए रखते हुए क्वांटाइजेशन-प्रेरित गुणवत्ता अंतराल को प्रभावी रूप से पुनर्प्राप्त करती है।

Hongyuan Liu, Yawei Li, Zhiqiang Que, Qinli Yang, Junming Shao, Guosheng Hu2026-06-11
🤖 AI

Position: Hippocampal Explicit Memory Is the Cornerstone for AGI

यह शोध पत्र यह तर्क देता है कि लार्ज लैंग्वेज मॉडल्स को आर्टिफिशियल जनरल इंटेलिजेंस की ओर अग्रसर करने के लिए हिप्पोकैम्पस जैसी स्पष्ट स्मृति प्रणालियों (hippocampal-like explicit memory systems) को एकीकृत करना आवश्यक है, क्योंकि उच्च-स्तरीय संज्ञानात्मक कार्य जैसे कि रणनीतिक योजना और मेटाकॉग्निशन, वर्तमान में एलएलएम (LLMs) के आधारभूत अंतर्निहित अंतर्निहित सांख्यिकीय शिक्षण तंत्रों (implicit statistical learning mechanisms) से अकेले उभर नहीं सकते हैं।

Sangjun Park2026-06-11