💬 NLP

What sentiment analysis can't see: Measuring whether customers were helped, and what went wrong, across 70,000 support conversations

यह शोध पत्र यह प्रदर्शित करता है कि संतुष्टि और विशिष्ट समस्याओं के लिए ग्राहक सहायता बातचीत का विश्लेषण करने हेतु उन्नत LLMs का उपयोग करना पारंपरिक सेंटिमेंट एनालिसिस (sentiment analysis) की तुलना में काफी अधिक सटीक और कार्रवाई योग्य अंतर्दृष्टि प्रदान करता है, जो अक्सर ग्राहक के लहजे और वास्तविक समाधान सफलता के बीच अंतर करने में विफल रहता है।

Jason Potteiger2026-06-19
💬 NLP

Closing the Calibration Gap in Semantic Caching

यह शोध पत्र तर्क देता है कि सिमेंटिक कैशिंग मॉडल चयन मौलिक रूप से एक रैंकिंग समस्या के बजाय एक कैलिब्रेशन समस्या है, यह प्रदर्शित करते हुए कि मानक मेट्रिक्स जैसे कि PR-AUC खराब परिनियोजन विकल्पों की ओर ले जाते हैं और ऑफलाइन मूल्यांकन एवं परिचालन प्रदर्शन के बीच के अंतर को पाटने के लिए नए मेट्रिक्स (P-CHR AUC और CRR) का प्रस्ताव देता है।

Aditeya Baral, Radoslav Ralev, Iliya Sotirov Zhechev, Srijith Rajamohan, Jen Agarwal2026-06-19
💬 NLP

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

यह शोध पत्र प्रदर्शित करता है कि क्रमिक डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) पहले से सीखे गए प्रेफरेंस को समान रूप से खराब नहीं करता है, बल्कि उद्देश्यों, सिग्नल की शक्ति और प्रशिक्षण क्रम के बीच संबंध के आधार पर स्थिरता से लेकर सकारात्मक हस्तांतरण तक के विविध परिणाम उत्पन्न करता है, जबकि यह भी प्रकट करता है कि ग्रेडिएंट विरोध इन प्रभावों का प्राथमिक चालक नहीं है।

Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim2026-06-19
🤖 AI

Benchmarking Agentic Review Systems

यह शोध पत्र मानव गुणवत्ता निर्णयों और इंजेक्ट की गई त्रुटियों के विरुद्ध कई एजेंटिक समीक्षा प्रणालियों का बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि हालांकि उन्हें अभी भी सुधार की आवश्यकता है, फिर भी OpenAIReview (GPT-5.5 के साथ) जैसे शीर्ष कॉन्फ़िगरेशन प्रभावी रूप से पेपर की गुणवत्ता को ट्रैक करते हैं, अधिकांश त्रुटियों का पता लगाते हैं, और वास्तविक उपयोगकर्ताओं से सकारात्मक प्रतिक्रिया प्राप्त करते हैं।

Dang Nguyen, Wanqing Hao, Yanai Elazar, Chenhao Tan2026-06-19
🤖 machine learning

Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models

यह शोध पत्र बेयसियन मैनिफोल्ड करिकुलम (BMC) प्रस्तुत करता है, जो एक संरचना-जागरूक ढांचा है जो कार्यों के बीच निहित ज्यामितीय संबंधों का लाभ उठाकर, केवल कठिनाई-आधारित चयन पर निर्भर रहने के बजाय, सीखने की उत्पादकता, कार्य विविधता और मूल्यांकन उपयोगिता के बीच संतुलन को अनुकूलित करने के लिए LLM सुदृढीकरण शिक्षण (reinforcement learning) में समस्या नमूनाकरण (problem sampling) को एक मैनिफोल्ड-संरचित बैंडिट समस्या के रूप में पुनर्गठित करता है।

Darrien McKenzie, Nicklas Hansen, Xiaolong Wang2026-06-19
🤖 AI

AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA

AgentFinVQA एक तैनात करने योग्य, मल्टी-एजेंट पाइपलाइन है जो विनियमित वातावरण के लिए डेटा रेजिडेंसी सुनिश्चित करते हुए और ट्रैसेबल वेरिफिकेशन प्रदान करते हुए FinMME बेंचमार्क पर स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त करता है जो ऑडिट करने योग्य वित्तीय चार्ट प्रश्न उत्तर (क्वेश्चन अनस्वर्सिंग) के लिए है।

Aravind Narayanan, Shaina Raza2026-06-19
🤖 AI

Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning

यह शोध पत्र \sevra को प्रस्तुत करता है, जो एक सर्विंग-लेयर कंट्रोलर है जो सटीकता और कंप्यूट लागत के बीच संतुलन बनाने के लिए चयनात्मक रूप से सत्यापन (verification) को लागू करता है, यह प्रदर्शित करते हुए कि जबकि चयनात्मक रिकवरी हमेशा चालू रहने वाले सत्यापन की तुलना में हानिकारक बदलावों (harmful flips) और टोकन उपयोग को कम करती है, प्रारंभिक रीजनिंग बजट को अनुकूलित करना अक्सर एक बेहतर लागत-सटीकता सीमा (cost-accuracy frontier) प्रदान करता है।

Sajib Acharjee Dip, Dawei Zhou, Liqing Zhang2026-06-19
💬 NLP

Clusters are All You Need: Pre-Training the Tsetlin Machine with Semantic Clusters from Language Models for Interpretability

यह शोध पत्र एक सिमेंटिक प्री-ट्रेनिंग फ्रेमवर्क का प्रस्ताव करता है जो सिमेंटिक क्लस्टरिंग के माध्यम से भाषा मॉडलों से प्रासंगिक ज्ञान को व्याख्यात्मक (interpretable) टसेटलिन मशीन (Tsetlin Machine) में स्थानांतरित करता है, जिससे पूर्ण पारदर्शिता बनाए रखते हुए BERT के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Jiechao Gao, Rohan Kumar Yadav, Yuangang Li, Yuandong Pan, Jie Wang, Ying Liu, Michael Lepech2026-06-19
💬 NLP

Leverage Is Not Reach: A Control-Window Law for Single-Neuron Steering in Language Models

यह शोध पत्र एक "कंट्रोल-विंडो लॉ" (control-window law) प्रस्तुत करता है जो एक बजट-सामान्यीकृत ढांचा स्थापित करता है ताकि यह भविष्यवाणी की जा सके कि भाषा मॉडलों में एकल-न्यूरॉन हस्तक्षेप कब आउटपुट पतन (output collapse) का कारण बने बिना रिफ्यूज़ल (refusal) जैसे व्यवहारों को सुसंगत रूप से निर्देशित करेगा, जो यह प्रकट करता है कि नियंत्रणीयता (controllability) एक प्रकारित, बजट वाली संपत्ति है न कि एक साधारण स्केलर डोज़।

Hongliang Liu2026-06-19
💬 NLP

AtomMem: Building Simple and Effective Memory System for LLM Agents via Atomic Facts

AtomMem एक नवीन दीर्घकालिक स्मृति प्रणाली है जो LLM एजेंटों के लिए, उच्च-मूल्य वाले परमाणु तथ्यों (atomic facts) को निकालने, उन्हें पदानुक्रमित संरचनाओं में व्यवस्थित करने और पुनर्प्राप्ति के लिए एक साहचर्य ग्राफ (associative graph) का उपयोग करने के माध्यम से प्रदर्शन और स्थिरता को बढ़ाती है, जिससे LoCoMo बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त होते हैं।

Yanyu Yao, Shangze Li, Zhi Zheng, Hui Zheng, Qi Liu, Tong Xu, Enhong Chen2026-06-19