💬 NLP

StoryScope: Investigating idiosyncrasies in AI fiction

यह शोधपत्र स्टोरीस्कोप (StoryScope) को प्रस्तुत करता है, जो एक ऐसा पाइपलाइन है जो शैलीगत संकेतों पर निर्भर रहने के बजाय विमर्श-स्तरीय कथा विशेषताओं—जैसे कि पात्रों की एजेंसी और कालिक जटिलता—का विश्लेषण करके एआई-जनित कथा साहित्य को मानव लेखन से उच्च सटीकता के साथ अलग करता है, जिससे यह प्रकट होता है कि एआई कहानियाँ अत्यधिक स्पष्टीकरण वाली और संरचनात्मक रूप से एकसमान होती हैं जबकि मानव कहानियाँ अधिक नैतिक अस्पष्टता और विविधता प्रदर्शित करती हैं।

Jenna Russell, Rishanth Rajendhran, Mohit Iyyer, John Wieting2026-04-06
💬 NLP

Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation

यह शोध पत्र दीर्घ-रूप (long-form) LLM जनरेशन के लिए एक व्यापक तथ्यात्मकता मूल्यांकन ढांचे का प्रस्ताव करता है जो सटीकता (precision) और महत्व-जागरूक रिकॉल (importance-aware recall) को संयुक्त रूप से मापता है, जिससे यह पता चलता है कि वर्तमान मॉडल उच्च सटीकता प्रदर्शन के बावजूद तथ्यात्मक पूर्णता के साथ महत्वपूर्ण रूप से संघर्ष करते हैं।

Nazanin Jafari, James Allan, Mohit Iyyer2026-04-06
💬 NLP

Valence-Arousal Subspace in LLMs: Circular Emotion Geometry and Multi-Behavioral Control

यह शोध पत्र एक ऐसी विधि प्रस्तुत करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के भीतर एक वैलेंस-अराउज़ल (valence-arousal) उप-स्थान (सबस्पेस) की पहचान करती है जो मानव भावना धारणा के अनुरूप गोलाकार ज्यामिति प्रदर्शित करता है, जिससे कई आर्किटेक्चरों में दोनों भावनात्मक आयामों और इनकार (refusal) एवं चापलूसी (sycophancy) जैसे विशिष्ट व्यवहारिक लक्षणों पर एकदिष्ट नियंत्रण (monotonic control) सक्षम होता है।

Lihao Sun, Lewen Yan, Xiaoya Lu, Andrew Lee, Jie Zhang, Jing Shao2026-04-06
💬 NLP

BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation

यह शोध पत्र सर्च-सक्षम (search-enabled) LLMs में साइटेशन मतिभ्रम (citation hallucinations) का मूल्यांकन करने के लिए एक व्यापक बेंचमार्क और त्रुटि वर्गीकरण (error taxonomy) प्रस्तुत करता है, जो यह प्रकट करता है कि पैरामीट्रिक मेमोरी पर निर्भरता के कारण अत्याधुनिक मॉडल भी हाल के शोध पत्रों के मामले में संघर्ष करते हैं, और यह प्रदर्शित करता है कि ओपन-सोर्स `clibib` टूल का उपयोग करने वाली एक दो-चरणीय शमन रणनीति (two-stage mitigation strategy) प्रतिगमन (regression) को कम करते हुए BibTeX सटीकता में महत्वपूर्ण सुधार करती है।

Delip Rao, Chris Callison-Burch2026-04-06
💬 NLP

Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स और डीप रिसर्च एजेंट्स में साइटेशन यूआरएल (citation URLs) की वैधता का व्यवस्थित रूप से मूल्यांकन करता है, जो विभिन्न डोमेन में हैलुसिनेशन (hallucination) और काम न करने वाले लिंक्स की महत्वपूर्ण दरों को प्रकट करता है, और यह प्रदर्शित करता है कि `urlhealth` नामक एक ओपन-सोर्स टूल एजेंटिक सेल्फ-करेक्शन (agentic self-correction) के माध्यम से इन त्रुटियों को 79 गुना तक प्रभावी ढंग से कम कर सकता है।

Delip Rao, Eric Wong, Chris Callison-Burch2026-04-06
🤖 machine learning

PRISM: LLM-Guided Semantic Clustering for High-Precision Topics

यह शोध पत्र PRISM को प्रस्तुत करता है, जो एक लागत प्रभावी टॉपिक मॉडलिंग फ्रेमवर्क है जो वेब-स्केल टेक्स्ट विश्लेषण के लिए उच्च-परिशुद्धता, व्याख्या योग्य सिमेंटिक क्लस्टरिंग प्राप्त करने हेतु स्पार्स LLM सुपरविजन को एक हल्के सेंटेंस एनकोडर में संकुचित (distill) करता है।

Connor Douglas, Utkucan Balci, Joseph Aylett-Bullock2026-04-06
💬 NLP

Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization

यह शोध पत्र विश्वसनीयता-जागरूक मल्टी-टीचर डिस्टिलेशन तकनीकों, विशेष रूप से EWAD और CPDP को पेश करता है, जो शिक्षक सहमति के आधार पर पर्यवेक्षण को गतिशील रूप से रूट करने और ज्यामितीय बाधाओं को संरक्षित करने के माध्यम से कम-संसाधन वाले एब्स्ट्रैक्टिव समराइजेशन को अनुकूलित करने के लिए है, जो अंततः यह प्रदर्शित करता है कि लॉजिट-लेवल नॉलेज डिस्टिलेशन सबसे विश्वसनीय प्रदर्शन लाभ प्रदान करता है और लंबे आउटपुट पर जटिल डिस्टिलेशन की सीमाओं और एकल-जज मूल्यांकन में पूर्वाग्रहों को उजागर करता है।

Dipto Sumit, Ankan Kumar Roy, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Yousuf Sadeque2026-04-06
💬 NLP

Learning the Signature of Memorization in Autoregressive Language Models

यह शोध पत्र Learned Transfer MIA (LT-MIA) को प्रस्तुत करता है, जो पहला हस्तांतरणीय (transferable) सीखा हुआ मेंबरशिप इन्फरेंस अटैक (membership inference attack) है, जो फाइन-ट्यूनिंग द्वारा उत्पन्न अपरिवर्तनीय "मेमोराइजेशन के सिग्नेचर" (signature of memorization) का लाभ उठाकर, हैंड-क्राफ्टेड ह्यूरिस्टिक्स या शैडो मॉडल्स पर निर्भर रहे बिना, विविध आर्किटेक्चरल परिवारों (मैम्बा और RWKV सहित) और डेटा डोमेन (प्राकृतिक भाषा और कोड) में उत्कृष्ट, ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त करता है।

David Ilić, Kostadin Cvejoski, David Stanojević, Evgeny Grigorenko2026-04-06
💻 computer science

Analyzing Language Bias Between French and English in Conventional Multilingual Sentiment Analysis Models

स्टैटिस्टिक्स कनाडा के पूर्वाग्रह संबंधी विचारों से प्रेरित, यह अध्ययन संतुलित फ्रेंच-अंग्रेजी डेटासेट पर SVM और नैव बेयस (Naive Bayes) मॉडलों का उपयोग करता है ताकि यह प्रकट किया जा सके कि जहाँ फ्रेंच सेंटिमेंट क्लासिफिकेशन अक्सर अंग्रेजी से बेहतर प्रदर्शन करता है, वहीं फेयरलर्न (Fairlearn) मेट्रिक्स संकेत देते हैं कि SVM भाषाओं के बीच लगभग समान उपचार प्राप्त करता है जबकि नैव बेयस अधिक असमानता प्रदर्शित करता है, जो निष्पक्ष बहुभाषी एनएलपी (NLP) प्रणालियों को विकसित करने की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Ethan Parker Wong, Faten M'hiri2026-04-03
⚡ electrical engineering

J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling

यह शोध पत्र J-CHAT को प्रस्तुत करता है, जो एक स्वचालित पद्धति का उपयोग करके YouTube और पॉडकास्ट डेटा से निर्मित 76,000-घंटे का एक ओपन-सोर्स जापानी स्पोकन डायलॉग कॉर्पस है, जो मौजूदा डेटासेट की सीमाओं को संबोधित करता है और उन्नत स्पोकन डायलॉग सिस्टम को प्रशिक्षित करने में प्रभावशीलता प्रदर्शित करता है।

Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari2026-04-03