💻 computer science

Semantically Enriching Investor Micro-blogs for Opinion-Aware Emotion Analysis: A Practical Approach

यह शोध पत्र StockTwits से प्राप्त अर्थपूर्ण संरचित ओपिनियन ग्राफ्स के माध्यम से StockEmotions डेटासेट को संवर्धित करके निवेशक माइक्रो-ब्लॉग विश्लेषण को बढ़ाने के लिए एक व्यावहारिक दृष्टिकोण प्रस्तावित करता है, जो यह प्रदर्शित करता है कि ग्राफ न्यूरल नेटवर्क के माध्यम से इन ओपिनियन सिमेंटिक्स को एकीकृत करना भावना वर्गीकरण प्रदर्शन में महत्वपूर्ण रूप से सुधार करता है।

Gaurav Negi, Paul Buitelaar2026-05-06
💻 computer science

PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization

Piiguard एक वेबपेज-स्तरीय रक्षा तंत्र है जो अनुकूलित छिपे हुए HTML अंशों का उपयोग करता है ताकि LLMs को संपर्क संबंधी PII (व्यक्तिगत पहचान योग्य सूचना) का खुलासा करने से दूर रखा जा सके, जिससे सौहार्दपूर्ण प्रश्नों के लिए उपयोगिता बनाए रखते हुए डेटा रिसाव को रोकने में उच्च सफलता दर प्राप्त की जा सके।

Mingshuo Liu, Yiwei Zha, Min Chen2026-05-06
💻 computer science

Effective Performance Measurement: Challenges and Opportunities in KPI Extraction from Earnings Calls

यह शोध पत्र नए बेंचमार्क पेश करके, संरचित SEC फाइलिंग पर प्रशिक्षित मॉडलों की सीमाओं को प्रदर्शित करके और एक मानव-सत्यापित LLM-आधारित प्रणाली प्रस्तावित करके, असंरचित अर्निंग कॉल ट्रांसक्रिप्ट से मुख्य प्रदर्शन संकेतकों (KPIs) को निकालने की चुनौतियों का समाधान करता है, जो ओपन-एंडेड सूचना निष्कर्षण के लिए 79.7% परिशुद्धता प्राप्त करता है।

Rasmus T. Aavang, Rasmus Tjalk-Bøggild, Alexandre Iolov, Giovanni Rizzi, Mike Zhang, Johannes Bjerva2026-05-06
🤖 machine learning

OCRR: A Benchmark for Online Correction Recovery under Distribution Shift

यह शोध पत्र OCRR को प्रस्तुत करता है, जो वितरण बदलाव (distribution shift) के तहत ऑनलाइन सुधार रिकवरी (online correction recovery) के मूल्यांकन के लिए एक नया बेंचमार्क है, और यह प्रदर्शित करता है कि प्रस्तावित हैश-चेन्ड अपेंड-ओनली सबस्ट्रेट (hash-chained append-only substrate) मौजूदा निरंतर-सीखने (continual-learning) और फाइन-ट्यूनिंग बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है, क्योंकि यह न्यूनतम मेमोरी ओवरहेड के साथ मूल डेटा पर प्रदर्शन बनाए रखते हुए नई श्रेणियों पर उच्च सटीकता भी प्राप्त करता है।

Adrian Grassi2026-05-06
💻 computer science

Geometric Deviation as an Unsupervised Pre-Generation Reliability Signal: Probing LLM Representations for Answerability

यह लेख प्रदर्शित करता है कि गणित और कोड जैसे संरचित डोमेन में अनउत्तरदायी (unanswerable) प्रश्नों का पता लगाने के लिए जनरेशन से पूर्व, एक उत्तरयोग्य संदर्भ सेट से हिडन स्टेट्स (hidden states) के ज्यामितीय विचलन को मापना एक विश्वसनीय, अनसुपरवाइज्ड सिग्नल प्रदान करता है, हालांकि यह प्रभाव तथ्यात्मक प्रॉम्प्ट्स पर सामान्यीकृत नहीं होता है।

Yucheng Du2026-05-06
💻 computer science

MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory

यह शोध पत्र MAGE को प्रस्तुत करता है, जो एक नवीन रक्षात्मक ढांचा (defensive framework) है जो सुरक्षा-महत्वपूर्ण संदर्भ (safety-critical context) को सक्रिय रूप से संकुचित करने और LLM एजेंटों में दीर्घकालिक खतरों (long-horizon threats) का पता लगाने के लिए एक समर्पित "शैडो मेमोरी" (shadow memory) का लाभ उठाता है, जिससे नगण्य ओवरहेड के साथ उच्च पहचान सटीकता प्राप्त होती है।

Yuhui Wang, Tanqiu Jiang, Jiacheng Liang, Charles Fleming, Ting Wang2026-05-06
💻 computer science

TeamUp: Semantic Project Matching and Team Formation for Learning at Scale

यह शोधपत्र TeamUp को प्रस्तुत करता है, जो एक हल्का, एम्बेडिंग-आधारित सिस्टम है जो संज्ञानात्मक रूप से विविध छात्र टीमों को स्वचालित रूप से बनाने और उन्हें उपयुक्त रूप से चुनौतीपूर्ण परियोजनाओं के साथ संरेखित करने के लिए सिमेंटिक मैचिंग और हाइब्रिड रैंकिंग एल्गोरिदम का लाभ उठाता है, जिससे बड़े पैमाने पर प्रोजेक्ट-आधारित पाठ्यक्रमों में मैच की गुणवत्ता, समानता और सीखने के परिणामों में महत्वपूर्ण सुधार होता है।

Dhruv Gulwani, Basem Suleiman, Aditya Joshi, Sonit Singh2026-05-06
💻 computer science

S^2tory: Story Spine Distillation for Movie Script Summarization

यह शोध पत्र S^2tory को प्रस्तुत करता है, जो एक नैरेटोलॉजी-आधारित ढांचा है जो गैर-रेखीय (non-linear) मूवी स्क्रिप्ट से आवश्यक कथानक नाभिक (plot nuclei) को निकालने के लिए चरित्र विकास प्रक्षेपवक्र (character development trajectories) और एक सिद्धांत-प्रतिबंधित तर्क एजेंट का लाभ उठाता है, जिससे उच्च अर्थपूर्ण निष्ठा के साथ अत्याधुनिक संक्षेपण प्रदर्शन प्राप्त होता है।

Mingzhe Lu, Yanbing Liu, Qihao Wang, Jiarui Zhang, Jiayue Wu, Yue Hu, Yunpeng Li, Yangyan Xu2026-05-06
💻 computer science

LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models

यह शोध पत्र LLM-XTM का प्रस्ताव करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो बेहतर टॉपिक कोहेरेंस (विषय सुसंगतता) और अलाइनमेंट प्राप्त करने के लिए LLM-निर्देशित रिफाइनमेंट को सेल्फ-कंसिस्टेंसी अनसर्टेंटी क्वांटिफिकेशन के साथ एकीकृत करके क्रॉस-लिंगुअल टॉपिक मॉडल्स को उन्नत करता है, जबकि द्विभाषी संसाधनों और महंगी LLM कॉल्स पर निर्भरता को कम करता है।

Minh Chu Xuan, Tien-Phat Nguyen, Linh Ngo Van, Dinh Viet Sang, Nguyen Thi Ngoc Diep, Trung Le2026-05-06
💻 computer science

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

यह शोध पत्र साइड-बाय-साइड (SxS) इंटरलीव्ड रीजनिंग (Interleaved Reasoning) का परिचय देता है, जो एक ऐसा ढांचा है जो लार्ज लैंग्वेज मॉडल्स को जनरेशन के दौरान कंटेंट प्रकटीकरण के समय को गतिशील रूप से नियंत्रित करने में सक्षम बनाता है ताकि विचार-विमर्श के समय और समयपूर्व प्रतिबद्धता के बीच के संतुलन को सुधारा जा सके, जिससे विभिन्न बेंचमार्क पर सटीकता-विलंबता (accuracy-latency) प्रदर्शन में सुधार होता है।

Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You2026-05-06