💬 NLP

Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models

यह शोध पत्र यह प्रदर्शित करता है कि सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना (Reinforcement Learning with Verifiable Rewards - RLVR), जो मॉडलों को अनिश्चित प्रश्नों का उत्तर देने से बचने के लिए स्पष्ट रूप से प्रोत्साहित करता है, तथ्यात्मक बेंचमार्क पर सटीकता से समझौता किए बिना बड़े भाषा मॉडलों में मतिभ्रम (hallucinations) को प्रभावी रूप से कम करता है और बौद्धिक विनम्रता में सुधार करता है।

Abha Jha, Akanksha Mahajan, Ashwath Vaithinathan Aravindan, Praveen Saravanan, Sai Sailaja Policharla, Sonal Chaturbhuj (…)2026-01-29
⚡ electrical engineering

Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR

यह शोध पत्र प्रदर्शित करता है कि डेल्टा SSL एम्बेडिंग्स (जो प्रीट्रेंड और फाइन-ट्यून्ड मॉडल्स के बीच टास्क-विशिष्ट बदलावों को कैप्चर करती हैं) को मानक एम्बेडिंग्स के साथ फ्यूज करना, बाल ऑटोमैटिक स्पीच रिकग्निशन प्रदर्शन में महत्वपूर्ण सुधार करता है, जिससे MyST कॉर्पस पर एक नया स्टेट-ऑफ-द-आर्ट वर्ड एरर रेट प्राप्त होता है।

Zilai Wang, Natarajan Balaji Shankar, Kaiyuan Zhang, Zihan Wang, Abeer Alwan2026-01-29
💬 NLP

Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction

यह शोध पत्र Me-Agent प्रस्तुत करता है, जो एक व्यक्तिगत मोबाइल एजेंट है जो अस्पष्ट निर्देशों की व्याख्या करने और व्यक्तिगत आवश्यकताओं को संभालने की सीमाओं को दूर करने के लिए दो-स्तरीय उपयोगकर्ता आदत शिक्षण दृष्टिकोण का लाभ उठाता है—जिसमें प्रॉम्प्ट-स्तरीय प्राथमिकता शिक्षण के लिए एक पर्सनल रिवॉर्ड मॉडल और दीर्घकालिक एवं ऐप-विशिष्ट मेमोरी स्टोरेज के लिए एक पदानुक्रमित प्राथमिकता मेमोरी शामिल है—और नए प्रस्तावित User FingerTip बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Shuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Xinyi Zeng, Jingyuan Zhang, Yu Tian2026-01-29
💬 NLP

Automated Benchmark Generation from Domain Guidelines Informed by Bloom's Taxonomy

यह शोध पत्र विशेषज्ञ दिशानिर्देशों का उपयोग करके ब्लूम के वर्गीकरण (Bloom's Taxonomy) के माध्यम से स्केलेबल, साइकोमेट्रिक रूप से सूचित बेंचमार्क को स्वचालित रूप से उत्पन्न करने के लिए एक ढांचे को प्रस्तुत करता है ताकि अभ्यास-आधारित डोमेन में एलएलएम (LLM) के संदर्भीकृत तर्क का मूल्यांकन किया जा सके, जो गैर-सहज प्रदर्शन पैटर्न को प्रकट करता है जहाँ मॉडल कभी-कभी उच्च-स्तरीय विश्लेषण में उत्कृष्ट होते हैं लेकिन बुनियादी रिकॉल (recall) में संघर्ष करते हैं।

Si Chen, Le Huy Khiem, Annalisa Szymanski, Ronald Metoyer, Ting Hua, Nitesh V. Chawla2026-01-29
💬 NLP

SoftHateBench: Evaluating Moderation Models Against Reasoning-Driven, Policy-Compliant Hostility

यह शोध पत्र SoftHateBench प्रस्तुत करता है, जो 28 लक्षित समूहों के विरुद्ध तर्क-संचालित 'सॉफ्ट-हेट स्पीच' (मृदु-घृणा भाषण) बनाने के लिए 'आर्ग्युमेंटम मॉडल ऑफ टॉपिक्स' और 'रिलिवेंस थ्योरी' का उपयोग करने वाला एक जनरेटिव बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडरेशन सिस्टम तब शत्रुता का पता लगाने में विफल रहते हैं जब इसे प्रत्यक्ष अपशब्दों के बजाय सूक्ष्म, नीति-अनुपालक तर्कों के माध्यम से व्यक्त किया जाता है।

Xuanyu Su, Diana Inkpen, Nathalie Japkowicz2026-01-29
💬 NLP

One Word is Enough: Minimal Adversarial Perturbations for Neural Text Ranking

यह शोध पत्र प्रदर्शित करता है कि न्यूरल टेक्स्ट रैंकिंग मॉडल अत्यंत सूक्ष्म, क्वेरी-जागरूक प्रतिकूल हमलों (adversarial attacks) के प्रति अत्यधिक संवेदनशील हैं जो केवल एक अर्थपूर्ण रूप से संरेखित शब्द को सम्मिलित या प्रतिस्थापित करके लक्षित दस्तावेजों को सफलतापूर्वक बढ़ावा दे सकते हैं, जो मध्य-रैंक वाले दस्तावेजों में भेद्यता के एक महत्वपूर्ण "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) को प्रकट करता है और मजबूत सुरक्षा उपायों की तत्काल आवश्यकता पर प्रकाश डालता है।

Tanmay Karmakar, Sourav Saha, Debapriyo Majumdar, Surjyanee Halder2026-01-29
⚡ electrical engineering

MiLorE-SSL: Scaling Multilingual Capabilities in Self-Supervised Models without Forgetting

MiLorE-SSL एक हल्का ढांचा (lightweight framework) है जो LoRA मॉड्यूल को सॉफ्ट मिक्सचर-ऑफ-एक्सपर्ट्स मैकेनिज्म और सीमित रिप्ले डेटा के साथ जोड़कर सेल्फ-सुपरवाइज्ड स्पीच मॉडल्स में कुशल निरंतर बहुभाषी प्रशिक्षण सक्षम करता है, ताकि केवल 2.14% प्रशिक्षण योग्य मापदंडों के साथ नई और मौजूदा भाषाओं में मजबूत प्रदर्शन प्राप्त करते हुए कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम किया जा सके।

Jing Xu, Minglin Wu, Xueyuan Chen, Xixin Wu, Helen Meng2026-01-29
💬 NLP

PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments

PsychePass एक एकीकृत ढांचा है जो क्लाइंट सिमुलेशन को एंकर करने और मजबूत एलो (Elo) रेटिंग और रिवॉर्ड सिग्नल उत्पन्न करने के लिए स्विस-सिस्टम टूर्नामेंट लागू करके मानसिक स्वास्थ्य देखभाल में एलएलएम (LLM) के मूल्यांकन और प्रशिक्षण को बढ़ाता है, जिससे वर्तमान असंरचित मूल्यांकन प्रतिमानों की अस्थिरता को दूर किया जा सके।

Zhuang Chen, Dazhen Wan, Zhangkai Zheng, Guanqun Bi, Xiyao Xiao, Binghang Li, Minlie Huang2026-01-29
💬 NLP

Hopes and Fears -- Emotion Distribution in the Topic Landscape of Finnish Parliamentary Speech 2000-2020

यह शोध पत्र 2000 से 2020 तक के फिनिश संसदीय भाषणों में विभिन्न विषयों के माध्यम से भावनाओं की अभिव्यक्ति का विश्लेषण करता है, जो विषय-विशिष्ट भावनात्मक पैटर्न और समय के साथ बढ़ती सकारात्मकता के प्रमाण को प्रकट करता है।

Anna Ristilä, Otto Tarkka, Veronika Laippala, Kimmo Elo2026-01-29
💬 NLP

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL एक नवीन दो-चरणीय ढांचा है जो जटिल मल्टीहॉप टूल उपयोग के लिए लार्ज लैंग्वेज मॉडल्स की योजना बनाने और निष्पादन करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए ऑफलाइन टूल एक्सप्लोरेशन को ऑनलाइन ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) के साथ जोड़ता है, जिससे ToolHop बेंचमार्क पर 56.5% की एक नई स्टेट-ऑफ-द-आर्ट सफलता दर प्राप्त होती है।

Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu2026-01-29