💬 NLP

SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy

यह शोध पत्र SWAY को पेश करता है, जो भाषा मॉडल के चाटुकारिता (sycophancy) को मापने के लिए एक अनसुपरवाइज्ड काउंटरफैक्चुअल मेट्रिक है, और यह प्रदर्शित करता है कि एक काउंटरफैक्चुअल चेन-ऑफ-थॉट शमन रणनीति इस पूर्वाग्रह को वास्तविक साक्ष्य के प्रति प्रतिक्रियाशीलता से समझौता किए बिना लगभग शून्य तक प्रभावी ढंग से कम करती है।

Joy Bhalla, Kristina Gligorić2026-04-06
🤖 AI

Generative AI Use in Entrepreneurship: An Integrative Review and an Empowerment-Entrapment Framework

यह शोध पत्र उद्यमी प्रक्रिया के दौरान जनरेटिव एआई (GenAI) के प्रभाव की एक एकीकृत समीक्षा प्रस्तुत करता है, जो एक 'एम्पावरमेंट-एंट्रैपमेंट फ्रेमवर्क' (सशक्तीकरण-जाल फ्रेमवर्क) प्रस्तावित करता है जो यह दर्शाता है कि कैसे GenAI विचार की गुणवत्ता और उत्पादकता जैसी क्षमताओं को बढ़ाता है और साथ ही मतिभ्रम (hallucinations) और क्षीण होती आलोचनात्मक सोच जैसे जोखिमों को भी पेश करता है, जो मेटाकॉग्निशन और डोमेन विशेषज्ञता जैसे कारकों द्वारा नियंत्रित होते हैं।

Jackson G. Lu, Gerui Gloria Zhao, Anna Manyi Zheng2026-04-06
🤖 AI

Corporations Constitute Intelligence

यह शोध पत्र एंथ्रोपिक के अपने एआई मॉडल के लिए 2026 के "संविधान" की एक संरचनात्मक रूप से त्रुटिपूर्ण कॉर्पोरेट गवर्नेंस दस्तावेज़ के रूप में आलोचना करता है जो महत्वपूर्ण सैन्य संदर्भों को बाहर करता है और लोकतांत्रिक विचार-विमर्श को रोकता है, यह तर्क देते हुए कि ऐसी पारदर्शिता उस लुप्त लोकतांत्रिक वैधता का विकल्प नहीं हो सकती है जो एआई व्यवहार को नियंत्रित करने वाले सिद्धांतों को स्थापित करने के लिए आवश्यक है।

Gilad Abiri2026-04-06
💬 NLP

Verbalizing LLMs' assumptions to explain and control sycophancy

यह शोध पत्र "वर्बलाइज्ड अज़म्पशन्स" (Verbalized Assumptions) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह उजागर करता है कि कैसे उपयोगकर्ता के इरादे (जैसे कि पुष्टि चाहना) के बारे में LLMs की गलत धारणाएं उनके चापलूसीपूर्ण व्यवहार (sycophantic behavior) को प्रेरित करती हैं, जिससे इन सुरक्षा संबंधी मुद्दों में गहरी अंतर्दृष्टि और व्याख्या योग्य स्टीयरिंग (interpretable steering) के माध्यम से उन पर कारण-आधारित नियंत्रण संभव हो पाता है।

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky (…)2026-04-06
💬 NLP

Valence-Arousal Subspace in LLMs: Circular Emotion Geometry and Multi-Behavioral Control

यह शोध पत्र एक ऐसी विधि प्रस्तुत करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के भीतर एक वैलेंस-अराउज़ल (valence-arousal) उप-स्थान (सबस्पेस) की पहचान करती है जो मानव भावना धारणा के अनुरूप गोलाकार ज्यामिति प्रदर्शित करता है, जिससे कई आर्किटेक्चरों में दोनों भावनात्मक आयामों और इनकार (refusal) एवं चापलूसी (sycophancy) जैसे विशिष्ट व्यवहारिक लक्षणों पर एकदिष्ट नियंत्रण (monotonic control) सक्षम होता है।

Lihao Sun, Lewen Yan, Xiaoya Lu, Andrew Lee, Jie Zhang, Jing Shao2026-04-06
🤖 machine learning

Fair Representation in Parliamentary Summaries: Measuring and Mitigating Inclusion Bias

यह शोध पत्र यूरोपीय संसद की बहसों का सारांश निकालने वाले पांच बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का मूल्यांकन करता है, जो क्रम, भाषा और राजनीतिक संबद्धता के आधार पर वक्ताओं के विरुद्ध व्यवस्थित पूर्वाग्रहों को प्रकट करता है, और एक पदानुक्रमित सारांशीकरण पद्धति प्रस्तावित करता है ताकि उन समावेशी पूर्वाग्रहों को प्रभावी ढंग से कम किया जा सके जहाँ प्रॉम्प्टिंग रणनीतियाँ विफल हो जाती हैं।

Eoghan Cunningham, James Cross, Derek Greene2026-04-03
💻 computer science

The First Mass Protest on Threads: Multimodal Mobilization and AI-Generated Visuals in Taiwan's Bluebird Movement

यह अध्ययन ताइवान में 2024 के ब्लूबर्ड मूवमेंट का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि कैसे थ्रेड्स (Threads) प्लेटफॉर्म ने विशिष्ट पाठ्य और दृश्य रणनीतियों के माध्यम से युवा नेतृत्व वाले विरोध प्रदर्शनों को प्रवर्धित किया, विशेष रूप से यह प्रदर्शित करते हुए कि कैसे एआई-जनित "कावई टॉक्सिसिटी" (राजनीतिक हमलों के लिए उपयोग की जाने वाली प्यारी सौंदर्यशास्त्र/क्यूट एस्थेटिक्स) और पक्षपाती विषमताओं ने लोकतांत्रिक लामबंदी और प्रतीकात्मक रिपर्टोइर को नया आकार दिया।

Tracy Weener, Ho-Chun Herbert Chang2026-04-03
💬 NLP

Large Language Models in the Abuse Detection Pipeline

यह सर्वेक्षण पत्र दुरुपयोग पहचान जीवनचक्र (Abuse Detection Lifecycle) के चार चरणों—लेबल और फीचर जनरेशन, डिटेक्शन, रिव्यू और अपील्स, तथा ऑडिटिंग और गवर्नेंस—में लार्ज लैंग्वेज मॉडल्स के एकीकरण का विश्लेषण करता है, साथ ही विश्वसनीय, बड़े पैमाने की सुरक्षा प्रणालियों की तैनाती के मार्गदर्शन हेतु वर्तमान प्रथाओं, वास्तुशिल्प संबंधी विचारों और लेटेंसी एवं निष्पक्षता जैसी प्रमुख चुनौतियों को संश्लेषित करता है।

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta2026-04-03
💻 computer science

Do Agents Repair When Challenged -- or Just Reply? Challenge, Repair, and Public Correction in a Deployed Agent Forum

यह शोध पत्र प्रकट करता है कि एक तैनात एलएलएम एजेंट फोरम (मोलबुक) उन चुनौती, मरम्मत और सार्वजनिक सुधार तंत्रों को बनाए रखने में विफल रहता है जो रेडिट जैसे मानव समुदायों में पाए जाते हैं, जो यह दर्शाता है कि वास्तविक सामाजिक संरेखण के लिए केवल मानदंड-जागरूक भाषा के उत्पादन के बजाय मानदंडों के प्रवर्तन के लिए संवादात्मक प्रक्रियाओं की आवश्यकता होती है।

Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan2026-04-03
💻 computer science

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

यह शोध पत्र एलएलएम (LLM) आउटपुट विविधता पर खंडित शोध को एकीकृत करने के लिए "मैजिक, मैडनेस, हेवन, सिन" (Magic, Madness, Heaven, Sin) ढांचे को प्रस्तुत करता है, जो चार मानक संदर्भों (ज्ञानमीमांसीय, संवादात्मक, सामाजिक और सुरक्षा) में एक समरूपता-विषमता अक्ष के साथ भिन्नता को मॉडल करता है, जिससे यह तर्क दिया जाता है कि विविधता का मूल्यांकन एक अंतर्निहित मॉडल विशेषता के बजाय एक कार्य-निर्भर गुण के रूप में किया जाना चाहिए।

Harnoor Dhingra2026-04-03