💬 NLP

From tools to thieves: Measuring and understanding public perceptions of AI through crowdsourced metaphors

यह अध्ययन एक राष्ट्रीय स्तर के प्रतिनिधि अमेरिकी नमूने से प्राप्त 12,000 से अधिक क्राउडसोर्स किए गए रूपकों (metaphors) का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि एआई (AI) के प्रति सार्वजनिक धारणाएं तेजी से मानव रूपी, आत्मीय और सक्षम होती जा रही हैं, और ये अंतर्निहित विचार एवं विशिष्ट रूपक विश्वास और अपनापन (adoption) का पुरजोर पूर्वानुमान लगाते हैं, जबकि महत्वपूर्ण जनसांख्यिकीय असमानताओं को भी उजागर करते हैं।

Myra Cheng, Angela Y. Lee, Kristina Rapuano, Kate Niederhoffer, Alex Liebscher, Jeffrey Hancock2026-04-06
💬 NLP

ELEPHANT: Measuring and understanding social sycophancy in LLMs

यह शोध पत्र "सामाजिक चाटुकारिता" (social sycophancy) की अवधारणा प्रस्तुत करता है, जिसे उपयोगकर्ता की वांछित आत्म-छवि के अत्यधिक संरक्षण के रूप में परिभाषित किया गया है, और ELEPHANT बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान मॉडल इस व्यवहार की काफी उच्च दर प्रदर्शित करते हैं, जो अक्सर विरोधाभासी उपयोगकर्ता दृष्टिकोणों की पुष्टि करते हैं और सुसंगत नैतिक निर्णयों को बनाए रखने में विफल रहते हैं।

Myra Cheng, Sunny Yu, Cinoo Lee, Pranav Khadpe, Lujain Ibrahim, Dan Jurafsky2026-04-06
💬 NLP

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

यह शोध पत्र "प्रीफिलिंग अटैक" (prefilling attack) को एक सरल, पैरामीटर-मुक्त तकनीक के रूप में पुन: उपयोग करने का प्रस्ताव देता है जो मॉडल आउटपुट के आगे एक संरचित प्राकृतिक-भाषा प्रीफ़िक्स जोड़ता है, जिससे उच्च दक्षता बनाए रखते हुए बहुविकल्पीय प्रश्नोत्तर के लिए प्रथम-टोकन संभाव्यता मूल्यांकन की सटीकता, अंशांकन (calibration) और विश्वसनीयता में महत्वपूर्ण सुधार होता है।

Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Ri (…)2026-04-06
💬 NLP

StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs

यह शोध पत्र StructEval प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें 18 प्रारूप और 44 कार्य प्रकार शामिल हैं जो गैर-रेंडर करने योग्य (non-renderable) और रेंडर करने योग्य (renderable) दोनों प्रकार के संरचित आउटपुट को उत्पन्न करने और परिवर्तित करने की LLMs की क्षमता का मूल्यांकन करता है, जो महत्वपूर्ण प्रदर्शन अंतराल को उजागर करता है जहाँ अत्याधुनिक मॉडल भी संरचनात्मक निष्ठा (structural fidelity) के साथ संघर्ष करते हैं, विशेष रूप से जनरेशन और विजुअल कंटेंट कार्यों में।

Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe (…)2026-04-06
💬 NLP

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

यह शोध पत्र IFRAgent को प्रस्तुत करता है, जो प्रदर्शनों (demonstrations) से स्पष्ट और अंतर्निहित मानवीय इरादा प्रवाह (human intention flows) को पहचानने के लिए MobileIAR डेटासेट का लाभ उठाता है, जिससे व्यक्तिगत मोबाइल-उपयोग एजेंट उत्पन्न होते हैं जो उपयोगकर्ता के इरादे के साथ संरेखित होने और कार्यों को पूरा करने में बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang2026-04-06
💬 NLP

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

यह शोध पत्र VeriOS को प्रस्तुत करता है, जो एक क्वेरी-संचालित फ्रेमवर्क और एजेंट है जो अविश्वसनीय परिदृश्यों में सक्रिय रूप से मनुष्यों से प्रश्न पूछकर OS ऑटोमेशन की विश्वसनीयता को बढ़ाता है, जो सामान्य प्रदर्शन से समझौता किए बिना बेसलाइन्स की तुलना में स्टेप-वाइज सफलता दर में 19.72% का महत्वपूर्ण सुधार प्राप्त करता है।

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxian (…)2026-04-06
💬 NLP

SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLP

यह शोधपत्र SciNLP को प्रस्तुत करता है, जो विशेष रूप से NLP डोमेन के लिए तैयार किया गया एंटिटी और रिलेशन एक्सट्रैक्शन के लिए पहला फुल-टेक्स्ट बेंचमार्क है, जो 60 वैज्ञानिक प्रकाशनों के व्यापक मैनुअल एनोटेशन के माध्यम से समृद्ध, सूक्ष्म-स्तरीय नॉलेज ग्राफ के निर्माण को सक्षम करके मौजूदा सेक्शन-विशिष्ट डेटासेट्स की सीमाओं को संबोधित करता है।

Decheng Duan, Yingyi Zhang, Jitong Peng, Chengzhi Zhang2026-04-06
💬 NLP

What Is The Political Content in LLMs' Pre- and Post-Training Data?

यह शोध पत्र एलएलएम (LLM) प्रशिक्षण डेटा में राजनीतिक सामग्री की जांच करता है और पाता है कि प्री-ट्रेनिंग कॉर्पोरा व्यवस्थित रूप से वामपंथी दृष्टिकोणों की ओर झुके हुए हैं, जिसमें ये पूर्वाग्रह पोस्ट-ट्रेनिंग चरणों के माध्यम से बने रहते हैं और मॉडल के परिणामी राजनीतिक रुख के साथ दृढ़ता से सह-संबंधित होते हैं, जिससे मॉडल के व्यवहार को आकार देने में डेटा संरचना की महत्वपूर्ण भूमिका उजागर होती है।

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza2026-04-06
🤖 machine learning

LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning

LiME एक हल्का (lightweight) मिचर ऑफ एक्सपर्ट्स फ्रेमवर्क है जो कुशल मल्टीमॉडल मल्टी-टास्क लर्निंग के लिए है, जो आउटपुट मॉड्यूलेशन और ज़ीरो-पैरामीटर रूटिंग के माध्यम से विशेषज्ञ विशिष्टता (expert specialization) प्राप्त करता है, जिससे 47 विविध कार्यों में प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए प्रशिक्षण योग्य मापदंडों (trainable parameters) और प्रशिक्षण समय को काफी कम कर दिया जाता है।

Md Kowsher, Haris Mansoor, Nusrat Jahan Prottasha, Ozlem Garibay, Victor Zhu, Zhengping Ji, Chen Chen2026-04-06
🤖 machine learning

SIEVE: Sample-Efficient Parametric Learning from Natural Language

यह शोध पत्र SIEVE का प्रस्ताव करता है, जो एक नमूना-कुशल (sample-efficient) पैरामीट्रिक लर्निंग पद्धति है जो एक नवीन सिंथेटिक डेटा जनरेशन पाइपलाइन (SIEVE-GEN) का लाभ उठाती है ताकि प्राकृतिक भाषा के संदर्भ को विघटित किया जा सके और मात्र तीन क्वेरी उदाहरणों के साथ इसे मॉडल के भार (weights) में आत्मसात किया जा सके, जो तर्क संबंधी कार्यों (reasoning tasks) में पूर्ववर्ती डिस्टिलेशन विधियों से बेहतर प्रदर्शन करता है।

Parth Asawa, Alexandros G. Dimakis, Matei Zaharia2026-04-06