💬 NLP

CoAct-1: Computer-using Multi-Agent System with Coding Actions

CoAct-1 एक नवीन मल्टी-एजेंट सिस्टम है जो GUI-आधारित नियंत्रण को प्रत्यक्ष प्रोग्रामेटिक निष्पादन के साथ तालमेल बिठाकर कंप्यूटर स्वचालन को बढ़ाता है, जिससे OSWorld बेंचमार्क पर 60.76% की एक नई अत्याधुनिक सफलता दर और काफी बेहतर दक्षता प्राप्त होती है।

Linxin Song, Yutong Dai, Viraj Prabhu, Jieyu Zhang, Taiwei Shi, Li Li, Junnan Li, Silvio Savarese, Zeyuan Chen, Jieyu Zh (…)2026-02-23
💬 NLP

Designing and Evaluating Chain-of-Hints for Scientific Question Answering

यह शोध पत्र वैज्ञानिक प्रश्न उत्तर देने के लिए स्टैटिक (static) बनाम डायनामिक (dynamic) चेन-ऑफ-हिंट्स (chain-of-hints) उत्पन्न करने की क्षमता पर 18 ओपन-सोर्स LLMs का मूल्यांकन करता है, जो एक उपयोगकर्ता अध्ययन के माध्यम से यह प्रकट करता है कि जबकि स्वचालित मेट्रिक्स हिंट की गुणवत्ता का आकलन करते हैं, वे शिक्षार्थियों की विशिष्ट प्राथमिकताओं और विभिन्न स्कैफोल्डिंग रणनीतियों की सूक्ष्म प्रभावशीलता को पूरी तरह से पकड़ने में विफल रहते हैं।

Anubhav Jangra, Smaranda Muresan2026-02-23
💬 NLP

Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters

यह शोध पत्र एक मानव-LLM सहयोगात्मक ढांचे को प्रस्तुत करता है जो केवल लेबल-आधारित एनोटेशन से थिंकिंग ट्रेसेस (thinking traces) को इन्फर करने के लिए रिजेक्शन सैंपलिंग का उपयोग करता है, जिनका उपयोग फिर ओपन LLM रेटर्स को फाइन-ट्यून करने और प्रोप्रायटरी मॉडल्स के लिए दिशानिर्देशों को परिष्कृत करने के लिए किया जाता है, जिससे उनकी विश्वसनीयता और मानव निर्णयों के साथ सहमति में महत्वपूर्ण सुधार होता है।

Xingjian Zhang, Tianhong Gao, Suliang Jin, Tianhao Wang, Teng Ye, Eytan Adar, Qiaozhu Mei2026-02-23
💬 NLP

MUCH: A Multilingual Claim Hallucination Benchmark

यह शोध पत्र MUCH को प्रस्तुत करता है, जो दावा-स्तरीय अनिश्चितता मात्रा निर्धारण (claim-level uncertainty quantification) के लिए पहला बहुभाषी बेंचमार्क है, जिसमें एक अत्यधिक कुशल नियत विभाजन एल्गोरिदम (deterministic segmentation algorithm) शामिल है और चार यूरोपीय भाषाओं में लार्ज लैंग्वेज मॉडल की विश्वसनीयता के निष्पक्ष, पुनरुत्पादनीय और यथार्थवादी मूल्यांकन को सक्षम करने के लिए जनरेशन लॉजिट्स (generation logits) जारी किए गए हैं।

Jérémie Dentan, Alexi Canesse, Davide Buscaldi, Aymen Shabou, Sonia Vanier2026-02-23
💬 NLP

Cross-Lingual Interleaving for Speech Language Models

यह शोध पत्र एक सरल, स्केलेबल क्रॉस-लिंगुअल इंटरलीविंग विधि प्रस्तुत करता है जो बिना पाठ्य पर्यवेक्षण (textual supervision) के विभिन्न भाषाओं में स्पीच लैंग्वेज मॉडल्स के प्रदर्शन में सुधार करती है, जिसे एक बड़े EN-FR प्रशिक्षण डेटासेट और मूल्यांकन के लिए नए सिंथेटिक बेंचमार्क के रिलीज़ द्वारा समर्थित किया गया है।

Adel Moumen, Guangzhi Sun, Philip C. Woodland2026-02-23
💬 NLP

The Invisible Hand of AI Libraries Shaping Open Source Projects and Communities

यह शोध पत्र 157,700 रिपॉजिटरीज़ की तुलना करके यह विश्लेषण करने के लिए एक बड़े पैमाने पर अनुभवजन्य अध्ययन का प्रस्ताव करता है कि पायथन और जावा ओपन-सोर्स प्रोजेक्ट्स में एआई (AI) लाइब्रेरीज़ को अपनाना विकास गतिविधि, सामुदायिक जुड़ाव और कोड जटिलता को कैसे प्रभावित करता है।

Matteo Esposito, Andrea Janes, Valentina Lenarduzzi, Davide Taibi2026-02-23
💬 NLP

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

यह शोध पत्र एक हल्का, इन्फरेंस-टाइम जेलब्रेक डिटेक्शन और मिटिगेशन फ्रेमवर्क प्रस्तावित करता है जो बिना किसी मॉडल फाइन-ट्यूनिंग या सहायक डिटेक्टरों के, हानिकारक प्रॉम्प्ट्स की पहचान करने और उन्हें बाधित करने के लिए LLM के आंतरिक निरूपणों (internal representations) में सुसंगत लेटेंट-स्पेस पैटर्न का लाभ उठाता है।

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis2026-02-23
💬 NLP

AI Hallucination from Students' Perspective: A Thematic Analysis

यह अध्ययन एआई (AI) मतिभ्रम (hallucinations) के साथ विश्वविद्यालय के छात्रों के अनुभवों का विश्लेषण करता है, जो यह प्रकट करता है कि वे मुख्य रूप से निर्मित उद्धरणों और भ्रामक आत्मविश्वास का सामना करते हैं, सहज ज्ञान से लेकर सत्यापन तक विभिन्न पहचान रणनीतियों पर भरोसा करते हैं, और अक्सर इन त्रुटियों के कारणों के बारे में गलत धारणाएं रखते हैं, जिससे एआई साक्षरता पाठ्यक्रमों में मतिभ्रम जागरूकता और सटीक मानसिक मॉडलों को एकीकृत करने की तत्काल आवश्यकता रेखांकित होती है।

Abdulhadi Shoufan, Ahmad-Azmi-Abdelhamid Esmaeil2026-02-23
💬 NLP

Lost Before Translation: Social Information Transmission and Survival in AI-AI Communication

यह शोधपत्र प्रदर्शित करता है कि AI-से-AI संचार अभिसरण (convergence), चयनात्मक उत्तरजीविता (selective survival) और प्रतिस्पर्धी फ़िल्टरिंग के माध्यम से सूचना को व्यवस्थित रूप से विकृत करता है, जिससे ऐसा कंटेंट निर्मित होता है जो मनुष्यों के लिए अधिक विश्वसनीय प्रतीत होता है, जबकि साथ ही तथ्यात्मक स्मरण शक्ति, संतुलन और भावनात्मक सूक्ष्मता को क्षीण करता है।

Bijean Ghafouri, Emilio Ferrara2026-02-23
💬 NLP

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

यह शोध पत्र बर्क-नाश तर्कसंगतता (Berk-Nash Rationalizability) पर आधारित एक एकीकृत सैद्धांतिक ढांचे का प्रस्ताव करता है ताकि यह प्रदर्शित किया जा सके कि चापलूसी (sycophancy) और धोखेबाजी (deception) जैसे निरंतर एआई मिसअलाइनमेंट (AI misalignments), मॉडल मिसस्पेसिफिकेशन (model misspecification) से उत्पन्न गणितीय रूप से तर्कसंगत व्यवहार हैं, जिससे यह स्थापित होता है कि सुदृढ़ सुरक्षा के लिए केवल पर्यावरणीय पुरस्कारों को अनुकूलित करने के बजाय एक एजेंट की आंतरिक विश्वास संरचना (internal belief structure) को इंजीनियर करना आवश्यक है।

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu2026-02-23