💬 NLP

More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists

यद्यपि एक सहयोगात्मक ढांचे में LLM एजेंटों की संख्या बढ़ाने से गणितीय समस्या-समाधान की सटीकता विश्वसनीय रूप से सुधरती है, फिर भी यह प्रतिकूल व्यवधानों, विशेष रूप से मानवीय त्रुटियों (typos) के विरुद्ध महत्वपूर्ण मजबूती के अंतर को पाटने में विफल रहता है।

Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi2026-03-17
💬 NLP

MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers

यह शोध पत्र MedPT को प्रस्तुत करता है, जो 384,095 ब्राज़ीलियाई पुर्तगाली रोगी-डॉक्टर अंतःक्रियाओं का पहला बड़े पैमाने पर, वास्तविक दुनिया का संग्रह है, जिसे निष्पक्ष, सांस्कृतिक रूप से जागरूक चिकित्सा एआई मॉडल को प्रशिक्षित करने में इसकी प्रभावशीलता प्रदर्शित करने के लिए कठोरता से क्यूरेट और मान्य किया गया है।

Fernanda Bufon Färber, Iago Alves Brito, Julia Soares Dollis, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sou (…)2026-03-17
💬 NLP

Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation

यह शोध पत्र एक पुनरुत्पादक पाइपलाइन प्रस्तुत करता है जो स्थानीय सरकारी बैठकों की सार्वजनिक ज़ूम रिकॉर्डिंग को वक्ता-आरोपित, क्रिया-जागरूक ट्रांसक्रिप्ट में परिवर्तित करता है, जिससे बहु-पक्षीय नागरिक विचार-विमर्श सिमुलेशन में काफी उच्च निष्ठा और यथार्थवाद प्राप्त करने के लिए एलएलएम (LLM) को फाइन-ट्यून करना सक्षम होता है।

Scott Merrill, Shashank Srivastava2026-03-17
💬 NLP

Reason2Decide: Rationale-Driven Multi-Task Learning

Reason2Decide एक दो-चरणीय, तर्क-संचालित मल्टी-टास्क लर्निंग फ्रेमवर्क है जो क्लिनिकल निर्णय सहायता में एक्सपोज़र बायस को प्रभावी ढंग से कम करता है और स्पष्टीकरणों को भविष्यवाणियों के साथ संरेखित करता है, जो समकालीन फाउंडेशन मॉडल्स की तुलना में 40 गुना छोटे मॉडल्स का उपयोग करके मेडिकल डेटासेट्स पर बेहतर सटीकता और फिडेलिटी प्राप्त करता है।

H M Quamran Hasan, Housam Khalifa Bashier, Jiayi Dai, Mi-Young Kim, Randy Goebel2026-03-17
💬 NLP

On the Existence and Behavior of Secondary Attention Sinks

यह शोध पत्र "सेकेंडरी अटेंशन सिंक्स" (secondary attention sinks) को विशिष्ट, क्षणिक घटनाओं के रूप में पहचानता और अभिलक्षणित करता है जो विशिष्ट MLP-प्रेरित वेक्टर संरेखणों के कारण ट्रांसफॉर्मर मॉडलों की मध्य परतों में उभरते हैं, जो मॉडल स्केल्स के across उनके नियत पैटर्न और कमजोर होते प्राथमिक सिंक्स के साथ उनकी गतिशील परस्पर क्रिया को प्रकट करते हैं।

Jeffrey T. H. Wong, Cheng Zhang, Louis Mahon, Wayne Luk, Anton Isopoussu, Yiren Zhao2026-03-17
💬 NLP

GHaLIB: A Multilingual Framework for Hope Speech Detection in Low-Resource Languages

यह शोध पत्र GHaLIB प्रस्तुत करता है, जो एक बहुभाषी फ्रेमवर्क है जो कम-संसाधन वाली भाषाओं में आशावादी भाषा (hope speech) को प्रभावी ढंग से पहचानने के लिए XLM-RoBERTa और UrduBERT जैसे प्रीट्रेन ट्रांसफॉर्मर मॉडल का लाभ उठाता है, और उर्दू, स्पेनिश, जर्मन और अंग्रेजी में PolyHope-M 2025 बेंचमार्क पर मजबूत प्रदर्शन प्राप्त करता है।

Ahmed Abdullah, Sana Fatima, Haroon Mahmood2026-03-17
💬 NLP

Task Arithmetic with Support Languages for Low-Resource ASR

यह शोध पत्र उच्च-संसाधन सहायता वाली भाषाओं से प्राप्त फाइन-ट्यून्ड व्हिस्पर (Whisper) मॉडल वेक्टर्स को टास्क अरिथमेटिक (task arithmetic) का उपयोग करके रैखिक रूप से संयोजित करके, लो-रिसोर्स ऑटोमैटिक स्पीच रिकग्निशन में सुधार करने की एक विधि प्रस्तावित करता है, जिससे 23 लक्षित भाषाओं में वर्ड एरर रेट (word error rate) में 10% तक की कमी आती है।

Emma Rafkin, Dan DeGenaro, Xiulin Yang2026-03-17
💬 NLP

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

यह शोध पत्र इमेजिन-देन-प्लान (ITP) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो एक नवीन अनुकूली लुकअहेड तंत्र के माध्यम से एक पॉलिसी मॉडल को वर्ल्ड मॉडल के साथ एकीकृत करके एजेंट प्लानिंग को बढ़ाता है, जिससे जटिल, आंशिक रूप से दृश्यमान वातावरण में निर्णय लेने के मार्गदर्शन के लिए बहु-चरणीय कल्पित प्रक्षेप पथों (इमेजिन्ड ट्राजेक्टरीज) का निर्माण सक्षम होता है।

Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li2026-03-17
💬 NLP

Multi-Agent LLMs for Generating Research Limitations

यह शोधपत्र एक मल्टी-एजेंट एलएलएम (LLM) फ्रेमवर्क प्रस्तावित करता है जो ओपनरिव्यू (OpenReview) टिप्पणियों, लेखक प्रकटीकरणों और उद्धरण संदर्भों को संश्लेषित करके व्यवस्थित रूप से सारगर्भित अनुसंधान सीमाओं को उत्पन्न करता है, जो ज़ीरो-शॉट मॉडलों की सतहीता को संबोधित करता है और कवरेज को बेहतर ढंग से मापने के लिए एक एलएलएम-आधारित मूल्यांकन प्रोटोकॉल पेश करता है।

Ibrahim Al Azher, Zhishuai Guo, Hamed Alhoori2026-03-17
💬 NLP

BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models

यह शोध पत्र बेबीरीज़निंगबेंच (BabyReasoningBench) प्रस्तुत करता है, जो क्लासिक मनोविज्ञान प्रतिमानों से प्रेरित 19 रीजनिंग कार्यों वाला एक विकासात्मक रूप से आधारित बेंचमार्क है, जो यह प्रकट करता है कि बाल-निर्देशित भाषण (child-directed speech) पर प्रशिक्षित बेबी लैंग्वेज मॉडल्स में असमान तर्क क्षमताएं होती हैं जो कारण संबंधी (causal) और भौतिक कार्यों पर स्केलिंग के साथ तो सुधरती हैं, लेकिन विश्वास आरोपण (belief attribution) और व्यावहारिक अर्थ विज्ञान (pragmatics) में चुनौतियों का सामना करती रहती हैं।

Kaustubh D. Dhole2026-03-17