💬 NLP

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

यह शोध पत्र रिफ्लेक्टिव टेस्ट-टाइम प्लानिंग (Reflective Test-Time Planning) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एम्बोडीड एलएलएम (embodied LLMs) को रिफ्लेक्शन-इन-एक्शन (reflection-in-action), रिफ्लेक्शन-ऑन-एक्शन (reflection-on-action), और रेट्रोस्पेक्टिव रिफ्लेक्शन (retrospective reflection) को एकीकृत करके उन्नत बनाता है ताकि बार-बार होने वाले प्रयास-और-त्रुटि (trial-and-error) को संचयी अनुभव में बदला जा सके, जिससे लॉन्ग-होरिज़ॉन टास्क परफॉर्मेंस (long-horizon task performance) और व्यवहार संबंधी सुधार में महत्वपूर्ण रूप से सुधार होता है।

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Jiajun Wu, Yejin Choi2026-02-25
💬 NLP

PoTeC: A German Naturalistic Eye-tracking-while-reading Corpus

पोट्सडैम टेक्स्टबुक कॉर्पस (PoTeC) एक नवीन, ओपन-एक्सेस जर्मन आई-ट्रैकिंग डेटासेट है जिसमें 75 प्रतिभागी (विशेषज्ञ और नौसिखिए दोनों) एक पूर्णतः-क्रॉस फैक्टोरियल डिज़ाइन के तहत 12 वैज्ञानिक ग्रंथों को पढ़ रहे हैं, जो समझ मूल्यांकन, भाषाई एनोटेशन और पूर्ण प्रीप्रोसेसिंग कोड से सुसज्जित है ताकि विशेषज्ञ बनाम गैर-विशेषज्ञ पठन रणनीतियों के अध्ययन को सुगम बनाया जा सके।

Deborah N. Jakobi, Thomas Kern, David R. Reich, Patrick Haller, Lena A. Jäger2026-02-24
💬 NLP

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

यह शोध पत्र MathScape प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) का मूल्यांकन करने के लिए मानव-कैप्चर की गई छवियों के साथ 1,369 वास्तविक दुनिया की गणितीय समस्याओं वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी वास्तविक परिदृश्यों के साथ संघर्ष करते हैं और गणितीय तर्क के आकलन के लिए केवल सिंथेटिक डेटासेट पर निर्भर रहने की सीमाओं को उजागर करता है।

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao (…)2026-02-24
💬 NLP

Personalized Help for Optimizing Low-Skilled Users' Strategy

यह शोध पत्र यह प्रदर्शित करता है कि डिप्लोमेसी खेल में व्यक्तिगत चाल और संदेश संबंधी सलाह प्रदान करने के लिए सुपरह्यूमन एआई एजेंट सिसिरो (CICERO) को संवर्धित करना, नौसिखिए खिलाड़ियों को अनुभवी खिलाड़ियों के साथ प्रतिस्पर्धा करने या यहाँ तक कि उनसे आगे निकलने में महत्वपूर्ण रूप से मदद करता है, जहाँ ऐसी सलाह की मात्र उपस्थिति ही रणनीतिक लाभ प्रदान करती है, चाहे उसका पालन किया जाए या नहीं।

Feng Gu, Wichayaporn Wongkamjan, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May, Jordan Boyd-Graber2026-02-24
💬 NLP

Efficient Context Propagating Perceiver Architectures for Auto-Regressive Language Modeling

यह शोध पत्र एफिशिएंट कॉन्टेक्स्ट प्रोपेगेटिंग परसीवर (ECP) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो लॉन्ग-सीक्वेंस लैंग्वेज मॉडलिंग कार्यों पर बेहतर प्रदर्शन प्राप्त करने के लिए लॉन्गलोरा-स्तर की दक्षता के साथ कॉन्टेक्स्ट और लेटेंट सीक्वेंस दोनों का लाभ उठाकर PerceiverAR में सुधार करता है।

Kaleel Mahmood, Shaoyi Huang2026-02-24
💬 NLP

Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context

यह शोध पत्र LiveIdeaBench प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जो न्यूनतम संदर्भ का उपयोग करके वैज्ञानिक विचार सृजन के लिए LLMs की अपसारी सोच (divergent thinking) क्षमताओं का मूल्यांकन करता है, यह प्रकट करते हुए कि रचनात्मक प्रदर्शन का सामान्य बुद्धिमत्ता मेट्रिक्स द्वारा खराब पूर्वानुमान लगाया जाता है और वैज्ञानिक रचनात्मकता को बढ़ाने के लिए विशेष प्रशिक्षण रणनीतियों की आवश्यकता का सुझाव देता है।

Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun2026-02-24
💬 NLP

Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations

यह शोध पत्र एक USMLE-संरेखित बेंचमार्क प्रस्तुत करता है जो शोर वाले नैदानिक परिदृश्यों (noisy diagnostic scenarios) का अनुकरण करता है और यह प्रदर्शित करता है कि संवाद-आधारित फाइन-ट्यूनिंग, चिकित्सा बड़े भाषा मॉडलों (medical large language models) की तर्क सटीकता और मजबूती को बढ़ाने में पारंपरिक स्थिर प्रशिक्षण विधियों की तुलना में काफी बेहतर प्रदर्शन करती है।

Zijie Liu, Xinyu Zhao, Jie Peng, Zhuangdi Zhu, Qingyu Chen, Kaidi Xu, Xia Hu, Tianlong Chen2026-02-24
💬 NLP

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

यह सर्वेक्षण बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) के साथ बहु-चरण अंतःक्रियाओं (मल्टी-टर्न इंटरैक्शन) के लिए चुनौतियों, बेंचमार्क और संवर्धन पद्धतियों की व्यापक रूप से समीक्षा करता है, जो कार्य-उन्मुख डोमेन और संवादात्मक सेटिंग्स में प्रगति को वर्गीकृत करते हुए मजबूती और प्रभावशीलता में सुधार के लिए भविष्य की अनुसंधान दिशाओं को रेखांकित करता है।

Yubo Li, Xiaobin Shen, Xinyu Yao, Xueying Ding, Yidi Miao, Ramayya Krishnan, Rema Padman2026-02-24
💬 NLP

CodePDE: An Inference Framework for LLM-driven PDE Solver Generation

यह शोध पत्र CodePDE को प्रस्तुत करता है, जो पहला इन्फरेंस फ्रेमवर्क है जो PDE सॉल्वर को कोड के रूप में उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, यह प्रदर्शित करते हुए कि उन्नत इन्फरेंस रणनीतियाँ और टेस्ट-टाइम स्केलिंग LLMs को जटिल आंशिक अवकल समीकरणों (partial differential equations) को प्रभावी ढंग से हल करने में सक्षम बनाते हैं और उनके तर्क, डिबगिंग और विश्वसनीयता संबंधी ट्रेड-ऑफ के बारे में महत्वपूर्ण अंतर्दृष्टि प्रदान करते हैं।

Shanda Li, Tanya Marwah, Junhong Shen, Weiwei Sun, Andrej Risteski, Yiming Yang, Ameet Talwalkar2026-02-24
💬 NLP

From Weak Labels to Strong Results: Utilizing 5,000 Hours of Noisy Classroom Transcripts with Minimal Accurate Data

यह शोध पत्र वीकली सुपरवाइज्ड प्रीट्रेनिंग (WSP) का प्रस्ताव करता है, जो एक दो-चरणीय कार्यप्रणाली है जो कम-संसाधन वाले ऑटोमैटिक स्पीच रिकग्निशन परिदृश्यों में बेहतर प्रदर्शन प्राप्त करने के लिए प्रचुर मात्रा में शोर युक्त क्लासरूम ट्रांसक्रिप्ट्स का लाभ उठाने के बाद सीमित सटीक डेटा पर फाइन-ट्यूनिंग का उपयोग करता है।

Ahmed Adel Attia, Dorottya Demszky, Jing Liu, Carol Espy-Wilson2026-02-24