💬 NLP

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR एक सेल्फ-प्ले फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को शिक्षक और छात्र के रूप में बारी-बारी से कार्य करके, बिना किसी बाहरी एनोटेशन के नवीन समस्याओं को उत्पन्न करने और उन्हें हल करने के माध्यम से उनकी तर्क क्षमता में निरंतर सुधार करने में सक्षम बनाता है, जिससे गणित और सामान्य रीजनिंग बेंचमार्क में निरंतर प्रदर्शन लाभ प्राप्त होता है।

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini2026-06-23
💬 NLP

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

यह शोध पत्र यह प्रकट करता है कि बहुभाषी LLMs में उच्च-संसाधन और निम्न-संसाधन भाषाओं के बीच दिखने वाला प्रदर्शन अंतराल काफी हद तक MGSM बेंचमार्क में अनुवाद त्रुटियों और असंगत उत्तर निष्कर्षण का एक परिणाम है, जो इन डेटा गुणवत्ता संबंधी समस्याओं को ठीक करने पर समाप्त हो जाता है।

Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag2026-06-23
💬 NLP

MedPath: Multi-Domain Cross-Vocabulary Hierarchical Paths for Biomedical Entity Linking

MedPath एक बड़े पैमाने का, बहु-डोमेन बायोमेडिकल एंटिटी लिंकिंग डेटासेट है जो व्याख्यात्मक और इंटरऑपरेबल क्लिनिकल NLP मॉडल के विकास को सक्षम करने के लिए UMLS सामान्यीकरण, 62 शब्दावली मैपिंग और पूर्ण ऑन्टोलॉजिकल पाथ के साथ नौ मौजूदा संसाधनों को एकीकृत करता है।

Nishant Mishra, Wilker Aziz, Iacer Calixto2026-06-23
💬 NLP

Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning

यह शोध पत्र "टेल मी" (Tell Me) को प्रस्तुत करता है, जो एक व्यापक LLM-संचालित मानसिक कल्याण प्रणाली है जो एक RAG-आधारित संवादात्मक सहायक, अनुसंधान और डेटा संवर्धन के लिए एक सिंथेटिक संवाद जनरेटर, और व्यक्तिगत स्व-देखभाल योजनाएं एवं निर्देशित ध्यान प्रदान करने के लिए एक एजेंटिक प्लानिंग क्रू को एकीकृत करती है, जिसका लक्ष्य जिम्मेदार, संदर्भ-जागरूक AI नवाचार के माध्यम से मानसिक स्वास्थ्य सहायता के अंतराल को पाटना है।

Trishala Jayesh Ahalpara2026-06-23
⚡ electrical engineering

Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking

यह शोध पत्र एक संयुक्त प्रशिक्षण दृष्टिकोण प्रस्तावित करता है जो सीमित स्पोकन डायलॉग स्टेट ट्रैकिंग डेटा को अन्य डोमेन के प्रचुर टेक्स्टुअल डेटा के साथ जोड़ता है ताकि लार्ज लैंग्वेज मॉडल-आधारित एंड-टू-एंड सिस्टम को बिना किसी टारगेट-डोमेन स्पोकन एनोटेशन की आवश्यकता के मजबूत क्रॉस-डोमेन सामान्यीकरण प्राप्त करने में सक्षम बनाया जा सके।

Katia Vendrame, Bolaji Yusuf, Santosh Kesiraju, Šimon Sedláček, Oldřich Plchot, Jan Černocký2026-06-23
💬 NLP

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

यह शोध पत्र IDRBench प्रस्तुत करता है, जो डीप रिसर्च एजेंटों की संवादात्मक क्षमताओं का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह मापता है कि वे स्पष्टीकरण कैसे मांगते हैं और विकसित होते उपयोगकर्ता के इरादे के साथ तालमेल कैसे बिठाते हैं, और यह प्रदर्शित करता है कि ऐसा संवाद विभिन्न बड़े भाषा मॉडलों (LLMs) में अनुसंधान की गुणवत्ता और मजबूती में महत्वपूर्ण सुधार करता है।

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung2026-06-23
💬 NLP

Next-Gen CAPTCHAs: Leveraging the Cognitive Gap for Scalable and Diverse GUI-Agent Defense

यह शोध पत्र "नेक्स्ट-जेन कैप्चा" (Next-Gen CAPTCHAs) को प्रस्तुत करता है, जो एक स्केलेबल रक्षा ढांचा है जो इंटरैक्टिव धारणा और निर्णय लेने में एक निरंतर संज्ञानात्मक अंतराल का लाभ उठाकर गतिशील, असीमित कार्य उत्पन्न करता है जो प्रभावी रूप से जैविक उपयोगकर्ताओं को उन उन्नत मल्टीमॉडल एजेंटों से अलग करता है जिन्होंने पारंपरिक सुरक्षा बाधाओं को पार कर लिया है।

Jiacheng Liu, Yaxin Luo, Jiacheng Cui, Xinyi Shang, Xiaohan Zhao, Zhiqiang Shen2026-06-23
💬 NLP

SteuerLLM: Local specialized large language model for German tax law analysis

यह शोध पत्र SteuerLLM को प्रस्तुत करता है, जो एक विशिष्ट 28B-पैरामीटर वाला जर्मन कर कानून मॉडल है, और SteuerEx को, जो प्रामाणिक विश्वविद्यालय परीक्षाओं से व्युत्पन्न पहला ओपन बेंचमार्क है, जो यह प्रदर्शित करता है कि डोमेन-विशिष्ट अनुकूलन और सिंथेटिक डेटा जनरेशन जटिल कानूनी तर्क कार्यों में सामान्य-उद्देश्य वाले मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Sebastian Wind, Jeta Sopa, Laurin Schmid, Quirin Jackl, Sebastian Kiefer, Fei Wu, Martin Mayr, Harald Köstler, Gerhard W (…)2026-06-23
💬 NLP

Revisiting Text Ranking in Deep Research

यह शोध पत्र BrowseComp-Plus डेटासेट पर रिट्रीवल यूनिट्स, पाइपलाइन कॉन्फ़िगरेशन और क्वेरी विशेषताओं का विश्लेषण करके डीप रिसर्च में टेक्स्ट रैंकिंग विधियों की प्रभावशीलता की जांच करता है, जिससे यह पता चलता है कि विशिष्ट रिट्राइवर प्रकार और पैसेज-लेवल यूनिट्स अच्छा प्रदर्शन करते हैं, साथ ही यह क्वेरी मिसमैच को कम करने के लिए एक क्वेरी-टू-क्वेश्चन विधि का प्रस्ताव भी देता है।

Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton2026-06-23
💬 NLP

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

यह शोध पत्र DoGMaTiQ को प्रस्तुत करता है, जो एक स्वचालित तीन-चरणीय पाइपलाइन है जो बहुभाषी दस्तावेज़ों से उच्च-गुणवत्ता वाले प्रश्न-उत्तर आधारित नगेट्स (nuggets) उत्पन्न करता है ताकि लंबे, उद्धरण-आधारित रिपोर्टों के स्केलेबल और पूर्णतः स्वचालित मूल्यांकन को सक्षम बनाया जा सके, जो क्रॉस-लिंगुअल बेंचमार्क में मानवीय निर्णयों के साथ मजबूत सहसंबंध प्रदर्शित करता है।

Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burc (…)2026-06-23