💬 NLP

BioUNER: A Benchmark Dataset for Clinical Urdu Named Entity Recognition

यह शोध पत्र BioUNER को प्रस्तुत करता है, जो चिकित्सा पाठ के 153K टोकन से निर्मित एक गोल्ड-स्टैंडर्ड बेंचमार्क डेटासेट है जिसे उच्च इंटर-एनोटेटर सहमति के साथ बायोमेडिकल उर्दू नेमड एंटिटी रिकग्निशन (NER) के लिए बनाया गया है, और विभिन्न मशीन लर्निंग एवं डीप लर्निंग मॉडलों का मूल्यांकन करके इसकी उपयोगिता को प्रमाणित करता है।

Wazir Ali, Adeeb Noor, Sanaullah Mahar, Alia, Muhammad Mazhar Younas2026-04-06
🤖 AI

Analysis of Optimality of Large Language Models on Planning Problems

यह शोध पत्र प्रदर्शित करता है कि तर्क-संवर्धित लार्ज लैंग्वेज मॉडल्स (Large Language Models) सक्रिय एल्गोरिद्मिक सिमुलेशन और ज्यामितीय स्मृति का लाभ उठाकर जटिल ब्लॉकवर्ल्ड (Blocksworld) और पाथ-स्टार (Path-Star) नियोजन कार्यों पर लगभग पूर्ण अनुकूलता प्राप्त करते हैं, जो पारंपरिक संतोषजनक नियोजकों (satisficing planners) की तुलना में काफी बेहतर प्रदर्शन करते हैं, भले ही उन्हें अर्थ संबंधी पूर्वग्रहों (semantic priors) से मुक्त कर दिया गया हो।

Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel2026-04-06
💬 NLP

Council Mode: Mitigating Hallucination and Bias in LLMs via Multi-Agent Consensus

यह शोध पत्र "काउंसिल मोड" (Council Mode) को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट कंसेंसस फ्रेमवर्क है जो एक ट्राइएज क्लासिफायर के माध्यम से प्रश्नों को रूट करके, विविध फ्रंटियर मॉडल्स से समानांतर प्रतिक्रियाएं उत्पन्न करके, और उन्हें एक संरचित सर्वसम्मति तंत्र के माध्यम से संश्लेषित करके लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) और पूर्वाग्रहों को कम करता है, जिसके परिणामस्वरूप तथ्यात्मक सटीकता में महत्वपूर्ण सुधार और पूर्वाग्रह भिन्नता में कमी आती है।

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang2026-04-06
💬 NLP

How Annotation Trains Annotators: Competence Development in Social Influence Recognition

यह अध्ययन प्रदर्शित करता है कि मानव डेटा एनोटेशन प्रक्रिया स्वयं एक प्रशिक्षण तंत्र के रूप में कार्य करती है जो एनोटेटरों की सक्षमता और आत्मविश्वास को महत्वपूर्ण रूप से बढ़ाती है—विशेष रूप से विशेषज्ञों के बीच—और यह कि एनोटेटर कौशल में ये सुधार बाद में उस डेटा पर प्रशिक्षित लार्ज लैंग्वेज मॉडल्स (LLMs) के बेहतर प्रदर्शन की ओर ले जाते हैं।

Maciej Markiewicz, Beata Bajcar, Wiktoria Mieleszczenko-Kowszewicz, Aleksander Szczęsny, Tomasz Adamczyk, Grzegorz Choda (…)2026-04-06
🤖 machine learning

Mitigating Reward Hacking in RLHF via Advantage Sign Robustness

यह शोध पत्र SignCert-PO का प्रस्ताव करता है, जो एक हल्का (lightweight) तरीका है जो पॉलिसी ऑप्टिमाइज़ेशन के दौरान गैर-मजबूत (non-robust) पूर्णताओं को कम भार देने के लिए एक प्रमाणित साइन-प्रिजर्वेशन रेडियस (certified sign-preservation radius) व्युत्पन्न करके RLHF में रिवॉर्ड हैकिंग को कम करता है, जिससे कई रिवॉर्ड मॉडल्स या प्रशिक्षण डेटा तक पहुंच की आवश्यकता के बिना एडवांटेज साइन फ्लिप (advantage sign flips) को रोका जा सके।

Shinnosuke Ono, Johannes Ackermann, Soichiro Nishimori, Takashi Ishida, Masashi Sugiyama2026-04-06
💬 NLP

Querying Structured Data Through Natural Language Using Language Models

यह शोध पत्र एक ओपन-सोर्स पद्धति प्रस्तुत करता है जो संरचित गैर-पाठ्य डेटासेट के लिए निष्पादन योग्य क्वेरी उत्पन्न करने हेतु सिंथेटिक डेटा का उपयोग करके एक कॉम्पैक्ट 8B लैंग्वेज मॉडल को फाइन-ट्यून करता है, जो रिट्रीवल ऑगमेंटेड जनरेशन (RAG) के एक प्रभावी विकल्प के रूप में संसाधन-सीमित वातावरण में उच्च सटीकता और सामान्यीकरण प्राप्त करता है।

Hontan Valentin-Micu, Bunea Andrei-Alexandru, Tantaroudas Nikolaos Dimitrios, Popovici Dan-Matei2026-04-06
💬 NLP

Verbalizing LLMs' assumptions to explain and control sycophancy

यह शोध पत्र "वर्बलाइज्ड अज़म्पशन्स" (Verbalized Assumptions) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह उजागर करता है कि कैसे उपयोगकर्ता के इरादे (जैसे कि पुष्टि चाहना) के बारे में LLMs की गलत धारणाएं उनके चापलूसीपूर्ण व्यवहार (sycophantic behavior) को प्रेरित करती हैं, जिससे इन सुरक्षा संबंधी मुद्दों में गहरी अंतर्दृष्टि और व्याख्या योग्य स्टीयरिंग (interpretable steering) के माध्यम से उन पर कारण-आधारित नियंत्रण संभव हो पाता है।

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky (…)2026-04-06
💬 NLP

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

यह शोधपत्र डॉक्यूमेंट-ड्रिवन इम्प्लिसिट पेलोड एक्ज़ीक्यूशन (DDIPE) को प्रस्तुत करता है, जो एक नवीन सप्लाई-चेन हमला है जो स्किल डॉक्यूमेंटेशन में मैलिशियस लॉजिक को एम्बेड करके LLM एजेंट सुरक्षा उपायों को बायपास करता है, और यह प्रदर्शित करता है कि ऐसे इम्प्लिसिट हमले स्पष्ट निर्देश हमलों की तुलना में काफी उच्च सफलता दर के साथ एजेंट कार्यों को सफलतापूर्वक हाईजैक कर सकते हैं।

Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma2026-04-06
🤖 machine learning

Co-Evolution of Policy and Internal Reward for Language Agents

यह शोध पत्र "सेल्फ-गाइड" (Self-Guide) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जहाँ भाषा एजेंट अपनी नीति (policy) और एक स्व-निर्मित आंतरिक पुरस्कार संकेत (internal reward signal) को सह-विकसित करते हैं ताकि इन्फरेंस-टाइम एक्शन गाइडेंस और डेंसर ट्रेनिंग-टाइम सुपरविजन दोनों प्रदान किए जा सकें, जिससे वे विरल बाहरी पुरस्कारों (sparse external rewards) की सीमाओं को पार कर सकें और महत्वपूर्ण प्रदर्शन लाभ प्राप्त कर सकें।

Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang, Fanqi Kong, Tung Sum Thomas Kwok, Xiao-Wen Chang, Yuyu (…)2026-04-06
🤖 machine learning

Self-Distilled RLVR

यह शोध पत्र RLSD को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण प्रतिमान (paradigm) है जो 'वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) के स्थिर, दिशा-प्रदान करने वाले संकेतों को 'ऑन-पॉलिसी सेल्फ-डिस्टिलेशन' के सूक्ष्म परिमाण समायोजनों (fine-grained magnitude adjustments) के साथ जोड़ता है, जिससे शुद्ध सेल्फ-डिस्टिलेशन दृष्टिकोणों में पाई जाने वाली सूचना रिसाव (information leakage) और अस्थिरता की समस्याओं को दूर करते हुए बेहतर अभिसरण (convergence) और प्रशिक्षण स्थिरता प्राप्त की जा सकती है।

Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan2026-04-06