💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

यह शोध पत्र DR Tulu को प्रस्तुत करता है, जो 'इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग' (RLER) के माध्यम से प्रशिक्षित एक ओपन-सोर्स डीप रिसर्च मॉडल है, जो पॉलिसी के साथ मूल्यांकन मानदंडों को सह-विकसित करता है, जिससे यह मौजूदा ओपन एजेंटों से बेहतर प्रदर्शन करने और दीर्घकालिक शोध कार्यों पर प्रोप्रायटरी सिस्टमों को टक्कर देने में सक्षम होता है, जबकि यह काफी अधिक लागत-प्रभावी भी है।

Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Sam (…)2026-05-18
💬 NLP

Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios

यह शोध पत्र "रिवॉर्ड ऑडिटर" (Reward Auditor) को प्रस्तुत करता है, जो एक परिकल्पना-परीक्षण ढांचा (hypothesis-testing framework) है, जो व्यवस्थित कमजोरियों का पता लगाने के लिए सांख्यिकीय महत्व (statistical significance) और प्रभाव आकार (effect size) को परिमाणित करके वास्तविक दुनिया के विक्षेपित परिदृश्यों में रिवॉर्ड मॉडल्स की उपयुक्तता का मूल्यांकन करता है, जिससे सत्यापन योग्य रूप से सुरक्षित और सुदृढ़ LLM संरेखण प्रणालियों के विकास को आगे बढ़ाया जा सके।

Jianxiang Zang, Yongda Wei, Ruxue Bai, Shiyu Jiang, Nijia Mo, Binhong Li, Qiang Sun, Hui Liu2026-05-18
💬 NLP

Reference Games as a Testbed for the Alignment of Model Uncertainty and Clarification Requests

यह शोध पत्र यह मूल्यांकन करने के लिए एक नियंत्रित टेस्टबेड के रूप में 'रेफरेंस गेम्स' का प्रस्ताव करता है कि क्या विजन-लैंग्वेज मॉडल प्रभावी रूप से अपनी आंतरिक अनिश्चितता को पहचान सकते हैं और स्पष्टीकरण का अनुरोध कर सकते हैं, जिसमें यह पाया गया है कि वर्तमान मॉडल सरल कार्यों में भी अनिश्चितता को उपयुक्त स्पष्टीकरण व्यवहार में बदलने में संघर्ष करते हैं।

Manar Ali, Judith Sieker, Sina Zarrieß, Hendrik Buschmeier2026-05-18
💬 NLP

Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities

यह शोध पत्र यह प्रदर्शित करता है कि रिप्रेजेंटेशन मिसडायरेक्शन (Representation Misirection), जो बड़े भाषा मॉडलों के लिए एक मशीन अनलर्निंग विधि है, न केवल विस्मरण (forgetting) प्राप्त करता है बल्कि उच्च-स्तरीय अवधारणाओं के साथ संरेखित एक लक्ष्य वेक्टर की ओर लेटेंट रिप्रेजेंटेशन्स को पुनर्निर्देशित करके नियंत्रणीय पार्श्व व्यवहारों और क्षमताओं को भी प्रेरित करता है।

Tien Dang, The-Hai Nguyen, Dinh Mai Phuong, Nguyen Minh Phuong, Anh Bui, Hoang Thanh-Tung, Le-Minh Nguyen, Naoya Inoue2026-05-18
💬 NLP

Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

यह शोध पत्र OP-Mix को पेश करता है, जो एक एकीकृत, कुशल डेटा मिक्सिंग एल्गोरिदम है जो पूरे लैंग्वेज मॉडल प्रशिक्षण जीवनचक्र में संभावित मिश्रणों का अनुकरण करने के लिए लो-रैंक एडैप्टर इंटरपोलेशन का उपयोग करता है, और मौजूदा चरण-विशिष्ट विधियों की तुलना में काफी कम कंप्यूट के साथ लगभग इष्टतम प्रदर्शन प्राप्त करता है।

Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma2026-05-18
💻 computer science

Effective Harness Engineering for Algorithm Discovery with Coding Agents

यह शोध पत्र यह प्रदर्शित करता है कि कोडिंग एजेंटों के साथ एल्गोरिदम खोज के लिए प्रभावी हार्नेस इंजीनियरिंग, केवल मात्रा के बजाय गहन तर्क के साथ कम और उच्च-गुणवत्ता वाले एल्गोरिदम उत्पन्न करने को प्राथमिकता देती है, साथ ही मूल्यांकन हैक डिटेक्शन (evaluation hack detection) और सुरक्षित समानांतर निष्पादन (safe parallel execution) जैसी महत्वपूर्ण चुनौतियों का भी समाधान करती है।

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada2026-05-18
💬 NLP

Fluency and Faithfulness in Human and Machine Literary Translation

यह अध्ययन 106 उपन्यासों के 130,000 से अधिक अनूदित अनुच्छेदों का विश्लेषण करता है ताकि मानवों और गूगल ट्रांसलेट दोनों के लिए साहित्यिक अनुवाद में प्रवाह (fluency) और निष्ठा (faithfulness) के बीच एक सुसंगत नकारात्मक सहसंबंध को प्रकट किया जा सके, जबकि यह भी उल्लेख किया गया है कि यह समझौता (trade-off) ट्रांसलेटजेम्मा (TranslateGemma) के लिए कमजोर या नगण्य है।

Sarah Griebel, Ted Underwood2026-05-18
💬 NLP

DiscoExplorer: An Open Interface for the Study of Multilingual Discourse Relations

यह शोध पत्र डिस्कोएक्सप्लोरर (DiscoExplorer) को प्रस्तुत करता है, जो एक ओपन-सोर्स, स्थानीय रूप से चलाने योग्य वेब इंटरफेस है जो 16 भाषाओं के डेटासेट को कवर करने वाले सुलभ क्वेरी, खोज और विज़ुअलाइज़ेशन टूल प्रदान करके बहुभाषी विमर्श संबंधों (multilingual discourse relations) के अध्ययन और तुलना को सुगम बनाता है।

Amir Zeldes2026-05-18
🤖 AI

Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning

यह शोध पत्र LaMR को प्रस्तुत करता है, जो एक संरचित संदर्भ प्रूनिंग (context pruning) ढांचा है जो मल्टी-रुब्रिक लेटेंट रीजनिंग और AST-आधारित पर्यवेक्षण का उपयोग करके कोड प्रासंगिकता को अर्थ संबंधी (semantic) और निर्भरता (dependency) आयामों में विभाजित करता है, जिससे कोडिंग एजेंट के प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए टोकन के उपयोग को महत्वपूर्ण रूप से कम किया जाता है।

Jingjing Wang, Xiwen Chen, Wenhui Zhu, Huayu Li, Zhengxiao He, Feiyang Cai, Ana S. Carreon-Rascon, Xuanzhao Dong, Feng L (…)2026-05-18
🤖 machine learning

From I/O to Code with Discovery Agent

यह शोध पत्र DIO-Agent को प्रस्तुत करता है, जो एक खोज ढांचा (discovery framework) है जो प्रोग्राम संश्लेषण (program synthesis) को निष्पादन त्रुटियों (execution errors) और सरल परिकल्पनाओं को प्राथमिकता देने के लिए एक "ट्रांसफॉर्मेशन प्रायोरिटी प्रिमिस" (Transformation Priority Premise) द्वारा निर्देशित एक विकासवादी खोज (evolutionary search) के रूप में फ्रेम करके चुनौतीपूर्ण IO2Code समस्या को हल करता है, और एक नवनिर्मित IO2CodeBench पर मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang2026-05-18