💬 NLP

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

यह शोध पत्र RLCR (कैलिब्रेशन रिवॉर्ड्स के साथ सुदृढीकरण सीखना) प्रस्तुत करता है, जो एक नवीन प्रशिक्षण दृष्टिकोण है जो बाइनरी शुद्धता पुरस्कारों को ब्रियर स्कोर (Brier score) के साथ जोड़कर भाषा मॉडलों की सटीकता और कैलिब्रेटेड आत्मविश्वास दोनों में सुधार करता है, जिससे मानक सुदृढीकरण सीखने के कारण होने वाले मतिभ्रम (hallucination) और कैलिब्रेशन क्षरण को कम किया जा सके।

Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas2026-05-18
🤖 machine learning

Logic of Hypotheses: from Zero to Full Knowledge in Neurosymbolic Integration

यह शोध पत्र लॉजिक ऑफ हाइपोथीसिसिस (LoH) को प्रस्तुत करता है, जो एक नवीन न्यूरोसिम्बोलिक फ्रेमवर्क है जो प्रपोज़िशनल लॉजिक को एक सीखने योग्य 'चॉइस ऑपरेटर' के माध्यम से विस्तारित करके हस्तनिर्मित नियमों और डेटा-संचालित शिक्षण को एकीकृत करता है, जिसे डिफरेंशिएबल फजी लॉजिक में संकलित किया गया है, जिससे प्रदर्शन में बिना किसी कमी के लचीले ज्ञान एकीकरण और असतत बूलियन तर्क (डिस्क्रीट बूलियन रीजनिंग) को सक्षम बनाया जा सके।

Davide Bizzaro, Alessandro Daniele2026-05-18
📊 statistics

Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models

यह शोध पत्र पेनलेस एक्टिवेशन स्टीयरिंग (PAS) को प्रस्तुत करता है, जो एक पूर्णतः स्वचालित और हल्का तरीका है जो मानवीय हस्तक्षेप के बिना लेबल किए गए डेटासेट से एक्टिवेशन वेक्टरों का निर्माण करता है ताकि लार्ज लैंग्वेज मॉडल्स को वांछित व्यवहारों की ओर प्रभावी ढंग से निर्देशित किया जा सके, जो नियंत्रण क्षमता और दक्षता में मौजूदा तकनीकों से बेहतर प्रदर्शन करते हुए व्यवहार-उन्मुख कार्यों के लिए विशिष्ट प्रभावकारिता प्रदर्शित करता है।

Sasha Cui, Zhongren Chen2026-05-18✓ Author reviewed
💬 NLP

How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models

यह शोध पत्र एडवाइजर मॉडल्स (Advisor Models) को प्रस्तुत करता है, जो एक ऐसी विधि है जो छोटे ओपन-वेट मॉडल्स को गतिशील, प्रति-इन्स्टेंस प्राकृतिक भाषा संबंधी सलाह उत्पन्न करने के लिए प्रशिक्षित करती है, जो उनके भार (weights) को संशोधित किए बिना पैरामीट्रिक अनुकूलन के माध्यम से अप्राप्य ब्लैक-बॉक्स फ्रंटियर LLMs के प्रदर्शन को प्रभावी रूप से निर्देशित और उन्नत करती है।

Parth Asawa, Alan Zhu, Abigail O'Neill, Matei Zaharia, Alexandros G. Dimakis, Joseph E. Gonzalez2026-05-18
🧬 biology

SAE-RNA: A Sparse Autoencoder Model for Interpreting RNA Language Model Representations

यह शोध पत्र SAE-RNA को प्रस्तुत करता है, जो एक स्पार्स ऑटोएनकोडर मॉडल है जो RNA भाषा मॉडल के निरूपण (representations) को मानव-स्तरीय जैविक विशेषताओं में मैप करके उनकी व्याख्या करता है, जो यह समझने के लिए एक निरूपण-स्तर के प्रोब (representation-level probe) के रूप में कार्य करता है कि ये मॉडल जैविक जानकारी को कैसे व्यवस्थित करते हैं और RNA परिवार की पहचान एवं संरचनात्मक संदर्भ से संबंधित स्पार्स घटकों की पहचान करते हैं।

Taehan Kim, Sangdae Nam2026-05-18
💬 NLP

ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking

यह शोध पत्र ADMIT को प्रस्तुत करता है, जो एक फ्यू-शॉट (few-shot), सिमेंटिकली अलाइन्ड (semantically aligned) एडवरसेरियल मल्टी-इंजेक्शन तकनीक है, जो न्यूनतम एडवरसेरियल सामग्री को इंजेक्ट करके प्रामाणिक साक्ष्यों को ओवरराइड करने और विविध मॉडलों एवं डोमेन में उच्च अटैक सक्सेस रेट के साथ LLM आउटपुट को मैनिपुलेट करने के माध्यम से RAG-आधारित फैक्ट-चेकिंग सिस्टम्स को सफलतापूर्वक पॉइजन करती है।

Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma2026-05-18
🤖 machine learning

Monotone and Separable Set Functions: Characterizations and Neural Models

यह शोध पत्र सेट समावेशन क्रम (set containment order) को संरक्षित करने के लिए मोनोटोनिक और सेपरेबल (MAS) सेट फलनों (set functions) को प्रस्तुत करता है, उनके अस्तित्व और आयामीता पर सैद्धांतिक सीमाएँ स्थापित करता है, अनंत ग्राउंड सेट्स (infinite ground sets) के लिए एक स्थिर "वीकली MAS" न्यूरल मॉडल प्रस्तावित करता है, और यूनिवर्सल एप्रोक्सिमेशन गारंटी एवं अनुभवजन्य परिणामों के माध्यम से सेट समावेशन कार्यों में उनकी प्रभावशीलता को प्रदर्शित करता है।

Soutrik Sarangi, Yonatan Sverdlov, Nadav Dym, Abir De2026-05-18
🤖 machine learning

SemanticOpt: Towards LLM-Based Semantic Black-Box Optimization

SemanticOpt एक नवीन ढांचा है जो बड़े भाषा मॉडलों (Large Language Models) को प्राकृतिक भाषा संदर्भ से समृद्ध संरचित बेयसियन प्रक्षेप पथों (structured Bayesian trajectories) पर उन्हें फाइन-ट्यून करके सिमेंटिक ब्लैक-बॉक्स अनुकूलन के लिए उन्नत करता है, जिससे वे प्रभावी रूप से डोमेन ज्ञान का लाभ उठाने में सक्षम होते हैं और महंगे प्रयोगात्मक परिदृश्यों में शास्त्रीय और मौजूदा एलएलएम-आधारित ऑप्टिमाइज़र दोनों से बेहतर प्रदर्शन करते हैं।

Jamison Meindl, Yunsheng Tian, Tony Cui, Veronika Thost, Zhang-Wei Hong, Jie Chen, Wojciech Matusik, Mina Konaković Luko (…)2026-05-18
🤖 machine learning

Weight Concentration Regularization for Improving Pruning Robustness Under High Sparsity

यह शोध पत्र वेट कंसन्ट्रेशन रेगुलराइजेशन (WCR) का प्रस्ताव करता है, जो एक नवीन प्रशिक्षण-समय रेगुलराइज़र है जो विभिन्न डीप लर्निंग कार्यों में उच्च स्पर्सिटी के तहत वन-शॉट मैग्नीट्यूड प्रूनिंग की मजबूती को महत्वपूर्ण रूप से सुधारने के लिए अन्य मापदंडों को दबाते हुए सूचनात्मक मापदंडों के एक छोटे उपसमूह को बढ़ाता है।

Vincent-Daniel Yun, Junhyuk Jo, Sunwoo Lee2026-05-18
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

यह शोध पत्र DR Tulu को प्रस्तुत करता है, जो 'इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग' (RLER) के माध्यम से प्रशिक्षित एक ओपन-सोर्स डीप रिसर्च मॉडल है, जो पॉलिसी के साथ मूल्यांकन मानदंडों को सह-विकसित करता है, जिससे यह मौजूदा ओपन एजेंटों से बेहतर प्रदर्शन करने और दीर्घकालिक शोध कार्यों पर प्रोप्रायटरी सिस्टमों को टक्कर देने में सक्षम होता है, जबकि यह काफी अधिक लागत-प्रभावी भी है।

Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Sam (…)2026-05-18