💬 NLP

Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG

यह शोध पत्र एक हल्के, नॉलेज-बेस-अलाइन्ड (knowledge-base-aligned), आउट-ऑफ-डोमेन डिटेक्शन पद्धति को प्रस्तावित और मूल्यांकित करता है जो असुरक्षित या अप्रासंगिक प्रश्नों के विरुद्ध RAG सिस्टम को प्रभावी ढंग से गेट करने के लिए PCA-आधारित सबस्पेस स्कोरिंग का उपयोग करता है, यह प्रदर्शित करते हुए कि ये कुशल ज्यामितीय या क्लासिफायर-आधारित दृष्टिकोण महंगे LLM जजों की तुलना में बेहतर प्रदर्शन करते हैं और उच्च-जोखिम वाले डोमेन में मजबूती बनाए रखते हैं।

Ilias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc2026-07-07
💬 NLP

DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

यह शोध पत्र DynamixSFT का प्रस्ताव करता है, जो एक गतिशील और स्वचालित विधि है जो समस्या को प्रायर-स्केल्ड बोल्ट्ज़मैन एक्सप्लोरेशन (Prior-scaled Boltzmann Exploration) और 1-स्टेप लुक-अहेड रिवॉर्ड (1-Step Look-ahead Reward) के साथ एक मल्टी-आर्म्ड बैंडिट (multi-armed bandit) के रूप में फ्रेम करके इंस्ट्रक्शन-ट्यूनिंग डेटासेट मिश्रणों को अनुकूलित करती है, जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ कई बेंचमार्क पर मॉडल के प्रदर्शन को प्रभावी रूप से बढ़ाती है।

Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong2026-07-07
💬 NLP

Polarity Detection of Sustainable Development Goals in News Text

यह शोध पत्र सतत विकास लक्ष्यों (SDG) की ओर विशिष्ट प्रगति या प्रतिगमन को निर्धारित करने के लिए 'एसडीजी पोलैरिटी डिटेक्शन' (SDG polarity detection) के नवीन कार्य को प्रस्तुत करता है, जो SDG-POD बेंचमार्क डेटासेट पेश करता है और यह प्रदर्शित करता है कि फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स, विशेष रूप से सिंथेटिक डेटा के साथ संवर्धित QWQ-32B, इस चुनौती को प्रभावी ढंग से संबोधित करते हैं।

Andrea Cadeddu, Alessandro Chessa, Vincenzo De Leo, Gianni Fenu, Francesco Osborne, Diego Reforgiato Recupero, Angelo Sa (…)2026-07-07
💬 NLP

Adaptive Margin RLHF via Preference over Preferences

यह शोध पत्र 'अडेप्टिव मार्जिन RLHF' (Adaptive Margin RLHF) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो रिवॉर्ड मॉडलिंग और एलाइनमेंट के लिए गतिशील, डेटा-विशिष्ट मार्जिन को अनुमानित करने हेतु "प्रेफरेंस-ओवर-प्रेफरेंस" (preference-over-preference) एनोटेशन का लाभ उठाता है, और विशेष सैंपलिंग रणनीतियों के माध्यम से दोनों के बीच के ट्रेड-ऑफ को संबोधित करते हुए डिस्क्रिमिनेटिव और जनरेटिव प्रदर्शन दोनों को बढ़ाने के लिए DPO-PoP एल्गोरिदम पेश करता है।

Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum2026-07-07
💬 NLP

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

SpatialThinker एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो डेंस स्पेशियल रिवॉर्ड्स के साथ ऑनलाइन रीइन्फोर्समेंट लर्निंग का उपयोग करके एक ही पास में सीन ग्राफ जनरेशन और विजुअल रीजनिंग को एकीकृत करता है, जिससे सीमित प्रशिक्षण डेटा के साथ भी स्थानिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark2026-07-07
💬 NLP

RAG System for Supporting Japanese Litigation Procedures: Faithful Response Generation Complying with Legal Norms

यह शोध पत्र जापानी चिकित्सा मुकदमेबाजी के लिए विशेष रूप से तैयार किए गए एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के डिज़ाइन का प्रस्ताव करता है जो समय-चिह्नित बाहरी ज्ञान को सख्ती से पुनर्प्राप्त करके, निजी जानकारी के उपयोग को प्रतिबंधित करके और यह सुनिश्चित करके कि सभी उत्पन्न प्रतिक्रियाएं प्रदान किए गए संदर्भ के प्रति वफादार रहें, कानूनी अनुपालन सुनिश्चित करता है।

Yuya Ishihara, Atsushi Keyaki, Hiroaki Yamada, Ryutaro Ohara, Mihoko Sumida2026-07-07
💬 NLP

Toward Efficient Agents: Memory, Tool learning, and Planning

यह शोध पत्र मेमोरी, टूल लर्निंग और प्लानिंग में हालिया प्रगति की समीक्षा करके, पारेटो फ्रंटियर (Pareto frontier) परिप्रेक्ष्य के माध्यम से प्रभावशीलता और लागत के बीच के समझौते को अभिलक्षणित करते हुए, और मूल्यांकन प्रोटोकॉल, मेट्रिक्स, चुनौतियों एवं भविष्य की दिशाओं का सारांश प्रस्तुत करते हुए, एजेंटिक सिस्टम (agentic systems) की अक्सर अनदेखी की जाने वाली दक्षता की जांच करता है।

Xiaofang Yang, Lijun Li, Heng Zhou, Tong Zhu, Xiaoye Qu, Yuchen Fan, Qianshan Wei, Rui Ye, Li Kang, Yiran Qin, Daizong L (…)2026-07-07
💬 NLP

No Reliable Evidence of Self-Reported Sentience in Small Large Language Models

स्व-रिपोर्टों को कई मॉडल परिवारों के आंतरिक सक्रियणों (internal activations) पर प्रशिक्षित क्लासिफायर के साथ संयोजित करके, यह अध्ययन इस बात का कोई विश्वसनीय प्रमाण नहीं पाता है कि छोटे से मध्यम आकार के भाषा मॉडलों में अपनी चेतना के प्रति अंतर्निहित विश्वास है, क्योंकि वे लगातार और सत्यनिष्ठा से स्वयं के सचेत होने से इनकार करते हैं।

Caspar Kaiser, Sean Enderby2026-07-07
💬 NLP

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

यह शोध पत्र BoRP को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो मानव निर्णयों के साथ संरेखण में जनरेटिव बेसलाइन्स से बेहतर, उच्च-सटीक और लागत प्रभावी उपयोगकर्ता संतुष्टि स्कोर उत्पन्न करने के लिए LLM लेटेंट स्पेस ज्योमेट्री और पार्शियल लीस्ट स्क्वायर्स रिग्रेशन का लाभ उठाता है।

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang2026-07-07
💬 NLP

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

यह शोध पत्र FlashBlock का प्रस्ताव करता है, जो एक नवीन तंत्र है जो वर्तमान ब्लॉक के बाहर के टोकन से स्थिर क्रॉस-स्टेप अटेंशन आउटपुट को कैश और पुन: उपयोग करके लॉन्ग-कॉन्टेक्स्ट ब्लॉक डिफ्यूजन को त्वरित करता है, जिससे जनरेशन की गुणवत्ता बनाए रखते हुए कम्प्यूटेशनल ओवरहेड और KV कैश एक्सेस को महत्वपूर्ण रूप से कम किया जा सकता है।

Zhuokun Chen, Jianfei Cai, Bohan Zhuang2026-07-07