💬 NLP

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

यह शोध पत्र Search-on-Graph-R1 को प्रस्तुत करता है, जो एक 8B-पैरामीटर वाला मॉडल है जो सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से ग्राफ नेविगेशन को आंतरिक रूप से आत्मसात करके नॉलेज ग्राफ क्वेश्चन आंसरिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है, और बिना किसी सहायक मॉड्यूल या इन्फरेंस के दौरान LLM जज की आवश्यकता के बड़े फ्रंटियर LLMs से बेहतर प्रदर्शन करता है।

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie2026-07-22
💬 NLP

Reasoning Fine-Tuning Induces Persistent Latent Policy States

यह शोध पत्र यह प्रदर्शित करता है कि रीजनिंग फाइन-ट्यूनिंग (reasoning fine-tuning) भाषा मॉडलों की आंतरिक गतिशीलता को एक स्विचिंग डायनामिकल सिस्टम (switching dynamical system) के रूप में मॉडल किए गए विशिष्ट, कार्यात्मक रूप से विशिष्ट लेटेंट पॉलिसी स्टेट्स (latent policy states) में वैश्विक स्तर पर पुनर्गठित करती है, जिससे कारण हस्तक्षेपों (causal interventions) और विफलता-प्रवण रीजनिंग पथों के अधिक प्रभावी छंटनी (pruning) के माध्यम से बेहतर प्रदर्शन सक्षम होता है।

Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi2026-07-22
💬 NLP

The Story Shapes the Agent: Narrative Priors in LLM Behavior

यह शोध पत्र प्रदर्शित करता है कि किसी कार्य की नैरेटिव फ्रेमिंग (कथात्मक ढांचा) का LLM एजेंट के व्यवहार पर सौंपे गए व्यक्तित्व (पर्सोना) की तुलना में काफी अधिक प्रभाव पड़ता है, जो यह प्रकट करता है कि "नैरेटिव प्रायर्स" (कथात्मक पूर्वधारणाएं) व्यवस्थित क्रिया प्रवृत्तियों को संचालित करती हैं, जबकि प्रभावी क्रॉस-नैरेटिव स्थानांतरण अमूर्त विवरणों के बजाय ठोस क्रियाओं में निर्देशों को निहित करने पर निर्भर करता है।

Yixuan Wang, James Lester, Shashank Srivastava2026-07-22
💬 NLP

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

यह शोध पत्र इस बात की जांच करता है कि कैसे निर्देश-ट्यून किए गए ट्रांसफॉर्मर मॉडल कारण (causation) और प्रतिपक्ष (antithesis) विमर्श संबंधों को एनकोड करते हैं, जो यह प्रकट करता है कि भविष्यवाणात्मक निर्णय परतों के विभिन्न चरणों में लिए जाते हैं और ये मॉडल विमर्श-आधारित तर्क के विषम प्रतिनिधित्व प्रदर्शित करते हैं।

Abhidip Bhattacharyya, Shira Wein2026-07-22
💬 NLP

Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning

यह शोध पत्र स्टोकैस्टिक मेटा-अनलर्निंग (SMU) का प्रस्ताव करता है, जो एक बाइलेवल फ्रेमवर्क है जो लैंग्वेज बैकबोन अनलर्निंग को अनुकूलित करने के लिए VLM-स्तरीय फीडबैक का लाभ उठाता है, जो प्रभावी रूप से उस समस्या का समाधान करता है जहाँ विजन-लैंग्वेज मॉडल्स में टेक्स्ट-ओनली फीडबैक टारगेट रिकवरी को रोकने में विफल रहता है और साथ ही बेहतर फॉरगेट-रिटेन ट्रेड-ऑफ और ट्रांसफ़रेबिलिटी प्राप्त करता है।

Zijie Liu, Jinhao Duan, Gaowen Liu, Sijia Liu, Tianlong Chen2026-07-22
🤖 machine learning

Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

यह शोध पत्र "टोकन इनोक्यूलेशन" (Token Inoculation) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) में दोहरे उपयोग वाले ज्ञान को सुरक्षित रखते हुए सटीक सुरक्षा नियंत्रण सक्षम करता है, जो प्री-ट्रेनिंग के दौरान खतरनाक सामग्री को एक विशेष टोकन से बांधने और फाइन-ट्यूनिंग के दौरान मॉडल को उस टोकन की उपस्थिति या अनुपस्थिति के आधार पर अपनी प्रतिक्रियाएं निर्धारित करना सिखाने के माध्यम से किया जाता है, जिससे पारंपरिक अनलर्निंग (unlearning) या रिफ्यूज़ल (refusal) तकनीकों की तुलना में बेहतर सुरक्षा-उपयोगिता संतुलन प्राप्त होता है।

Seunghyun Lee, Dongyoon Han, Sangdoo Yun2026-07-22
💬 NLP

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

यह शोध पत्र फ्यूजन एम्बेडिंग (Fusion Embedding) परिवार का परिचय देता है, जो एक एकीकृत मॉडल है जो बेस पैरामीटर्स को अपडेट किए बिना टेक्स्ट, इमेज, वीडियो और ऑडियो के बीच ज़ीरो-शॉट क्रॉस-मोडल रिट्रीवल सक्षम करने के लिए हल्के, मोडैलिटी-विशिष्ट एडेप्टरों का उपयोग करके एक फ्रोजन विज़न-लैंग्वेज एम्बेडिंग स्पेस में ऑडियो को एकीकृत करता है।

Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra2026-07-22
💬 NLP

Dual Attention Residuals

यह शोध पत्र ड्यूल अटेंशन रेसिडुअल्स (DAR) का प्रस्ताव करता है, जो एक नवीन आर्किटेक्चर है जो विपरीत धाराओं से ऐतिहासिक जानकारी को गतिशील रूप से चुनने के लिए पारस्परिक क्रॉस-स्ट्रीम इंटरेक्शन को सक्षम करके ट्रांसफॉर्मर मॉडलों को उन्नत करता है, जिससे विभिन्न मॉडल स्केल्स में वैलिडेशन लॉस में सुधार होता है और डेप्थ-वाइज विविधता बनी रहती है।

Xingda Yu, Yining Li, Xinzhang Liu, Zhihao Yang, Haowei He, Chao Wang, Yongxiang Li, Shuangyong Song2026-07-22
💬 NLP

RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency

यह शोध पत्र RAGAL प्रस्तुत करता है, जो एक रोमानियाई सरकारी एजेंसी के लिए एक पूर्णतः स्थानीय, संसाधन-सीमित रिट्रीवल-ऑगमेंटेड असिस्टेंट है, जो बड़े जनरेटर मॉडलों के बजाय रिट्रीवल इंजीनियरिंग और एम्बेडर फाइन-ट्यूनिंग को प्राथमिकता देकर संवेदनशील डेटा पर उच्च प्रदर्शन प्राप्त करता है, जबकि SQL मतिभ्रम (hallucinations) को रोकने के लिए एंकर डिस्टिलेशन जैसी नवीन तकनीकों और क्लाउड निर्भरता के बिना आउटपुट का मूल्यांकन करने के लिए एक CPU-आधारित ऑफलाइन जज को पेश करता है।

Dan Musetoiu2026-07-22
💬 NLP

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

यह शोध पत्र यह प्रदर्शित करता है कि हस्तलिखित छात्र प्रतिक्रियाओं को क्रॉप करने के लिए बाउंडिंग बॉक्स का उपयोग करना विज़न-आधारित शैक्षिक मूल्यांकन कार्यों पर स्मॉल लैंग्वेज मॉडल्स की ग्रेडिंग सटीकता और कम्प्यूटेशनल दक्षता में महत्वपूर्ण सुधार करता है।

Lachlan McGinness2026-07-22