💬 NLP

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

यह शोध पत्र पॉलिसीबेंच (PolicyBench) को पेश करता है, जो स्मृति (memorization), समझ (understanding) और अनुप्रयोग (application) के माध्यम से नीति बोध (policy comprehension) के मूल्यांकन के लिए एक बड़े पैमाने का क्रॉस-सिस्टम बेंचमार्क है, और पॉलिसीमोई (PolicyMoE) का प्रस्ताव करता है, जो एक विशिष्ट मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जो संरचित तर्क (structured reasoning) और अनुप्रयोग-उन्मुख नीति कार्यों पर उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chaw (…)2026-04-15
💬 NLP

One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness

यह शोध पत्र प्रकट करता है कि निर्देश-अनुकूलित (instruction-tuned) बड़े भाषा मॉडल अत्यधिक भंगुरता प्रदर्शित करते हैं, जो निर्देश ट्यूनिंग द्वारा प्रेरित एक नियोजन विफलता (planning failure) के कारण मामूली शाब्दिक बाधाओं के अधीन होने पर व्यापकता में ढह जाते हैं, एक ऐसी भेद्यता जो मानक स्वतंत्र मूल्यांकन मेट्रिक्स द्वारा अन détected रहती है लेकिन युग्मवार तुलनाओं (pairwise comparisons) के माध्यम से उजागर होती है।

Erfan Baghaei Potraghloo, Seyedarmin Azizi, Souvik Kundu, Massoud Pedram2026-04-15
🤖 machine learning

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

यह शोध पत्र बड़े भाषा मॉडलों में ऑन-पॉलिसी डिस्टिलेशन (OPD) की गतिशीलता और तंत्रों की व्यवस्थित रूप से जांच करता है, यह पहचानते हुए कि सफलता संगत विचार पैटर्न और नवीन शिक्षक क्षमताओं पर निर्भर करती है, एक टोकन-स्तरीय संरेखण तंत्र को प्रकट करता है, और विफल होते OPD को पुनः प्राप्त करने के लिए व्यावहारिक रणनीतियों का प्रस्ताव देते हुए लंबी अवधि के कार्यों के लिए इसकी स्केलेबिलिटी पर प्रश्न उठाता है।

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyu (…)2026-04-15
💬 NLP

Toward Autonomous Long-Horizon Engineering for ML Research

यह शोध पत्र AiScientist को प्रस्तुत करता है, जो एक स्वायत्त प्रणाली है जो पदानुक्रमित ऑर्केस्ट्रेशन (hierarchical orchestration) को अवस्था निरंतरता (state continuity) बनाए रखने के लिए एक टिकाऊ "फ़ाइल-एज़-बस" (File-as-Bus) वर्कस्पेस के साथ जोड़कर लॉन्ग-होराइजन एमएल रिसर्च इंजीनियरिंग में महत्वपूर्ण प्रगति करती है, जिससे यह प्रमुख बेंचमार्क पर बेसलाइन से बेहतर प्रदर्शन करती है और यह प्रदर्शित करती है कि प्रभावी दीर्घकालिक अनुसंधान केवल एक स्थानीय तर्क चुनौती नहीं बल्कि एक सिस्टम्स समन्वय समस्या है।

Guoxin Chen, Jie Chen, Lei Chen, Jiale Zhao, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Cheng Chen, Ji-Rong Wen, Kai Jia2026-04-15
💬 NLP

SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis

यह शोध पत्र सीनक्रिटिक (SceneCritic) को प्रस्तुत करता है, जो एक संरचित स्थानिक ऑन्टोलॉजी (SceneOnto) पर आधारित एक प्रतीकात्मक मूल्यांकनकर्ता है जो 3D इनडोर दृश्य लेआउट का स्थिर, वस्तु-स्तरीय आकलन प्रदान करता है, जो विजन-लैंग्वेज मॉडल्स की तुलना में मानव निर्णय के साथ बेहतर संरेखण प्रदर्शित करता है और यह प्रकट करता है कि अर्थ संबंधी (semantic) और अभिविन्यास (orientation) त्रुटियों को सुधारने के लिए छवि-आधारित परिशोधन सबसे प्रभावी है।

Kathakoli Sengupta, Kai Ao, Paola Cascante-Bonilla2026-04-15
💬 NLP

SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions

यह शोध पत्र SciTune को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो बड़े भाषा मॉडलों (large language models) को मानव-क्यूरेटेड वैज्ञानिक मल्टीमॉडल निर्देशों के साथ संरेखित करता है, जिसके परिणामस्वरूप एक मॉडल (LLaMA-SciTune) प्राप्त होता है जो वैज्ञानिक विज़ुअल और लैंग्वेज बेंचमार्क पर अत्याधुनिक प्रणालियों से काफी बेहतर प्रदर्शन करता है, और कुछ श्रेणियों में मानव प्रदर्शन को भी पीछे छोड़ देता है।

Sameera Horawalavithana, Sai Munikoti, Ian Stewart, Henry Kvinge, Karl Pazdernik2026-04-14
💬 NLP

Language Reconstruction with Brain Predictive Coding from fMRI Data

यह शोध पत्र PredFT का प्रस्ताव करता है, जो एक नवीन fMRI-से-टेक्स्ट डिकोडिंग फ्रेमवर्क है जो विशिष्ट रुचि के क्षेत्रों (regions of interest) से मस्तिष्क के प्रेडिक्टिव रिप्रजेंटेशन को एक मुख्य नेटवर्क में एकीकृत करके प्रेडिक्टिव कोडिंग थ्योरी का लाभ उठाता है, जिससे यह मस्तिष्क संकेतों से निरंतर भाषा के पुनर्निर्माण में मौजूदा मॉडलों से बेहतर प्रदर्शन करता है।

Congchi Yin, Ziyi Ye, Piji Li2026-04-14
💬 NLP

RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine

यह शोध पत्र RiTeK प्रस्तुत करता है, जो एक व्यापक बेंचमार्क डेटासेट है जिसे डेटा की कमी, टोपोलॉजिकल अभिव्यक्ति और रिट्रीवल प्रदर्शन की वर्तमान सीमाओं को संबोधित करते हुए मेडिकल टेक्स्टुअल नॉलेज ग्राफ्स पर लार्ज लैंग्वेज मॉडल्स की जटिल तर्क क्षमताओं का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है।

Jiatan Huang, Mingchen Li, Zonghai Yao, Dawei Li, Yuxin Zhang, Zhichao Yang, Yongkang Xiao, Feiyun Ouyang, Xiaohan Li, S (…)2026-04-14
💬 NLP

Improving LLM Unlearning Robustness via Random Perturbations

यह शोध पत्र प्रकट करता है कि वर्तमान LLM अनलर्निंग विधियाँ अनजाने में 'फॉरगेट-टोकन्स' को लक्षित निरूपणों (target representations) के साथ संरेखित करके बैकडोर कमजोरियों को जन्म देती हैं, और अनलर्निंग प्रदर्शन को बनाए रखते हुए इस समस्या को कम करने के लिए एक मॉडल-अज्ञेयवादी रैंडम नॉइज़ ऑग्मेंटेशन (RNA) तकनीक का प्रस्ताव करता है।

Dang Huu-Tien, Hoang Thanh-Tung, Anh Bui, Minh-Phuong Nguyen, Le-Minh Nguyen, Naoya Inoue2026-04-14
💬 NLP

Ultra-Low-Dimensional Prompt Tuning via Random Projection

यह शोध पत्र अल्ट्रा-लो-डायमेंशनल प्रॉम्प्ट ट्यूनिंग (ULPT) को प्रस्तुत करता है, जो एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो एक फ्रोजन रैंडम अप-प्रोजेक्शन मैट्रिक्स का उपयोग करके अल्ट्रा-लो-डायमेंशनल स्पेस (जैसे, 2D) में प्रॉम्प्ट्स को अनुकूलित करती है, जिससे 20 से अधिक NLP कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करते हुए प्रशिक्षण योग्य मापदंडों (trainable parameters) में 98% की कमी आती है।

Zijun Wu, Yongchang Hao, Lili Mou2026-04-14