💬 NLP

Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis

यह शोध पत्र यह तर्क देता है कि बड़े पैमाने पर प्रीट्रेनिंग अकेले बड़े भाषा मॉडलों को विश्वसनीय कानूनी "साधारण अर्थ" (ordinary meaning) विश्लेषण के लिए तैयार करने हेतु अपर्याप्त है, क्योंकि अनुभवजन्य साक्ष्य प्रकट करते हैं कि उनके निष्कर्ष मामूली प्रॉम्प्ट विविधताओं के विरुद्ध सुदृढ़ता का अभाव रखते हैं और मानव निर्णयों के साथ केवल मध्यम सहसंबंध दिखाते हैं, जो उन्हें उच्च-दांव वाले न्यायिक संदर्भों में आधिकारिक उपयोग के लिए अनुपयुक्त बनाता है।

Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider2026-05-15
💬 NLP

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning

यह शोध पत्र नेटिव पैरेलल रीज़नर (NPR) को प्रस्तुत करता है, जो एक टीचर-फ्री फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को सेल्फ-डिस्टिल्ड प्रोग्रेसिव ट्रेनिंग, पैरेलल-अवेयर पॉलिसी ऑप्टिमाइज़ेशन और एक रिफैक्टर्ड एक्जीक्यूशन इंजन के माध्यम से वास्तविक समानांतर तर्क (पैरेलल रीजनिंग) क्षमताओं को स्वयं विकसित करने में सक्षम बनाता है, जिससे ऑटोरिग्रेसिव डिकोडिंग पर वापस जाए बिना महत्वपूर्ण प्रदर्शन लाभ और 4.6 गुना तक इन्फरेंस स्पीडअप प्राप्त होता है।

Tong Wu, Yang Liu, Jun Bai, Zixia Jia, Shuyi Zhang, Ziyong Lin, Yanting Wang, Song-Chun Zhu, Zilong Zheng2026-05-15
💬 NLP

Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks

यह शोध पत्र PolyBench प्रस्तुत करता है, जो संरचित ज्ञान के साथ संवर्धित 125,0{00} से अधिक पॉलीमर डिज़ाइन कार्यों का एक बड़े पैमाने का बेंचमार्क डेटासेट है, और यह प्रदर्शित करता है कि एक नवीन ज्ञान-संवर्धित तर्क आसवन (knowledge-augmented reasoning distillation) विधि के साथ प्रशिक्षित छोटे भाषा मॉडल, पॉलीमर डिज़ाइन के बारे में तर्क करने में समान आकार के मॉडलों से बेहतर प्रदर्शन कर सकते हैं और फ्रंटियर LLMs के साथ प्रतिस्पर्धा कर सकते हैं।

Dikshya Mohanty, Mohammad Saqib Hasan, Syed Mostofa Monsur, Size Zheng, Benjamin Hsiao, Niranjan Balasubramanian2026-05-15
💬 NLP

OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling

यह शोध पत्र OPT-Engine प्रस्तुत करता है, जो ऑप्टिमाइज़ेशन मॉडलिंग कार्यों पर लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक स्केलेबल बेंचमार्क फ्रेमवर्क है, जो यह प्रकट करता है कि वर्तमान प्रतिमान जटिलता बढ़ने के साथ मजबूती बनाए रखने में संघर्ष करते हैं और सॉल्वर-एकीकृत तर्क (solver-integrated reasoning) के लिए स्वचालित बाधा निर्माण (automated constraint formulation) को प्राथमिक बाधा के रूप में पहचानता है।

Yitian Chen, Cheng Cheng, Yinan Sun, Zi Ling, Dongdong Ge2026-05-15
💬 NLP

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

यह शोधपत्र FactNet को प्रस्तुत करता है, जो एक बिलियन-स्केल बहुभाषी नॉलेज ग्राफ है जो 1.7 बिलियन विकीडेटा एसेर्शन (assertions) को बाइट-लेवल सटीकता के साथ 3 बिलियन से अधिक मूल-भाषा विकिपीडिया साक्ष्य पॉइंटर्स से जोड़ता है, और इसके साथ ही FactNet-Bench इवैल्यूएशन सुइट भी दिया गया है जिसे विभिन्न भाषाओं में तथ्यात्मक ग्राउंडिंग और ज्ञान हस्तांतरण का आकलन करने और सुधारने के लिए डिज़ाइन किया गया है।

Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Su (…)2026-05-15
💬 NLP

Do Reasoning LLMs Refuse What They Infer in Long Contexts?

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट रीजनिंग (long-context reasoning) वाले एलएलएम (LLM) में एक महत्वपूर्ण सुरक्षा अंतराल को उजागर करता है, जो यह दर्शाता है कि जबकि मॉडल स्पष्ट रूप से हानिकारक अनुरोधों को प्रभावी ढंग से अस्वीकार करते हैं, उनकी अस्वीकृति दर तब काफी कम हो जाती है जब हानिकारक उद्देश्यों को खंडित संदर्भ टुकड़ों में छिपा दिया जाता है जिन्हें पुनर्गठित करने के लिए कंपोजिशनल इन्फरेंस (compositional inference) की आवश्यकता होती है।

Yu Fu, Haz Sameen Shahgir, Huanli Gong, Zhipeng Wei, N. Benjamin Erichson, Yue Dong2026-05-15
💻 computer science

A Hormone-inspired Emotion Layer for Transformer language models (HELT)

यह शोध पत्र HormoneT5 प्रस्तुत करता है, जो एक नवीन ट्रांसफॉर्मर आर्किटेक्चर है जो निरंतर, बहु-आयामी भावनात्मक अवस्थाओं को सिम्युलेट करने के लिए जैविक रूप से प्रेरित हार्मोन इमोशन ब्लॉक को एकीकृत करके भाषा मॉडलों में भावनात्मक बुद्धिमत्ता को बढ़ाता है, जिसके परिणामस्वरूप बेसलाइन मॉडलों की तुलना में काफी अधिक सहानुभूतिपूर्ण और भावनात्मक रूप से उपयुक्त प्रतिक्रियाएं प्राप्त होती हैं।

Eslam Reda, Sara El-Metwally2026-05-15
💻 computer science

PREPING: Building Agent Memory without Tasks

यह शोध पत्र Preping को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एजेंटों को लक्षित कार्यों का सामना करने से पहले एक प्रपोजर-गाइडेड लूप का उपयोग करके उच्च-गुणवत्ता वाले सिंथेटिक अभ्यास प्रक्षेपवक्र (trajectories) उत्पन्न करने और उन्हें चुनिष्ट रूप से संग्रहीत करने के माध्यम से प्रक्रियात्मक स्मृति (procedural memory) का निर्माण करने में सक्षम बनाता है, जिससे ऑनलाइन मेमोरी निर्माण की तुलना में काफी कम परिनियोजन लागत के साथ कोल्ड-स्टार्ट अंतराल को दूर किया जा सकता है।

Yumin Choi, Sangwoo Park, Minki Kang, Jinheon Baek, Sung Ju Hwang2026-05-15
🤖 machine learning

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

यह शोधपत्र TraFL को प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक ट्रजेक्टरी-बैलेंस पोस्ट-ट्रेनिंग विधि है जो रिवॉर्ड-मैक्सिमाइजिंग दृष्टिकोणों की "ट्रजेक्टरी लॉकिंग" विफलता मोड पर विजय प्राप्त करने के लिए पॉलिसी को एक रिवॉर्ड-टिल्टेड टार्गेट डिस्ट्रीब्यूशन के साथ संरेखित करता है, जिससे गणितीय तर्क और कोड जनरेशन बेंचमार्क में निरंतर प्रदर्शन लाभ प्राप्त होता है।

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui2026-05-15
💬 NLP

VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use

यह शोध पत्र VectraYX-Nano को प्रस्तुत करता है, जो एक 42M-पैरामीटर वाला स्पेनिश भाषा मॉडल है जिसे करिकुलम लर्निंग और नेटिव मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) टूल इंटीग्रेशन के साथ एक क्यूरेटेड साइबर सुरक्षा कॉर्पस पर स्क्रैच से प्रशिक्षित किया गया है, जो कमोडिटी हार्डवेयर पर प्रभावी प्रदर्शन प्रदर्शित करता है और नैनो-स्केल पर कॉर्पस डेंसिटी और टूल-यूज़ क्षमताओं के बीच के संबंध में नई अंतर्दृष्टि प्रदान करता है।

Juan S. Santillana2026-05-15