💬 NLP

Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing

यह शोध पत्र जनरल गेम प्लेइंग परिवेश के भीतर चार लार्ज लैंग्वेज मॉडल्स की औपचारिक तर्क क्षमताओं का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि वर्तमान मॉडल्स ने महत्वपूर्ण प्रगति दिखाई है, लेकिन कार्य की जटिलता और स्टेप डेप्थ बढ़ने के साथ उनका प्रदर्शन घट जाता है, जो अक्सर काल्पनिक नियमों (hallucinated rules) और सिंटैक्टिक गलतियों जैसी विशिष्ट तर्क संबंधी त्रुटियों के कारण होता है।

Maciej Świechowski, Adam Żychowski, Jacek Mańdziuk2026-02-24
💬 NLP

Next Reply Prediction X Dataset: Linguistic Discrepancies in Naively Generated Content

यह शोध पत्र X (पूर्व में ट्विटर) पर एक नवीन इतिहास-सशर्त उत्तर पूर्वानुमान डेटासेट प्रस्तुत करता है ताकि सरलता से जनरेट की गई लार्ज लैंग्वेज मॉडल सामग्री और प्रामाणिक मानवीय संचार के बीच भाषाई विसंगतियों को मापा जा सके, जो कम्प्यूटेशनल सोशल साइंस अनुसंधान की वैधता में सुधार करने के लिए एक ढांचा प्रदान करता है।

Simon Münker, Nils Schwager, Kai Kugler, Michael Heseltine, Achim Rettinger2026-02-24
💬 NLP

Learning to Reason for Multi-Step Retrieval of Personal Context in Personalized Question Answering

यह शोध पत्र PR2 प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो अनुकूलन योग्य नीतियों को सीखने के माध्यम से व्यक्तिगत प्रश्न उत्तर प्रक्रिया को बढ़ाता है ताकि यह गतिशील रूप से निर्धारित किया जा सके कि कब और क्या व्यक्तिगत संदर्भ प्राप्त करना है, जिससे उपयोगकर्ता-विशिष्ट संकेतों के साथ बहु-चरणीय तर्क को एकीकृत किया जा सके और मौजूदा रिट्रीवल-ऑगमेंटेड जनरेशन बेसलाइनों से काफी बेहतर प्रदर्शन किया जा सके।

Maryam Amirizaniani, Alireza Salemi, Hamed Zamani2026-02-24
💬 NLP

SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning

यह शोधपत्र SenTSR-Bench का परिचय देता है, जो एक वास्तविक दुनिया का औद्योगिक समय-श्रृंखला (time-series) नैदानिक तर्क बेंचमार्क है, और एक हाइब्रिड फ्रेमवर्क प्रस्तावित करता है जो सुदृढीकरण शिक्षण (reinforcement learning) का लाभ उठाकर फाइन-ट्यून किए गए टाइम-सीरीज मॉडल्स से डोमेन-विशिष्ट अंतर्दृष्टि को सामान्य तर्क देने वाले LLMs में इंजेक्ट करता है, जो जटिल नैदानिक कार्यों में मौजूदा मॉडल्स से काफी बेहतर प्रदर्शन करता है।

Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang Fang, Danielle C. Maddix, Abdul Fatir Ansar (…)2026-02-24
💬 NLP

How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1

यह शोध पत्र व्यवस्थित रूप से डीप रिसर्च एजेंटों पर प्रॉम्प्ट टेम्पलेट्स, रिवॉर्ड फंक्शन्स और पॉलिसी ऑप्टिमाइजेशन के प्रभाव की जांच करता है, जो यह प्रकट करता है कि फास्ट थिंकिंग प्रॉम्प्ट्स, एक्शन-लेवल पेनल्टी के साथ F1 रिवॉर्ड्स और REINFORCE बेहतर स्थिरता और प्रदर्शन प्रदान करते हैं, जिससे उन्नत Search-R1++ बेसलाइन का विकास हुआ है।

Yinuo Xu, Shuo Lu, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He, Jian Liang2026-02-24
💬 NLP

DEEP: Docker-based Execution and Evaluation Platform

यह शोध पत्र DEEP का परिचय देता है, जो एक डॉकर-आधारित (Docker-based) प्लेटफॉर्म है जो मशीन अनुवाद और ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) मॉडलों के निष्पादन, स्कोरिंग और सांख्यिकीय क्लस्टरिंग विश्लेषण को स्वचालित करता है, साथ ही प्रतिस्पर्धी प्रणालियों के बीच प्रदर्शन के अंतर को विज़ुअलाइज़ करने और व्याख्या करने के लिए एक वेब इंटरफेस प्रदान करता है।

Sergio Gómez González, Miguel Domingo, Francisco Casacuberta2026-02-24
💬 NLP

KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge

यह शोध पत्र KGHaluBench प्रस्तुत करता है, जो एक नवीन नॉलेज ग्राफ-आधारित बेंचमार्क है जो बहुआयामी प्रश्नों को गतिशील रूप से उत्पन्न करता है और 25 फ्रंटियर लार्ज लैंग्वेज मॉडल्स की व्यापकता, गहराई और सत्यता का व्यापक मूल्यांकन करने के लिए एक स्वचालित सत्यापन पाइपलाइन का उपयोग करता है, जिससे भ्रम (hallucinations) को प्रेरित करने वाले कारकों के बारे में गहरी अंतर्दृष्टि प्राप्त होती है।

Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar, Srijith Rajamohan2026-02-24
💬 NLP

Denotational Semantics for ODRL: Knowledge-Based Constraint Conflict Detection

यह शोध पत्र एक डिनोटेशनल सिमेंटिक्स फ्रेमवर्क प्रस्तावित करता है जो बाधाओं (constraints) को नॉलेज बेस (KB) अवधारणाओं में मैप करके विषम ज्ञान आधारों (heterogeneous knowledge bases) में ODRL नीतियों के लिए सुदृढ़, तीन-मूल्य वाले संघर्ष का पता लगाने में सक्षम बनाता है, यह सिद्ध करता है कि संरेखण (alignment) के तहत संघर्ष सुरक्षित रहते हैं और अज्ञात स्थितियों में सुचारू रूप से कम होते हैं, और विविध वर्गीकरणों (taxonomies) एवं संरचनात्मक डोमेन में 154 बेंचमार्क के माध्यम से इस दृष्टिकोण को सत्यापित करता है।

Daham Mustafa, Diego Collarana, Yixin Peng, Rafiqul Haque, Christoph Lange-Bever, Christoph Quix, Stephan Decker2026-02-24
💬 NLP

ReAttn: Improving Attention-based Re-ranking via Attention Re-weighting

यह शोधपत्र ReAttn का प्रस्ताव करता है, जो एक पोस्ट-हॉक (post-hoc), प्रशिक्षण-मुक्त रणनीति है जो लेक्सिकल बायस (lexical bias) को कम करने के लिए क्रॉस-डॉक्यूमेंट IDF वेटिंग और ओवर-कन्सेंट्रेटेड अटेंशन को कम करने के लिए एंट्रॉपी-आधारित रेगुलराइजेशन को लागू करके अटेंशन-आधारित री-रैंकिंग में सुधार करता है, जिससे बिना किसी अतिरिक्त पर्यवेक्षण के प्रासंगिकता स्कोरिंग को बढ़ाया जाता है।

Yuxing Tian, Fengran Mo, Weixu Zhang, Yiyan Qi, Jian-Yun Nie2026-02-24
💬 NLP

Position: General Alignment Has Hit a Ceiling; Edge Alignment Must Be Taken Seriously

यह शोध पत्र यह तर्क देता है कि विविध मानवीय मूल्यों को एक एकल अदिश (scalar) मान में बदलने पर आधारित वर्तमान 'जनरल एलाइनमेंट' का प्रतिमान जटिल सामाजिक-तकनीकी प्रणालियों में एक संरचनात्मक सीमा तक पहुँच गया है, और "एज एलाइनमेंट" (Edge Alignment) के रूप में एक बेहतर ढांचे का प्रस्ताव करता है जो बहु-आयामी मूल्य संरचनाओं को संरक्षित करता है, बहुलवादी प्रतिनिधित्व का समर्थन करता है, और एलाइनमेंट को एक एकल अनुकूलन कार्य के बजाय एक गतिशील शासन जीवनचक्र के रूप में मानता है।

Han Bao, Yue Huang, Xiaoda Wang, Zheyuan Zhang, Yujun Zhou, Carl Yang, Xiangliang Zhang, Yanfang Ye2026-02-24