💬 NLP

Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge

यह शोध पत्र पहचानता है कि जज के रूप में उपयोग किए जाने वाले LLMs सीधे रेटिंग असाइन करते समय महत्वपूर्ण स्कोर रेंज बायस (score range bias) प्रदर्शित करते हैं, और इस समस्या को कम करने के लिए एक कंट्रास्टिव डिकोडिंग (contrastive decoding) विधि प्रस्तावित करता है, जो विभिन्न सारांशीकरण कार्यों में मानवीय निर्णयों के साथ संरेखण में 11.7% तक का सापेक्ष सुधार प्राप्त करती है।

Yoshinari Fujinuma2026-04-09
💬 NLP

VisCoder2: Building Multi-Language Visualization Coding Agents

यह शोध पत्र VisCoder2 को प्रस्तुत करता है, जो बड़े पैमाने के VisCode-Multi-679K डेटासेट पर प्रशिक्षित बहु-भाषा विज़ुअलाइज़ेशन कोडिंग मॉडल्स का एक परिवार है और जिसे VisPlotBench के माध्यम से मूल्यांकित किया गया है, जो 12 प्रोग्रामिंग भाषाओं में इटरेटिव सेल्फ-डीबगिंग के माध्यम से मौजूदा ओपन-सोर्स बेसलाइन से काफी बेहतर प्रदर्शन करता है और प्रोप्राइटरी मॉडल के प्रदर्शन के करीब पहुँचता है।

Yuansheng Ni, Songcheng Cai, Xiangchao Chen, Jiarong Liang, Zhiheng Lyu, Jiaqi Deng, Kai Zou, Ping Nie, Fei Yuan, Xiang (…)2026-04-09
💬 NLP

How to Evaluate Speech Translation with Source-Aware Neural MT Metrics

यह शोध पत्र स्पीच ट्रांसलेशन (वाक् अनुवाद) के लिए सोर्स-अवेयर न्यूरल मेट्रिक्स का पहला व्यवस्थित अध्ययन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एएसआर (ASR) ट्रांसक्रिप्ट्स और बैक-ट्रांसलेशन, एक नवीन क्रॉस-लिंगुअल री-सेगमेंटेशन एल्गोरिदम द्वारा संवर्धित होकर, प्रभावी सिंथेटिक सोर्स प्रॉक्सी के रूप में कार्य करते हैं—ताकि तब भी मानवीय निर्णयों के साथ मजबूत सहसंबंध प्राप्त किया जा सके जब सोर्स ट्रांसक्रिप्ट्स उपलब्ध न हों।

Mauro Cettolo, Marco Gaido, Matteo Negri, Sara Papi, Luisa Bentivogli2026-04-09
💻 computer science

Knowledge Graphs Generation from Cultural Heritage Texts: Combining LLMs and Ontological Engineering for Scholarly Debates

यह शोध पत्र ATR4CH प्रस्तुत करता है, जो एक व्यवस्थित पाँच-चरणीय कार्यप्रणाली है जो अनस्ट्रक्चर्ड सांस्कृतिक विरासत ग्रंथों को स्ट्रक्चर्ड, क्वेरेबल नॉलेज ग्राफ में स्वचालित रूप से परिवर्तित करने के लिए लार्ज लैंग्वेज मॉडल्स को ऑन्टोलॉजिकल इंजीनियरिंग के साथ जोड़ती है, जो प्रामाणिकता मूल्यांकन संबंधी बहसों पर एक केस स्टडी के माध्यम से उच्च निष्कर्षण सटीकता और लागत प्रभावी परिनियोजन का प्रदर्शन करती है।

Andrea Schimmenti, Valentina Pasqual, Fabio Vitali, Marieke van Erp2026-04-09
💬 NLP

Improved Evidence Extraction and Metrics for Document Inconsistency Detection with LLMs

यह शोध पत्र एक रेडैक्ट-एंड-रिट्राय (redact-and-retry) फ्रेमवर्क को पेश करके LLM-आधारित दस्तावेज़ विसंगति का पता लगाने पर सीमित शोध को संबोधित करता है, जिसमें सीमित फ़िल्टरिंग और नए व्यापक मेट्रिक्स शामिल हैं, जो साक्ष्य निष्कर्षण प्रदर्शन में महत्वपूर्ण सुधार करते हैं और एक नए जारी किए गए अर्ध-सिंथेटिक डेटासेट का उपयोग करके मान्य किए जाते हैं।

Nelvin Tan, Yaowen Zhang, James Asikin Cheung, Fusheng Liu, Yu-Ching Shih, Dong Yang2026-04-09
💬 NLP

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

यह शोधपत्र PEARL प्रस्तुत करता है, जो एक बाहरी प्राथमिकता स्मृति (external preference memory) से सुसज्जित एक सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है, जो नए प्रस्तावित CalConflictBench पर प्रदर्शित होने के अनुसार, उपयोगकर्ता की प्राथमिकताओं को गतिशील रूप से सीखकर और उनके अनुकूल होकर लंबी अवधि के कैलेंडर संघर्षों को हल करने में लार्ज लैंग्वेज मॉडल्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji2026-04-09
💻 computer science

WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search

WebExpert एक डोमेन-जागरूक वेब एजेंट है जो वित्त और बायोमेडिसिन जैसे विशिष्ट क्षेत्रों में उच्च-परिशुद्धता खोज को बढ़ाने के लिए वाक्य-स्तरीय अनुभव पुनर्प्राप्ति (sentence-level experience retrieval), कमजोर रूप से पर्यवेक्षित पहलू प्रेरण (weakly supervised facet induction), और प्राथमिकता-अनुकूलित योजना (preference-optimized planning) को एकीकृत करता है ताकि मौजूदा बेसलाइन की तुलना में उत्तर की सटीकता में उल्लेखनीय सुधार किया जा सके और नेविगेशन चरणों को कम किया जा सके।

Yuelin Hu, Zhengxue Cheng, Ronghua Wu, Qunshan Gu, Hongwei Hu, Wei Liu, Qiao Liang, Li Song2026-04-09
💻 computer science

Benchmarking LLM Tool-Use in the Wild

यह शोध पत्र WildToolBench प्रस्तुत करता है, जो वास्तविक दुनिया के उपयोगकर्ता व्यवहारों पर आधारित एक नया बेंचमार्क है ताकि जटिल, अव्यवस्थित और लचीले मल्टी-टर्न टूल-उपयोग परिदृश्यों को संभालने में वर्तमान लार्ज लैंग्वेज मॉडल्स की महत्वपूर्ण सीमाओं को उजागर किया जा सके, जिससे यह पता चलता है कि ऑर्केस्ट्रेशन, प्रासंगिक अनुमान और गतिशील निर्देश संक्रमणों की चुनौतियों के कारण कोई भी मूल्यांकित मॉडल 15% सटीकता से अधिक नहीं है।

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang2026-04-09
💻 computer science

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

यह ऑडिट अध्ययन प्रकट करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का मूल्यांकन केवल एपीआई एंडपॉइंट्स के माध्यम से करना वास्तविक दुनिया के चैटबॉट व्यवहारों को पकड़ने में विफल रहता है, जो यह दर्शाता है कि इंटरफ़ेस-विशिष्ट कारक, सामयिक गतिशीलता और नीतिगत विकल्प भ्रमपूर्ण या षड्यंत्रकारी विचारधारा के सुदृढ़ीकरण को महत्वपूर्ण रूप से प्रभावित करते हैं, जिसमें नए मॉडल अभी भी पर्याप्त सुरक्षा जोखिम और समय के साथ अस्थिर प्रदर्शन प्रदर्शित करते हैं।

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci2026-04-09
💬 NLP

The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?

यह शोध पत्र 'स्टेपवाइज़ इन्फॉर्मेटिवनेस अज़म्प्शन' (Stepwise Informativeness Assumption) का प्रस्ताव करता है और अनुभवजन्य रूप से इसे मान्य करता है, जो यह स्पष्ट करता है कि मैक्सिमम-लाइक्लीहुड और रीइन्फोर्समेंट लर्निंग प्रशिक्षण के माध्यम से वैध रीजनिंग ट्रेसेस (reasoning traces) अपेक्षा के माध्यम से उत्तर-प्रासंगिक सूचना संचित करते हैं, जिससे बड़े भाषा मॉडलों में आंतरिक एंट्रॉपी डायनेमिक्स और तर्क की शुद्धता के बीच सहसंबंध स्थापित होता है।

Mar Gonzàlez I Català, Haitz Sáez de Ocáriz Borde, George D. Montañez, Pietro Liò2026-04-09