💬 NLP

Re-defining Humor Data Objects for AI Humor Research

यह शोध पत्र एलएलएम (LLM) के लिए उच्च-गुणवत्तापूर्ण हास्य स्पष्टीकरण उत्पन्न करने हेतु एक बेहतर प्रॉम्प्टिंग रणनीति विकसित करके, एआई (AI) अनुसंधान में हास्य को एक संदर्भ-निर्भर सामाजिक अंतःक्रिया के रूप में पुनर्व्याख्यायित करता है, जिससे डेटा संश्लेषण के लिए एक स्केलेबल डेटासेट का निर्माण होता है और सामाजिक व्यवहार के रूप में हास्य की समझ को आगे बढ़ाया जाता है।

Anna Arnett, Bang Nguyen, Meng Jiang2026-05-26
💬 NLP

Knowledge Graph-Driven Expert-Level Reasoning for Neuroscience

यह शोधपत्र प्रदर्शित करता है कि एक एकल तंत्रिका विज्ञान (न्यूरोसाइंस) पाठ्यपुस्तक से प्राप्त उच्च-गुणवत्ता वाले नॉलेज ग्राफ पर, मल्टी-हॉप क्यू एंड ए (QA) प्रशिक्षण और सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) के साथ संवर्धित करके, एक भाषा मॉडल को विशेष रूप से फाइन-ट्यून करना, विशेषज्ञ-स्तरीय तर्क क्षमता को सक्षम बनाता है जो सटीकता में बड़े भाषा मॉडलों से बेहतर है जबकि इसमें आदेशों के परिमाण (ऑर्डर्स ऑफ मैग्नीट्यूड) कम पैरामीटर्स का उपयोग होता है।

Jake Stephen, Niraj K. Jha2026-05-26
💬 NLP

By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode

यह शोध पत्र उन किनारों (edge cases) की गणना और मौखिक विवरण के माध्यम से कानूनी औपचारिकताओं (legal formalizations) की व्यवस्थित रूप से तुलना करने की एक विधि प्रस्तुत करता है जहाँ वे असहमत होते हैं, यह प्रकट करते हुए कि संरचनात्मक समानता व्यवहार संबंधी निरंतरता की गारंटी नहीं देती है और कि LLM-जनित औपचारिकताएं विशिष्ट, कानूनी रूप से महत्वपूर्ण विचलन उत्पन्न कर सकती हैं।

Julius Vernie, Matthias Grabmair2026-05-26
💬 NLP

Clarification Is Not Enough: Post-Clarification Answering Remains the Bottleneck in Multi-Turn QA

यद्यपि सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) मल्टी-टर्न क्यू एंड ए (multi-turn QA) में स्पष्टीकरण के लिए प्रश्न पूछने के निर्णय लेने की मॉडल की क्षमता को प्रभावी ढंग से सुधार सकती है, लेकिन मुख्य बाधा स्पष्टीकरण के बाद भी उपयोगकर्ता की प्रतिक्रियाओं को सटीक रूप से व्याख्या करने और सही अंतिम उत्तर उत्पन्न करने में सिस्टम की अक्षमता बनी हुई है।

Jinyan Su, Jennifer Healey2026-05-26
💬 NLP

JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

यह शोधपत्र जजमेंटबेंच (JudgmentBench) को प्रस्तुत करता है, जो विशेषज्ञ वकीलों द्वारा रूब्रिक स्कोर और युग्म-आधारित वरीयताओं (pairwise preferences) के साथ एनोटेट किए गए 30 कानूनी कार्यों का एक नवीन बेंचमार्क है, जो यह प्रदर्शित करता है कि तुलनात्मक निर्णय गुणवत्ता रैंकिंग को पुनः प्राप्त करने में रूब्रिक-आधारित स्कोरिंग की तुलना में काफी बेहतर प्रदर्शन करते हैं और इसके लिए आधे से भी कम एनोटेशन समय की आवश्यकता होती है।

Russell Yang, Ruishi Chen, Pierce Kelaita, Riya Ranjan, Sibo Ma, Charles Dickens, Matthew Guillod, Megan Ma, Julian Nyar (…)2026-05-26
💬 NLP

Inference Time Optimization with Confidence Dynamics

यह शोध पत्र कॉन्फिडेंस डायनेमिक गेन (CDG) को प्रस्तुत करता है, जो एक नवीन इन्फरेंस-टाइम ऑप्टिमाइज़ेशन विधि है जो सही बनाम गलत रीजनिंग ट्रेसेस के विशिष्ट कॉन्फिडेंस ट्राजेक्टरी पैटर्न का लाभ उठाकर कई लार्ज लैंग्वेज मॉडल्स और गणितीय बेंचमार्क में उत्तर चयन और प्रदर्शन को महत्वपूर्ण रूप से सुधारती है।

Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei2026-05-26
💬 NLP

Knowing but Not Showing: LLMs Recognize Ambiguity but Rarely Ask Clarifying Questions

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) में एक महत्वपूर्ण अंतराल को प्रकट करता है जहाँ, क्वेरी की अस्पष्टता को स्पष्ट रूप से पहचानने की उनकी क्षमता के बावजूद, वे स्पष्टीकरण के लिए प्रश्न पूछने के बजाय सीधे उत्तर देने की ओर अत्यधिक झुकाव रखते हैं, और यह प्रवृत्ति तब और अधिक बढ़ जाती है जब रिट्रीव्ड कॉन्टेक्स्ट (प्राप्त संदर्भ) उपलब्ध होता है।

Jinyan Su, Claire Cardie2026-05-26
💬 NLP

Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams

यह शोध पत्र यह प्रदर्शित करता है कि LLM एजेंटों में टूल-कॉल प्रक्षेपवक्र (tool-call trajectories) का निर्देशित निर्भरता ग्राफ (directed dependency graph), मॉडल के रेसिडुअल स्ट्रीम्स (residual streams) से रैखिक रूप से डिकोड करने योग्य है, जो यह दर्शाता है कि नेटवर्क केवल स्थितिगत क्रम या पहचानकर्ता मानों को ट्रैक करने के बजाय सक्रिय रूप से अमूर्त निष्पादन टोपोलॉजी (abstract execution topology) का प्रतिनिधित्व करता है।

Tianda Sun, Dimitar Kazakov2026-05-26
💬 NLP

P1SCO: Social Dimensions from a Perspectivist Lens

यह शोध पत्र P1SCO प्रस्तुत करता है, जो सामाजिक मीडिया टिप्पणियों का एक नवीन डेटासेट है जिसे दस सामाजिक आयामों में एनोटेट किया गया है और जिसमें समृद्ध एनोटेटर मेटाडेटा शामिल है, जिसे इस बात पर सूक्ष्म शोध को सुगम बनाने के लिए डिज़ाइन किया गया है कि कैसे सामाजिक धारणाएं विभिन्न प्लेटफार्मों, व्यक्तियों और जनसांख्यिकीय कारकों के अनुसार भिन्न होती हैं।

Amanda Cercas Curry, Gianmarco de Francisci Morales, Luca Maria Aiello2026-05-26
💬 NLP

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

यह शोध पत्र GeoMathCode प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्रोग्रामेटिक कोड को मध्यवर्ती दृश्य आउटपुट के रूप में उपयोग करके ज्यामिति समस्या-समाधान को बढ़ाता है, यह प्रकट करते हुए कि सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) तर्क और कोड जनरेशन को अलग करती है जबकि पदानुक्रमित सिंटैक्टिक संरचनाएं दृश्य निरूपणों की तुलना में अधिक समृद्ध गणितीय जानकारी कैप्चर करती हैं।

Yingji Zhang, Yong Dai, André Freitas2026-05-26