💬 NLP

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

यह शोध पत्र TimeLens प्रस्तुत करता है, जो वीडियो टेम्पोरल ग्राउंडिंग के लिए एक व्यवस्थित ढांचा है जो एक उच्च-गुणवत्ता वाला बेंचमार्क और प्रशिक्षण डेटासेट (TimeLens-Bench और TimeLens-100K) स्थापित करता है, साथ ही ओपन-सोर्स मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के बीच अत्याधुनिक प्रदर्शन प्राप्त करने के लिए इंटरलीव्ड टेक्स्टुअल एनकोडिंग और थिंकिंग-फ्री RLVR जैसे कुशल एल्गोरिदम डिजाइनों का प्रस्ताव देता है।

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang2026-03-27
💬 NLP

A Geolocation-Aware Multimodal Approach for Ecological Prediction

यह शोध पत्र GAMMA को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-आधारित भू-स्थानिक रूप से जागरूक बहुआयामी ढांचा (multimodal framework) है, जो निरंतर रिमोट सेंसिंग इमेजरी और विरल प्रजाति अवलोकनों जैसे विषम पारिस्थितिक डेटा स्रोतों को प्रभावी ढंग से एकीकृत करता है, ताकि बड़े पैमाने पर पर्यावरणीय चर के सटीक पूर्वानुमान में महत्वपूर्ण सुधार किया जा सके।

Valerie Zermatten, Chiara Vanalli, Gencer Sumbul, Diego Marcos, Devis Tuia2026-03-27
💬 NLP

SciCoQA: Quality Assurance for Scientific Paper--Code Alignment

यह शोध पत्र SciCoQA पेश करता है, जो एक ऐसा डेटासेट है जिसमें वास्तविक दुनिया की समस्याओं और सिंथेटिक जनरेशन से प्राप्त 635 पेपर-कोड विसंगतियां शामिल हैं, ताकि वैज्ञानिक प्रकाशनों के निष्ठापूर्ण कार्यान्वयन को सुनिश्चित करने में बड़े भाषा मॉडल (large language models) की सीमाओं का मूल्यांकन और उन्हें उजागर किया जा सके।

Tim Baumgärtner, Iryna Gurevych2026-03-27
💬 NLP

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

यह अध्ययन एलएलएम (LLMs) को सामाजिक विज्ञान के विषयों के रूप में मूल्यांकन करने के लिए 'कंडीशन्ड कमेंट प्रेडिक्शन' (CCP) प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि सुपरवाइज्ड फाइन-ट्यूनिंग (Supervised Fine-Tuning) आउटपुट संरचना को संरेखित करती है, यह अर्थ संबंधी ग्राउंडिंग (semantic grounding) को कम करती है और उच्च-सटीकता वाले उपयोगकर्ता सिमुलेशन के लिए स्पष्ट जीवनी संबंधी कंडीशनिंग के बजाय लेटेंट व्यवहार संबंधी अनुमान (latent behavioral inference) को प्राथमिकता देती है।

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger2026-03-27
💬 NLP

When Consistency Becomes Bias: Interviewer Effects in Semi-Structured Clinical Interviews

यह शोध पत्र प्रकट करता है कि अर्ध-संरचित नैदानिक साक्षात्कारों पर प्रशिक्षित स्वचालित अवसाद पहचान मॉडल अक्सर प्रतिभागियों के वास्तविक भाषाई संकेतों के बजाय साक्षात्कारकर्ता के प्रॉम्प्ट्स (prompts) में निहित व्यवस्थित पूर्वाग्रहों का लाभ उठाकर बढ़ा-चढ़ाकर प्रदर्शन प्राप्त करते हैं, जो वैध व्याख्यात्मकता के लिए विश्लेषण को केवल रोगी के कथनों तक सीमित करने की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Hasindri Watawana, Sergio Burdisso, Diego A. Moreno-Galván, Fernando Sánchez-Vega, A. Pastor López-Monroy, Petr Motlicek (…)2026-03-27
💬 NLP

Demystifying When Pruning Works via Representation Hierarchies

यह शोध पत्र यह स्पष्ट करता है कि नेटवर्क प्रूनिंग (network pruning) गैर-जनरेटिव कार्यों में क्यों सफल होती है लेकिन जनरेटिव सेटिंग्स में क्यों विफल हो जाती है, यह प्रदर्शित करते हुए कि जहाँ एम्बेडिंग और लॉजिट रिप्रजेंटेशन प्रूनिंग के प्रति मजबूत बने रहते हैं, वहीं संभावनाओं (probabilities) में गैर-रेखीय रूपांतरण विक्षोभों (perturbations) को बढ़ा देता है, जिससे जनरेशन के दौरान त्रुटियों का संचय होता है।

Shwai He, Guoheng Sun, Haichao Zhang, Yun Fu, Ang Li2026-03-27
💬 NLP

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

यह शोधपत्र SlopCodeBench प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह दर्शाता है कि वर्तमान कोडिंग एजेंट लंबी अवधि के पुनरावृत्ति कार्यों (long-horizon iterative tasks) में व्यवस्थित रूप से विफल होते हैं, क्योंकि वे बढ़ती हुई शब्द-बहुलता (verbosity) और संरचनात्मक क्षरण (structural erosion) के माध्यम से कोड की गुणवत्ता में निरंतर गिरावट प्रदर्शित करते हैं, एक ऐसी समस्या जिसे पास-रेट बेंचमार्क पकड़ने में विफल रहते हैं।

Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghou (…)2026-03-27
💬 NLP

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

यह शोध पत्र प्रदर्शित करता है कि सिंथेटिक रीराइटिंग (synthetic rewriting) पुर्तगाली निरंतर प्रीट्रेनिंग (Portuguese continued pretraining) के लिए एक स्केल-डिपेंडेंट क्वालिटी मल्टीप्लायर (scale-dependent quality multiplier) के रूप में कार्य करती है, जो उच्च-गुणवत्ता वाले स्रोत डेटा पर लागू होने पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाती है लेकिन कम-गुणवत्ता वाले डेटा के लिए न्यूनतम लाभ प्रदान करती है।

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini2026-03-27
🤖 machine learning

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

यह शोध पत्र एक मल्टी-आंसर रीइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तुत करता है जो भाषा मॉडलों को एक ही फॉरवर्ड पास में आत्मविश्वास अनुमानों के साथ कई संभावित परिकल्पनाओं को उत्पन्न करने के लिए प्रशिक्षित करता है, जो विविध बेंचमार्क में विविधता, अंशांकन (कैलिब्रेशन) और सटीकता में सुधार करते हुए इन्फरेंस-टाइम स्केलिंग विधियों के लिए एक कंप्यूट-कुशल विकल्प प्रदान करता है।

Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim2026-03-27
🤖 AI

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

यह शोधपत्र DreamHouse प्रस्तुत करता है, जो भौतिक जनरेटिव रीजनिंग (physical generative reasoning) के लिए एक नवीन बेंचमार्क है, जो विजन-लैंग्वेज मॉडल्स की पुनरावृत्ति एजेंटिक इंटरैक्शन (iterative agentic interaction) के माध्यम से संरचनात्मक रूप से सुदृढ़ और कोड-अनुपालन वाले टिम्बर-फ्रेम घरों के निर्माण की क्षमता का मूल्यांकन करता है, जो भौतिक तर्क (physical reasoning) में महत्वपूर्ण क्षमता अंतराल को प्रकट करता है जो वर्तमान विजुअल-रियलिज्म-केंद्रित मूल्यांकनों में अदृश्य हैं।

Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen2026-03-27