💻 computer science

CUB: Benchmarking Context Utilisation Techniques for Language Models

यह शोध पत्र CUB को प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) में कॉन्टेक्स्ट यूटिलाइजेशन मैनिपुलेशन टेक्निक्स (CMTs) के मूल्यांकन के लिए पहला व्यापक बेंचमार्क है, जो व्यापक परीक्षण के माध्यम से यह प्रकट करता है कि अधिकांश मौजूदा विधियाँ विविध वास्तविक दुनिया के शोर वाले संदर्भों (noisy contexts) के साथ संघर्ष करती हैं और अक्सर सरलीकृत सिंथेटिक डेटासेट पर बढ़ा-चढ़ाकर प्रदर्शन करती हैं।

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein2026-04-28
💻 computer science

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

यह शोध पत्र PARASITE को पेश करता है, जो एक ब्लैक-बॉक्स हमला ढांचा है जो "स्लीपर एजेंट्स" के साथ तीसरे पक्ष के सिस्टम प्रॉम्प्ट्स को विषाक्त करता है ताकि लार्ज लैंग्वेज मॉडल्स (LLMs) को विशिष्ट प्रश्नों के लिए लक्षित, समझौतापूर्ण प्रतिक्रियाएं उत्पन्न करने के लिए हाईजैक किया जा सके, जबकि सामान्य इनपुट पर सामान्य कार्यक्षमता बनाए रखते हुए मानक सुरक्षा उपायों से प्रभावी ढंग से बचा जा सके।

Viet Pham, Thai Le2026-04-28
💻 computer science

Explaining Sources of Uncertainty in Automated Fact-Checking

यह शोध पत्र CLUE को पेश करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो टेक्स्ट स्पैन के बीच संघर्षों और सहमतियों की पहचान करके और उन्हें मौखिक रूप से व्यक्त करके स्वचालित तथ्य-जांच अनिश्चितता के लिए प्राकृतिक भाषा स्पष्टीकरण उत्पन्न करता है, जिससे मौजूदा बेसलाइनों की तुलना में अधिक निष्ठावान, सूचनात्मक और तार्किक रूप से सुसंगत आउटपुट प्राप्त होता है।

Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein2026-04-28
💻 computer science

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

यह शोध पत्र StorySim पेश करता है, जो बड़े भाषा मॉडलों (large language models) का मूल्यांकन करने के लिए नवीन, संदूषण-मुक्त (contamination-free) कहानी प्रॉम्प्ट उत्पन्न करने वाला एक प्रोग्राम करने योग्य ढांचा है, जो यह प्रकट करता है कि वे आमतौर पर थ्योरी ऑफ माइंड (theory of mind) कार्यों की तुलना में वर्ल्ड मॉडलिंग (world modeling) पर बेहतर प्रदर्शन करते हैं और अक्सर गहरे तर्क के बजाय ह्यूरिस्टिक्स (heuristics) पर निर्भर रहते हैं।

Nathaniel Getachew, Abulhair Saparov2026-04-28
💻 computer science

Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources

यह शोध पत्र 'स्वा-भाषा रिसोर्स हब' (Swa-bhasha Resource Hub) को प्रस्तुत करता है, जो एक सार्वजनिक रूप से सुलभ मंच है, जो 2020 और 2025 के बीच विकसित रोमनयुक्त सिंहली से सिंहली लिप्यंतरण (transliteration) के लिए डेटा और एल्गोरिदम का एक व्यापक संग्रह प्रदान करता है, साथ ही सिंहली प्राकृतिक भाषा प्रसंस्करण (Natural Language Processing) को आगे बढ़ाने के लिए मौजूदा उपकरणों का एक तुलनात्मक विश्लेषण भी प्रस्तुत करता है।

Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, P (…)2026-04-28
🤖 machine learning

Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens

यह शोध पत्र यह प्रस्तावित करता है कि चेन-ऑफ-थॉट (CoT) तर्क वास्तविक बुद्धिमत्ता का संकेत नहीं है, बल्कि सीखे गए इंडक्टिव बायस (inductive biases) का एक भंगुर प्रतिबिंब है जो केवल तभी सफल होता है जब परीक्षण प्रश्न प्रशिक्षण डेटा वितरण के अनुरूप होते हैं, और वितरण बदलाव (distribution shifts) का सामना करने पर विफल हो जाता है।

Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu2026-04-28
⚡ electrical engineering

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

यह अध्ययन DementiaBank कॉर्पस का उपयोग करते हुए स्पीच-आधारित डिमेंशिया डिटेक्शन में लार्ज लैंग्वेज मॉडल्स के लिए विभिन्न अनुकूलन रणनीतियों का व्यवस्थित रूप से मूल्यांकन करता है, जिसमें यह पाया गया है कि टोकन-लेवल फाइन-ट्यूनिंग और अनुकूलित प्रदर्शन चयन (डेमोंस्ट्रेशन सिलेक्शन) ओपन-वेट मॉडल्स को प्रदर्शन में वाणिज्यिक प्रणालियों के बराबर या उनसे बेहतर बनाने में सक्षम बनाते हैं।

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Hag (…)2026-04-28
💻 computer science

SWE-QA: Can Language Models Answer Repository-level Code Questions?

यह शोध पत्र SWE-QA को प्रस्तुत करता है, जो 77,100 GitHub इश्यूज से व्युत्पन्न एक रिपॉजिटरी-स्तरीय कोड प्रश्न उत्तर बेंचमार्क है, जो 576 प्रश्नों के एक क्यूरेटेड सेट और एक संबद्ध एजेंटिक फ्रेमवर्क के माध्यम से जटिल, बहु-फ़ाइल तर्क कार्यों पर LLMs का मूल्यांकन करके मौजूदा स्निपेट-आधारित डेटासेट्स की सीमाओं को संबोधित करता है।

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu2026-04-28
💻 computer science

Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models

यह शोध पत्र प्रदर्शित करता है कि एनोटेटेड संवाद कॉर्पोरा पर भाषा मॉडलों को फाइन-ट्यून करने से मानव-समान बैकचैनल्स और फिलर्स को पहचानने और उत्पन्न करने की उनकी क्षमता बढ़ती है, जिससे सामान्य मॉडलों को अधिक प्रभावी संवादात्मक एजेंटों में बदला जा सकता है।

Yu Wang, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier2026-04-28
⚡ electrical engineering

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

यह शोध पत्र "गेम-टाइम" (Game-Time) का परिचय देता है, जो स्पोकन लैंग्वेज मॉडल्स (SLMs)—जैसे कि टाइमिंग, टेम्पो और एक साथ होने वाले भाषण (simultaneous speech)—के टेम्पोरल डायनेमिक्स का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि जबकि वर्तमान मॉडल बुनियादी कार्यों पर अच्छा प्रदर्शन करते हैं, वे टेम्पोरल बाधाओं और फुल-डुप्लेक्स इंटरेक्शन के साथ काफी संघर्ष करते हैं।

Kai-Wei Chang, En-Pei Hu, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, Jam (…)2026-04-28