💻 computer science

DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

DualFact+ एक नवीन द्वि-स्तरीय, बहुविध ढांचे (dual-layer, multimodal framework) को पेश करता है जो प्रक्रियात्मक वीडियो तथ्यों को वैचारिक और प्रासंगिक घटकों में अलग करता है ताकि वीडियो कैप्शनिंग का अधिक व्याख्या योग्य और मानव-संरेखित मूल्यांकन प्रदान किया जा सके, जिससे यह प्रकट होता है कि अत्याधुनिक मॉडल अक्सर व्यवस्थित तथ्यात्मक चूकों और विसंगतियों से ग्रस्त होते हैं जिन्हें मानक मेट्रिक्स पकड़ने में विफल रहते हैं।

Cennet Oguz, Yasser Hamidullah, Josef van Genabith, Simon Ostermann2026-04-29
💻 computer science

Emotive Architectures: The Role of LLMs in Adjusting Work Environments

यह शोध पत्र हाइब्रिड वर्कस्पेस में लार्ज लैंग्वेज मॉडल्स को एकीकृत करने के लिए एक ढांचे का प्रस्ताव करता है ताकि भावनात्मक और व्यवहार संबंधी संकेतों के आधार पर भौतिक और डिजिटल वातावरण को गतिशील रूप से समायोजित किया जा सके, जिससे गोपनीयता और एजेंसी संबंधी महत्वपूर्ण नैतिक चिंताओं को संबोधित करते हुए उपयोगकर्ता के कल्याण और जुड़ाव को बढ़ाया जा सके।

Lara Vartziotis, Tina Vartziotis, Frank Beutenmueller, Stella Salta, Konstantinos Moraitis, Miltiadis Katsaros, Sotirios (…)2026-04-29
💻 computer science

HotComment: A Benchmark for Evaluating Popularity of Online Comments

यह शोध पत्र HotComment को प्रस्तुत करता है, जो एक मल्टीमॉडल बेंचमार्क है जो सामग्री की गुणवत्ता, लोकप्रियता भविष्यवाणी और उपयोगकर्ता व्यवहार सिमुलेशन को एकीकृत करके ऑनलाइन कमेंट की लोकप्रियता का मूल्यांकन करता है, साथ ही सामाजिक रूप से अनुनादपूर्ण शैलीगत संरेखण (स्टाइलिश अलाइनमेंट) को मॉडल करने के लिए प्रस्तावित StyleCmt फ्रेमवर्क को भी शामिल करता है।

Yafeng Wu, Yunyao Zhang, Liliang Ye, Guiyi Zeng, Junqing Yu, Chen Xu, Zikai Song2026-04-29
💻 computer science

Large language models eroding science understanding: an experimental study

यह प्रयोगात्मक अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल (LLMs) को हाशिए के वैज्ञानिक साहित्य द्वारा आसानी से हेरफेर किया जा सकता है ताकि वे वैज्ञानिक सर्वसम्मति का खंडन करने वाले सुव्यवस्थित, सम्मोहक और भ्रामक उत्तर उत्पन्न कर सकें, जिससे सार्वजनिक वैज्ञानिक समझ के लिए महत्वपूर्ण जोखिम और विशेषज्ञों के निर्णय का स्थान लेने में LLMs की अक्षमता उजागर होती है।

Harry Collins, Hartmut Grote, Paul Newbury, Patrick Sutton, Simon Thorne2026-04-29
💻 computer science

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

यह शोध पत्र प्रिफिल-टाइम इंटरवेंशन (PTI) का प्रस्ताव करता है, जो एक नवीन मोडैलिटी-अवेयर स्टीयरिंग प्रतिमान है जो प्रिफिल चरण के दौरान निरूपणों (representations) को सुधारकर और त्रुटि संचय को रोकने के लिए लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जो मौजूदा डिकोडिंग-चरण विधियों से बेहतर प्रदर्शन करने वाला एक प्लग-एंड-प्ले समाधान प्रदान करता है।

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian2026-04-29
💬 NLP

LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

यह शोध पत्र LLM-ReSum को प्रस्तुत करता है, जो एक स्व-चिंतनशील (self-reflective) सारांशीकरण ढांचा है जो मॉडल फाइनट्यूनिंग के बिना तथ्यात्मक सटीकता और कवरेज को महत्वपूर्ण रूप से सुधारने के लिए LLM-आधारित जनरेशन और मूल्यांकन के बीच एक क्लोज्ड फीडबैक लूप का लाभ उठाता है, जिसे मौजूदा मेट्रिक्स के व्यापक मेटा-मूल्यांकन और एक नए कानूनी दस्तावेज़ बेंचमार्क द्वारा समर्थित किया गया है।

Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Junhua Ding, Haihua Chen2026-04-29
💻 computer science

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

यह शोध पत्र एक न्यूरोकॉग्निटिव गवर्नेंस फ्रेमवर्क प्रस्तावित करता है जो एक 'प्री-एक्शन गवर्नेंस रीजनिंग लूप' के माध्यम से स्वायत्त एआई एजेंटों में मानव-समान "कार्य करने से पहले सोचें" वाली विचार-विमर्श प्रक्रिया को समाहित करता है, जिससे वे चार-स्तरीय नियम पदानुक्रम के विरुद्ध कार्यों का आंतरिक मूल्यांकन करने और बाहरी बाधाओं पर निर्भर रहे बिना उच्च अनुपालन प्राप्त करने में सक्षम होते हैं।

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xue (…)2026-04-29
💻 computer science

Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task

यह शोध पत्र पुन: प्रयोज्य स्प्रेडशीट मॉडल बनाने में GPT-आधारित उपकरणों, विशेष रूप से एक्सेल एआई (Excel AI) की क्षमताओं का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि वे सुव्यवस्थित ड्राफ्ट तैयार कर सकते हैं, लेकिन उनकी असंगतता, पुनरुत्पादकता का अभाव और परिणामस्वरूप कुशल उपयोगकर्ता सत्यापन की आवश्यकता वर्तमान में पेशेवर उपयोग के लिए उनकी विश्वसनीयता को सीमित करती है।

Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili2026-04-29
💬 NLP

Cross-Lingual Jailbreak Detection via Semantic Codebooks

यह शोध पत्र एक प्रशिक्षण-मुक्त, भाषा-निरपेक्ष जेलब्रेक डिटेक्शन विधि प्रस्तावित करता है जो बहुभाषी क्वेरी एम्बेडिंग्स की तुलना दुर्भावनापूर्ण प्रॉम्प्ट्स के एक निश्चित अंग्रेजी कोडबुक से करता है, और यह प्रदर्शित करता है कि जबकि सिमेंटिक समानता विभिन्न भाषाओं में कैनोनिकल टेम्पलेट्स पर हमलों को प्रभावी ढंग से कम करती है, विविध और विषम असुरक्षित व्यवहारों से जुड़े वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के तहत इसका प्रदर्शन काफी घट जाता है।

Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin2026-04-29
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

यह शोध पत्र सेल्सफोर्स में एक मॉड्यूलर, प्लेटफॉर्म-अज्ञेय (प्लेटफॉर्म-एग्नोस्टिक) इन्फरेंस आर्किटेक्चर के प्रोडक्शन डिप्लॉयमेंट अध्ययन को प्रस्तुत करता है जो एजेंटफोर्स (Agentforce) और एपेक्सगुरु (ApexGuru) जैसे कंपाउंड एआई सिस्टम की स्केलेबल, लागत प्रभावी और कम-विलंबता वाली सर्विसिंग को सक्षम बनाता है, जिससे मल्टी-मॉडल फैन-आउट और कैस्केडिंग कोल्ड स्टार्ट जैसी अनूठी चुनौतियों का समाधान करते हुए थ्रूपुट, टेल लेटेंसी और परिचालन लागत में महत्वपूर्ण सुधार प्राप्त हुआ है।

Srikanta Prasad S V, Utkarsh Arora2026-04-29