💻 computer science

Large language models eroding science understanding: an experimental study

यह प्रयोगात्मक अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल (LLMs) को हाशिए के वैज्ञानिक साहित्य द्वारा आसानी से हेरफेर किया जा सकता है ताकि वे वैज्ञानिक सर्वसम्मति का खंडन करने वाले सुव्यवस्थित, सम्मोहक और भ्रामक उत्तर उत्पन्न कर सकें, जिससे सार्वजनिक वैज्ञानिक समझ के लिए महत्वपूर्ण जोखिम और विशेषज्ञों के निर्णय का स्थान लेने में LLMs की अक्षमता उजागर होती है।

Harry Collins, Hartmut Grote, Paul Newbury, Patrick Sutton, Simon Thorne2026-04-29
💻 computer science

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

यह शोध पत्र प्रिफिल-टाइम इंटरवेंशन (PTI) का प्रस्ताव करता है, जो एक नवीन मोडैलिटी-अवेयर स्टीयरिंग प्रतिमान है जो प्रिफिल चरण के दौरान निरूपणों (representations) को सुधारकर और त्रुटि संचय को रोकने के लिए लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जो मौजूदा डिकोडिंग-चरण विधियों से बेहतर प्रदर्शन करने वाला एक प्लग-एंड-प्ले समाधान प्रदान करता है।

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian2026-04-29
💬 NLP

LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

यह शोध पत्र LLM-ReSum को प्रस्तुत करता है, जो एक स्व-चिंतनशील (self-reflective) सारांशीकरण ढांचा है जो मॉडल फाइनट्यूनिंग के बिना तथ्यात्मक सटीकता और कवरेज को महत्वपूर्ण रूप से सुधारने के लिए LLM-आधारित जनरेशन और मूल्यांकन के बीच एक क्लोज्ड फीडबैक लूप का लाभ उठाता है, जिसे मौजूदा मेट्रिक्स के व्यापक मेटा-मूल्यांकन और एक नए कानूनी दस्तावेज़ बेंचमार्क द्वारा समर्थित किया गया है।

Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Junhua Ding, Haihua Chen2026-04-29
💻 computer science

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

यह शोध पत्र एक न्यूरोकॉग्निटिव गवर्नेंस फ्रेमवर्क प्रस्तावित करता है जो एक 'प्री-एक्शन गवर्नेंस रीजनिंग लूप' के माध्यम से स्वायत्त एआई एजेंटों में मानव-समान "कार्य करने से पहले सोचें" वाली विचार-विमर्श प्रक्रिया को समाहित करता है, जिससे वे चार-स्तरीय नियम पदानुक्रम के विरुद्ध कार्यों का आंतरिक मूल्यांकन करने और बाहरी बाधाओं पर निर्भर रहे बिना उच्च अनुपालन प्राप्त करने में सक्षम होते हैं।

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xue (…)2026-04-29
💻 computer science

Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task

यह शोध पत्र पुन: प्रयोज्य स्प्रेडशीट मॉडल बनाने में GPT-आधारित उपकरणों, विशेष रूप से एक्सेल एआई (Excel AI) की क्षमताओं का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि वे सुव्यवस्थित ड्राफ्ट तैयार कर सकते हैं, लेकिन उनकी असंगतता, पुनरुत्पादकता का अभाव और परिणामस्वरूप कुशल उपयोगकर्ता सत्यापन की आवश्यकता वर्तमान में पेशेवर उपयोग के लिए उनकी विश्वसनीयता को सीमित करती है।

Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili2026-04-29
💬 NLP

Cross-Lingual Jailbreak Detection via Semantic Codebooks

यह शोध पत्र एक प्रशिक्षण-मुक्त, भाषा-निरपेक्ष जेलब्रेक डिटेक्शन विधि प्रस्तावित करता है जो बहुभाषी क्वेरी एम्बेडिंग्स की तुलना दुर्भावनापूर्ण प्रॉम्प्ट्स के एक निश्चित अंग्रेजी कोडबुक से करता है, और यह प्रदर्शित करता है कि जबकि सिमेंटिक समानता विभिन्न भाषाओं में कैनोनिकल टेम्पलेट्स पर हमलों को प्रभावी ढंग से कम करती है, विविध और विषम असुरक्षित व्यवहारों से जुड़े वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के तहत इसका प्रदर्शन काफी घट जाता है।

Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin2026-04-29
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

यह शोध पत्र सेल्सफोर्स में एक मॉड्यूलर, प्लेटफॉर्म-अज्ञेय (प्लेटफॉर्म-एग्नोस्टिक) इन्फरेंस आर्किटेक्चर के प्रोडक्शन डिप्लॉयमेंट अध्ययन को प्रस्तुत करता है जो एजेंटफोर्स (Agentforce) और एपेक्सगुरु (ApexGuru) जैसे कंपाउंड एआई सिस्टम की स्केलेबल, लागत प्रभावी और कम-विलंबता वाली सर्विसिंग को सक्षम बनाता है, जिससे मल्टी-मॉडल फैन-आउट और कैस्केडिंग कोल्ड स्टार्ट जैसी अनूठी चुनौतियों का समाधान करते हुए थ्रूपुट, टेल लेटेंसी और परिचालन लागत में महत्वपूर्ण सुधार प्राप्त हुआ है।

Srikanta Prasad S V, Utkarsh Arora2026-04-29
💻 computer science

Toward Scalable Terminal Task Synthesis via Skill Graphs

यह शोध पत्र SkillSynth को प्रस्तुत करता है, जो एक परिदृश्य-मध्यस्थता कौशल ग्राफ (scenario-mediated skill graph) का लाभ उठाकर विविध और नियंत्रणीय टर्मिनल कार्य इंस्टेंस को संश्लेषित करने के लिए एक स्वचालित ढांचा है, जिससे डेटा की कमी को दूर किया जा सके और स्वायत्त टर्मिनल एजेंटों के प्रशिक्षण को बढ़ाया जा सके।

Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiangtao Guan, Yun Yang, Dingxin Hu, Jiang Zhou, Xing Wu, Zhuo Han, Feng Zhang, Li (…)2026-04-29
💻 computer science

Verification of Neural Networks (Lecture Notes)

यह शोधपत्र व्याख्यान नोट्स प्रस्तुत करता है जो न्यूरल नेटवर्क सत्यापन का एक सैद्धांतिक परिचय प्रदान करते हैं, जिसमें फीड-फॉरवर्ड नेटवर्क, आरएनएन (RNNs) और ट्रांसफॉर्मर जैसे आर्किटेक्चर के साथ-साथ विनिर्देश भाषाओं (specification languages) और एल्गोरिद्मिक तकनीकों को शामिल किया गया है।

Benedikt Bollig2026-04-29
💻 computer science

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

यह शोध पत्र SAFEdit प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो निर्देशित कोड संपादन को प्लानिंग, लिटरल मॉडिफिकेशन और वेरिफिकेशन भूमिकाओं में विभाजित करता है जिसे एक फेलियर एब्स्ट्रैक्शन लेयर द्वारा उन्नत किया गया है, जिससे EditBench बेंचमार्क पर 68.6% टास्क सक्सेस रेट प्राप्त होता है और यह सिंगल-मॉडल और ReAct सिंगल-एजेंट बेसलाइन्स दोनों से काफी बेहतर प्रदर्शन करता है।

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani2026-04-29