🤖 machine learning

ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

यह शोध पत्र ClawGUI को प्रस्तुत करता है, जो वर्चुअल और फिजिकल डिवाइसेस के लिए एक स्थिर RL इंफ्रास्ट्रक्चर, एक मानकीकृत बेंचमार्किंग पाइपलाइन और क्रॉस-प्लेटफॉर्म एजेंट डिप्लॉयमेंट प्रदान करके GUI एजेंट्स के प्रशिक्षण, मूल्यांकन और परिनियोजन (डिप्लॉयमेंट) को एकीकृत करने वाला एक ओपन-सोर्स फ्रेमवर्क है, जो अंततः ClawGUI-2B मॉडल को मोबाइल GUI कार्यों में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करने में सक्षम बनाता है।

Fei Tang, Zhiqiong Lu, Boxuan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen2026-04-14
💬 NLP

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

यह शोध पत्र CLSGen को प्रस्तुत करता है, जो एक नवीन ड्यूल-हेड फाइन-ट्यूनिंग फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को सुसंगत मौखिक स्पष्टीकरण (verbalized explanations) उत्पन्न करने की अपनी क्षमता को बनाए रखते हुए बाइनरी क्लासिफिकेशन के लिए विश्वसनीय मात्रात्मक संभाव्यताएं (quantitative probabilities) उत्पन्न करने में सक्षम बनाता है, जिससे पारंपरिक विभेदक दृष्टिकोणों (discriminative approaches) में पाई जाने वाली कैटास्ट्रोफिक फॉरगेटिंग और भाषाई पतन (linguistic collapse) की सीमाओं को दूर किया जा सके।

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller2026-04-14
💬 NLP

Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus

यह शोधपत्र सार-वॉइस (Saar-Voice) का परिचय देता है, जो नौ वक्ताओं के संरेखित पाठ और ऑडियो के साथ सारब्रुकन जर्मन बोली का एक छह घंटे का भाषण संग्रह है, जिसे एनएलपी (NLP) में बोलियों के अल्प-प्रतिनिधित्व को संबोधित करने और कम-संसाधन वाले, बोली-जागरूक टेक्स्ट-टू-स्पीच सिस्टम में भविष्य के अनुसंधान को समर्थन देने के लिए डिज़ाइन किया गया है।

Lena S. Oberkircher, Jesujoba O. Alabi, Dietrich Klakow, Jürgen Trouvain2026-04-14
🤖 AI

Detecting Safety Violations Across Many Agent Traces

यह शोध पत्र मीरकैट (Meerkat) को प्रस्तुत करता है, जो एक नवीन प्रणाली है जो एजेंटिक खोज (agentic search) के साथ क्लस्टरिंग को जोड़ती है ताकि एजेंट ट्रेसेस के बड़े सेट में दुर्लभ और जटिल सुरक्षा उल्लंघनों का कुशलतापूर्वक पता लगाया जा सके, जो सीड परिदृश्यों (seed scenarios) या व्यापक सूचीकरण (exhaustive enumeration) पर निर्भर रहे बिना दुरुपयोग, रिवॉर्ड हैकिंग और डेवलपर धोखाधड़ी की पहचान करने में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong2026-04-14
💬 NLP

Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution

यह शोध पत्र "NeuronLens" का प्रस्ताव करके बड़े भाषा मॉडलों (large language models) में पॉलीसेमैनिसिटी (polysemanticity) के कारण होने वाले विविक्त न्यूरॉन-अवधारणा एट्रिब्यूशन (discrete neuron-concept attribution) की सीमाओं को चुनौती देता है, जो व्यक्तिगत न्यूरॉन्स के बजाय अवधारणा-विशिष्ट सक्रियण श्रेणियों (concept-specific activation ranges) का विश्लेषण और हस्तक्षेप करके अधिक सटीक व्याख्यात्मकता (interpretability) और लक्षित हेरफेर (targeted manipulation) प्राप्त करता है।

Muhammad Umair Haider, Hammad Rizwan, Hassan Sajjad, Peizhong Ju, A. B. Siddique2026-04-13
💻 computer science

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

यह शोध पत्र कॉन्फिडेंस-अवेयर अटेंशन कैलिब्रेशन (CAAC) फ्रेमवर्क प्रस्तुत करता है, जो एक ट्रेनिंग-मुक्त विधि है जो विजुअल-टोकन कैलिब्रेशन और एडेप्टिव अटेंशन री-स्केलिंग के माध्यम से स्थानिक धारणा और मोडैलिटी पूर्वाग्रहों को सुधारकर लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करती है, जिससे लॉन्ग-फॉर्म जनरेशन कार्यों में सटीकता में उल्लेखनीय सुधार होता है।

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu2026-04-13
💬 NLP

Bayesian Social Deduction with Graph-Informed Language Models

यह शोध पत्र एक हाइब्रिड फ्रेमवर्क पेश करता है जो विश्वास अनुमान (belief inference) के लिए एक संरचित संभाव्य मॉडल को भाषा संवाद के लिए एक LLM के साथ जोड़ता है, जिससे एक सोशल डिटेक्शन एजेंट 'अवलॉन' के खेल में बड़े लैंग्वेज मॉडल्स और मानव खिलाड़ियों दोनों को पछाड़ने में सक्षम होता है और मनुष्यों के विरुद्ध 67% जीत दर प्राप्त करता है।

Shahab Rahimirad, Guven Gergerli, Lucia Romero, Angela Qian, Matthew Lyle Olson, Simon Stepputtis, Joseph Campbell2026-04-13
💬 NLP

BEDTime: A Unified Benchmark for Automatically Describing Time Series

यह शोध पत्र BEDTime प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क है जिसमें पांच डेटासेट और तीन मोडैलिटीज शामिल हैं, जो यह मूल्यांकन करने के लिए है कि अत्याधुनिक मॉडल यूनिवेरिएट टाइम सीरीज़ (एकचर समय श्रृंखला) के विवरण को कितनी अच्छी तरह पहचानते, अंतर करते और उत्पन्न करते हैं, जिससे यह पता चलता है कि समर्पित टाइम-सीरीज-लैंग्वेज मॉडल विजन-लैंग्वेज मॉडल्स की तुलना में कम प्रदर्शन करते हैं जबकि सभी दृष्टिकोण वास्तविक दुनिया की मजबूती (रोबस्टनेस) के साथ संघर्ष करते हैं।

Medhasweta Sen, Zachary Gottesman, Jiaxing Qiu, C. Bayan Bruss, Nam Nguyen, Tom Hartvigsen2026-04-13
💬 NLP

Localizing Task Recognition and Task Learning in In-Context Learning via Attention Head Analysis

यह शोध पत्र टास्क सबस्पेस लॉजिट एट्रिब्यूशन (TSLA) फ्रेमवर्क को इन-कॉन्टेक्स्ट लर्निंग को विशिष्ट टास्क रिकग्निशन और टास्क लर्निंग घटकों में यांत्रिक रूप से स्थानीयकृत करने के लिए प्रस्तुत करता है, जो उन विशेष अटेंशन हेड्स की पहचान करता है जो हिडन स्टेट्स को क्रमशः टास्क सबस्पेस के साथ संरेखित करते हैं और उन्हें सही भविष्यवाणियों की ओर घुमाते हैं।

Haolin Yang, Hakaze Cho, Naoya Inoue2026-04-13
💬 NLP

Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight

यह शोध पत्र इन-कॉन्टेक्स्ट लर्निंग के लिए एक्सट्रैक्टेड टास्क वेक्टर्स के एक बेहतर, सीधे प्रशिक्षित विकल्प के रूप में लर्नड टास्क वेक्टर्स (LTVs) को प्रस्तुत करता है, जबकि यह इस बात की यांत्रिक अंतर्दृष्टि भी प्रदान करता है कि ये वेक्टर्स ट्रांसफॉर्मर मॉडल्स के भीतर विशिष्ट अटेंशन सर्किट्स और लीनियर प्रोपेगेशन पैटर्न के माध्यम से भविष्यवाणियों को कैसे निर्देशित करते हैं।

Haolin Yang, Hakaze Cho, Kaize Ding, Naoya Inoue2026-04-13